本文へ移動

重要なAIニュースを、速く、わかりやすく。

運営:AIMA

GLM-5.3公開 コーディング性能向上とAPI移行の注意点

GLM-5.3公開 コーディング性能向上とAPI移行の注意点
3行でわかる
  • Z.aiは、長い工程のコーディングとサイバー領域を強化したGLM-5.3を公開した
  • APIは思考モードが必須になり、旧設定のままモデル名だけ変えるとリクエストが失敗する
  • 企業は代表業務と安全な検証環境を決め、品質・時間・費用を既存モデルと並べて試したい

長いコーディング工程を、少ない出力で進めるモデルへ

中国のAI企業Z.aiは2026年8月14日、大規模言語モデルGLM-5.3を公開しました。基礎モデルはGLM-5.2と同じで、追加学習の段階を拡大した更新です。狙いは短いコード補完ではなく、調査、実装、検証をまたぐ長い仕事をAIへ任せやすくすることにあります。

公式発表によると、社内のZ.ai Code BenchではGLM-5.2より50%改善しました。公開ベンチマークでもTerminal-Bench 3.0が4.6から28.3、DeepSWE v1.1が46.2から66.9へ上がっています。ただし、社内評価はZ.ai自身の測定であり、すべての会社のコードや開発環境で同じ差が出る保証ではありません。

GLM-5.3はGLM-5.2と同じ基礎モデルを使い、性能向上は追加学習から得た。複雑なコーディングと長期タスクを大きく改善した。

出典:Z.ai「GLM-5.3: Frontier Coding with Emergent Cyber Capabilities」(原文を日本語で要約)

独立評価サイトArtificial Analysisでは、GLM-5.3 maxの総合知能指数は60で187モデル中9位、出力速度は毎秒90トークンでした。同サイトが観測した価格は入力100万トークン1.40ドル、出力4.40ドルです。提供元や契約で価格は変わるため、この数字は請求額ではなく比較の起点として使うのが安全でしょう。

モデル名の差し替えだけではAPIが動かない

導入時に最も見落としやすいのは、思考モードの変更です。GLM-5.3では思考を無効にできず、reasoning_effortをlow、high、maxから選びます。従来の設定でthinking.typeをdisabledにしたままモデルIDだけを変えると、公式発表はリクエストが失敗すると明記しています。

GLM-5.3へ移行する際、thinking.typeがdisabledならenabledへ変え、reasoning_effortをlowに設定する必要がある。変更しなければリクエストは失敗する。

出典:Z.ai・GLM-5.3 API変更(原文を日本語で要約)

これは性能だけを見て一斉に切り替えると、既存サービスを止める恐れがある変更です。まず検証環境でlowを使い、代表的な入力を流して応答形式と待ち時間を確認します。その後、難しい開発作業だけhighやmaxへ上げれば、すべての処理で長い推論を走らせる無駄を避けられます。

確認するものGLM-5.3の変更移行時の対応
思考モード無効化できないenabledへ変更
思考の深さlow・high・max代表業務ごとに選ぶ
モデル重み発表時点では未公開公開後にライセンスと運用条件を確認

サイバー能力の上昇は、便利さと管理責任を同時に増やす

GLM-5.3は脆弱性の発見だけでなく、複数段階の攻撃手順を組み立てる能力も伸びました。公式値ではCyberGymが77.2%から84.5%、ExploitBenchが24.4%から54.4%へ上昇しています。実際のオープンソースコードを対象にした取り組みでは、専門家の確認と重複除去を経て269プロジェクトで2,436件の脆弱性を追跡し、そのうち1,097件を中〜高重大度としています。

性能向上は防御側にとって朗報ですが、一般社員の端末で自由に攻撃検証させてよいという意味ではありません。編集部は、高性能モデルの競争が文章生成から、コード変更とセキュリティ判断を連続して実行する段階へ進んだとみます。企業で試すなら、本番資格情報を置かない隔離環境、対象リポジトリの許可、出力を確認する担当者、発見時の報告先を先に決める必要があります。

Z.aiはモデル重みを公開から2週間後に出す予定としていますが、安全評価と強化を終えてからの公開です。重みが実際に予定どおり提供され、商用利用条件と安全策が明確になれば、自社環境で動かしたい企業の選択肢は広がります。反対に公開が遅れる、または利用条件が厳しくなるなら、当面の価値はZ.aiのAPI上での利用に限られます。

自社の仕事で、品質・時間・費用を同じ表に置く

比較を始める前に、社内で頻度が高く、正解を判定できる作業を一つ選びます。たとえば既知の不具合修正、テスト追加、依存関係更新です。同じ指示、同じリポジトリ、同じ完了条件で現行モデルとGLM-5.3を走らせ、テスト通過率、人の修正時間、完了までの時間、入力と出力の費用を記録します。

ベンチマーク順位だけで選ぶと、長い出力やレビュー負担を見落とします。Artificial Analysisでは総合評価時の出力量が中央値より多いとされており、速さと単価が良くても総費用が必ず下がるとは限りません。品質が上がり、人の修正が減る仕事だけを残すのが現実的です。

今回の発表で企業が得るのは、別の万能モデルではなく、長い開発作業を比較できる新しい候補です。まずAPI設定を直し、隔離した環境で一つの仕事を測る。その結果が現行モデルを上回った範囲から広げれば、性能競争の数字を自社の利益へ変えられます。

※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。

AI検索・LLMO対策

月額5万円で、AIに引用される会社へ

AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。

SUPERVISOR
監修者 水間 雄紀

監修者:水間 雄紀

株式会社AIMA 代表取締役

1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。

監修者・運営会社について
← AI深報トップへ