Skip to content

Instantly share code, notes, and snippets.

@gpsnmeajp
Last active April 24, 2026 04:13
Show Gist options
  • Select an option

  • Save gpsnmeajp/240f88ee4eea7e8b54cd3ed187f1556b to your computer and use it in GitHub Desktop.

Select an option

Save gpsnmeajp/240f88ee4eea7e8b54cd3ed187f1556b to your computer and use it in GitHub Desktop.

自作エージェントによるまとめ

最新フロンティアモデル比較レポート(2026年4月)

調査日: 2026-04-24
対象: GPT-5.5 / Claude Opus 4.7 / DeepSeek V4-Pro / Gemini 3.1 Pro
   + Qwen3.6-Max-Preview / Kimi K2.6 / GLM-5.1 (4/24追記)


1. 基本スペック一覧

西洋系フラッグシップ

項目 GPT-5.5 Claude Opus 4.7 DeepSeek V4-Pro Gemini 3.1 Pro
提供元 OpenAI Anthropic DeepSeek Google DeepMind
リリース 2026-04-23 2026-04-16 2026-04下旬 2026-02-19
アーキテクチャ 非公開 非公開 MoE (1.6T/49B activated) Dense (詳細非公開)
コンテキスト長 非公開 非公開 1M tokens 1M tokens
ライセンス プロプライエタリ プロプライエタリ MIT (OSSフルウェイト) プロプライエタリ
価格(API) 未公開(近日) $5/$25 per MTok $0.30/MTok 非公開
マルチモーダル ○(画像・computer use) ○(高解像度画像) △(テキスト中心) ○(テキスト・音声・画像・動画)

中華系フラッグシップ(2026年4月ラッシュ)

項目 Qwen3.6-Max-Preview Kimi K2.6 GLM-5.1
提供元 Alibaba (通义千问) Moonshot AI Z.ai (旧Zhipu AI)
リリース 2026-04-20 2026-04-20 2026-04-07
アーキテクチャ MoE (35B/3B activated) MoE (1T/32B activated) MoE (754B、詳細非公開)
コンテキスト長 260K tokens 256K tokens 未公開
ライセンス プロプライエタリ(初) Modified MIT (ウェイト公開) MIT (ウェイト公開)
価格(API) $1.30/$7.80 per MTok (preview) $0.95/$4.00 per MTok 非公開
マルチモーダル ○(テキスト・画像) ○(ネイティブマルチモーダル) ○(テキスト・画像)

2. ベンチマーク比較

西洋系モデル比較(GPT-5.5公式発表表)

ベンチマーク GPT-5.5 GPT-5.4 GPT-5.5 Pro Claude Opus 4.7 Gemini 3.1 Pro
Terminal-Bench 2.0 82.7% 75.1% 69.4% 68.5%
GDPval (wins/ties) 84.9% 83.0% 82.3% 80.3% 67.3%
OSWorld-Verified 78.7% 75.0% 78.0%
BrowseComp 84.4% 82.7% 90.1% 79.3% 85.9%
FrontierMath T1-3 51.7% 47.6% 52.4% 43.8% 36.9%
FrontierMath T4 35.4% 27.1% 39.6% 22.9% 16.7%
CyberGym 81.8% 79.0% 73.1%

DeepSeek V4-Pro-Max公式発表表(vs 競合)

ベンチマーク Opus 4.6 Max GPT-5.4 xHigh Gemini 3.1 Pro High Kimi K2.6 DS V4-Pro Max
GPQA Diamond 91.3% 93.0% 94.3% 90.5% 90.1%
LiveCodeBench 88.8% 91.7% 89.6% 93.5%
Codeforces Rating 3168 3052 3206
SWE Verified 80.8% 80.6% 80.2% 80.6%
BrowseComp 83.7% 82.7% 85.9% 83.2% 83.4%
Terminal Bench 2.0 65.4% 75.1% 68.5% 66.7% 67.9%
MRCR 1M (長文) 92.9% 76.3% 83.5%

Gemini 3.1 Pro公式発表表(2026-02時点)

ベンチマーク Gemini 3.1 Pro Gemini 3 Pro Opus 4.6 Max GPT-5.2 xHigh
Humanity's Last Exam 44.4% 37.5% 40.0% 34.5%
ARC-AGI-2 77.1% 31.1% 68.8% 52.9%

中華系フラッグシップ横断比較(4月)

ベンチマーク GLM-5.1 Kimi K2.6 Qwen3.6-Max-Preview DeepSeek V4-Pro
SWE-Bench Pro 58.4% 58.6% 57.3%
SWE-Bench Verified 80.2% 80.6%
Terminal-Bench 2.0 63.5% 66.7% 65.4% 67.9%
HLE-Full (w/tools) 54.0%
LiveCodeBench 89.6% 93.5%
Codeforces Rating 3206
CyberGym 68.7%
BrowseComp 68.0% 83.2% 83.4%

3. 分野別評価

コーディング・エージェント性能

モデル 強み 代表スコア
GPT-5.5 長時間自律実行・システム全体把握・computer use Terminal-Bench 82.7%, SWE Pro 58.6%
Claude Opus 4.7 精密な命令追従・自己検証・ループ耐性 CursorBench 70%, XBOW visual 98.5%
DeepSeek V4-Pro-Max コード競技性能トップ LiveCodeBench 93.5%, Codeforces 3206
Gemini 3.1 Pro 長文コードリポジトリ全体理解 BrowseComp 85.9%
Kimi K2.6 長時間エージェントチェーン・スウォーム SWE-Bench Pro 58.6%, HLE 54.0%
GLM-5.1 長時間自律実行(8時間ループ) SWE-Bench Pro 58.4%, CyberGym 68.7%
Qwen3.6-Max-Preview 小規模MoEで高コーディング性能 SWE-Bench Pro 57.3% (35B/3B activated)

推論・知識

モデル 強み 代表スコア
GPT-5.5 数学・FrontierMath FrontierMath T4: 35.4%
Claude Opus 4.7 法律・財務文書の精度 BigLaw Bench 90.9%
DeepSeek V4-Pro-Max 事実知識(SimpleQA等)・中国語 Chinese-SimpleQA 84.4%
Gemini 3.1 Pro 抽象推論・大学院レベル科学 ARC-AGI-2 77.1%, GPQA Diamond 94.3%
Kimi K2.6 多分野統合推論(HLEトップ) HLE-Full with tools: 54.0% (#1)

長文コンテキスト

モデル コンテキスト長 長文ベンチ
DeepSeek V4-Pro 1M tokens MRCR 1M: 83.5%(Gemini 76.3%を上回る)
Gemini 3.1 Pro 1M tokens MRCR 1M: 76.3%
Qwen3.6-Max-Preview 260K tokens Qwen3.6-Plusでは1M対応(Plus版)
Kimi K2.6 256K tokens
GPT-5.5 非公開
Claude Opus 4.7 非公開 Opus 4.6比で長文一貫性トップ(内部)

4. 各モデルの特記事項

GPT-5.5

  • アジェンティック作業の実用性が最高水準。Cursor・Codex等との統合前提。
  • GPT-5.4と同等のレイテンシを維持しながら性能向上。トークン効率も改善。
  • 85%以上のOpenAI社員が毎週Codexを業務利用(経理・広報・財務も含む)。
  • API提供は「近日」——現時点では未提供。

Claude Opus 4.7

  • サイバーセキュリティ能力の差別的削減を実施(Mythos Previewより意図的に抑制)。
  • 初の「リアルタイムサイバーセーフガード」実装モデル。悪用検知・自動ブロック付き。
  • visual-acuity(PCスクリーン読み取り)がOpus 4.6の98.5% vs 54.5%と劇的向上——computer use用途に大きく寄与。
  • 価格据え置き: $5/$25 per MTok。

DeepSeek V4-Pro

  • MITライセンスで完全公開(1.6T paramsのウェイト含む)。実質最強のOSSモデル。
  • アーキテクチャ革新: CSA+HCA(KVキャッシュをV3.2比10%まで削減)+ mHC + Muon optimizer。
  • Huawei Ascend 950PRで学習・動作。NVIDIAアクセスを意図的に遮断。
  • 3つの推論モード(Non-think / Think High / Think Max)で用途別チューニング可能。
  • V4-Flashは284B/13B activated——より軽量な選択肢として提供。
  • 推奨サンプリング: temp=1.0, top_p=1.0。Think Maxには384K以上のコンテキストを推奨。

Gemini 3.1 Pro

  • リリースは2026年2月——今回の「4月ラッシュ」の中では最も早い。
  • **ARC-AGI-2: 77.1%**は現時点で最高スコア(Gemini 3 Pro: 31.1%から大幅ジャンプ)。
  • ネイティブマルチモーダル(テキスト・音声・画像・動画の同時入力)。
  • ただし、GDPval(知識労働)では67.3%とGPT-5.5(84.9%)・Claude Opus 4.7(80.3%)に大きく劣る。
  • 出力は最大64Kトークンに制限。

Qwen3.6-Max-Preview(4/24追記)

  • Alibaba初のクローズドウェイトフラッグシップ。Qwen3.5までのOSS路線から転換。
  • 35B総パラメータ / 3B activated (MoE)——この規模でSWE-Bench Pro 57.3%は異例の効率。
  • 260Kコンテキスト。OpenAI + Anthropic API仕様と互換(Alibaba Cloud経由)。
  • preserve_thinking機能により、マルチターンエージェントワークフローで思考状態を保持。
  • 6ベンチマーク(SWE-Bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench, SciCode)でリリース時に#1を主張。

Kimi K2.6(4/24追記)

  • 1T params / 32B activated (MoE)。Modified MITライセンスでウェイト公開(Hugging Face / GitHub)。
  • HLE-Full with tools: 54.0%——これは4月時点で全モデル中トップ(GPT-5.4: 52.1, Opus 4.6: 53.0, Gemini 3.1 Pro: 51.4)。
  • SWE-Bench Pro: 58.6(GLM-5.1の58.4を上回り、Qwen3.6-Max-PreviewやGPT-5.4も凌駕)。
  • Agent Swarmアーキテクチャで最大300サブエージェント・4000ステップの同時並列実行。
  • ネイティブマルチモーダル対応。Cloudflare Workers AI経由でも提供。
  • Moonshot AI(北京)は中国最速成長のAI企業の一つ。256Kコンテキスト。

GLM-5.1(4/24追記)

  • Z.ai(旧Zhipu AI)。Tsinghua大学スピンオフ。2026年1月に香港IPO(世界初の上場基盤モデル企業)。
  • 754B MoE。MITライセンスでウェイト公開
  • 2026年4月7日リリース時点でSWE-Bench Pro 58.4%——GPT-5.4(57.7%)・Opus 4.6(57.3%)を上回り一時グローバル#1。後にKimi K2.6(58.6%)に抜かれる。
  • 8時間の自律実行を実証済み。「plan→execute→test→fix→optimize」ループを655イテレーション。
  • Terminal-Bench 2.0: 63.5%、CyberGym: 68.7%、BrowseComp: 68.0%。
  • DeepSeek V4-Proとともに「Huawei Ascendエコシステム」に注力するとされる。

5. 未公開モデル(参考)

  • Claude Mythos Preview: SWE-bench 93.9%, GPQA Diamond 94.6%。サイバーセキュリティリスクにより非公開。限定パートナー向けのみ(Project Glasswing)。Opus 4.7はMythosの「サイバー能力を意図的に抑えた版」という位置付け。

6. SWE-Bench Pro リーダーボード推移(4月)

時期 #1モデル スコア
4/7以前 GPT-5.4 57.7%
4/7 GLM-5.1 58.4%
4/20 Kimi K2.6 58.6%
4/20〜 Qwen3.6-Max-Preview, GPT-5.5など追撃

→ 4月の中国系3モデルが立て続けに「コーディング世界一」を更新するという展開。


7. 総評

用途 推奨モデル 理由
自律エージェント・長時間コーディング GPT-5.5 持続性・システム把握・computer use総合トップ
精密なエンタープライズ作業 Claude Opus 4.7 命令追従精度・自己検証・法律/財務文書
コード競技・OSS・コスト重視 DeepSeek V4-Pro LiveCodeBench/Codeforces #1・MIT・$0.30/MTok
抽象推論・科学・マルチモーダル Gemini 3.1 Pro ARC-AGI-2 #1・GPQA Diamond #1・音声/動画対応
エージェントスウォーム・OSS大規模 Kimi K2.6 HLE #1・SWE-Bench Pro #1・MIT 1T params
長時間自律・OSS中規模 GLM-5.1 8時間ループ実証・SWE-Bench Pro 58.4%・MIT
効率的コーディング(小型MoE) Qwen3.6-Max-Preview 3B activated でSWE-Bench Pro 57.3%・260K

4月の中国系モデルは「OSSで世界#1」という共通戦略をとっており、KimiとGLMはいずれも大規模MoEをMITで公開している。一方でQwenは初めてクローズドに転向した。DeepSeekは依然として価格対性能比でOSS最強($0.30/MTok・1M context・MITフルウェイト)。


参照ソース

西洋系モデル

中華系モデル

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment