自作エージェントによるまとめ
最新フロンティアモデル比較レポート(2026年4月)
調査日: 2026-04-24
対象: GPT-5.5 / Claude Opus 4.7 / DeepSeek V4-Pro / Gemini 3.1 Pro
+ Qwen3.6-Max-Preview / Kimi K2.6 / GLM-5.1 (4/24追記)
項目
GPT-5.5
Claude Opus 4.7
DeepSeek V4-Pro
Gemini 3.1 Pro
提供元
OpenAI
Anthropic
DeepSeek
Google DeepMind
リリース
2026-04-23
2026-04-16
2026-04下旬
2026-02-19
アーキテクチャ
非公開
非公開
MoE (1.6T/49B activated)
Dense (詳細非公開)
コンテキスト長
非公開
非公開
1M tokens
1M tokens
ライセンス
プロプライエタリ
プロプライエタリ
MIT (OSSフルウェイト)
プロプライエタリ
価格(API)
未公開(近日)
$5/$25 per MTok
$0.30/MTok
非公開
マルチモーダル
○(画像・computer use)
○(高解像度画像)
△(テキスト中心)
○(テキスト・音声・画像・動画)
項目
Qwen3.6-Max-Preview
Kimi K2.6
GLM-5.1
提供元
Alibaba (通义千问)
Moonshot AI
Z.ai (旧Zhipu AI)
リリース
2026-04-20
2026-04-20
2026-04-07
アーキテクチャ
MoE (35B/3B activated)
MoE (1T/32B activated)
MoE (754B、詳細非公開)
コンテキスト長
260K tokens
256K tokens
未公開
ライセンス
プロプライエタリ(初)
Modified MIT (ウェイト公開)
MIT (ウェイト公開)
価格(API)
$1.30/$7.80 per MTok (preview)
$0.95/$4.00 per MTok
非公開
マルチモーダル
○(テキスト・画像)
○(ネイティブマルチモーダル)
○(テキスト・画像)
ベンチマーク
GPT-5.5
GPT-5.4
GPT-5.5 Pro
Claude Opus 4.7
Gemini 3.1 Pro
Terminal-Bench 2.0
82.7%
75.1%
—
69.4%
68.5%
GDPval (wins/ties)
84.9%
83.0%
82.3%
80.3%
67.3%
OSWorld-Verified
78.7%
75.0%
—
78.0%
—
BrowseComp
84.4%
82.7%
90.1%
79.3%
85.9%
FrontierMath T1-3
51.7%
47.6%
52.4%
43.8%
36.9%
FrontierMath T4
35.4%
27.1%
39.6%
22.9%
16.7%
CyberGym
81.8%
79.0%
—
73.1%
—
DeepSeek V4-Pro-Max公式発表表(vs 競合)
ベンチマーク
Opus 4.6 Max
GPT-5.4 xHigh
Gemini 3.1 Pro High
Kimi K2.6
DS V4-Pro Max
GPQA Diamond
91.3%
93.0%
94.3%
90.5%
90.1%
LiveCodeBench
88.8%
—
91.7%
89.6%
93.5%
Codeforces Rating
—
3168
3052
—
3206
SWE Verified
80.8%
—
80.6%
80.2%
80.6%
BrowseComp
83.7%
82.7%
85.9%
83.2%
83.4%
Terminal Bench 2.0
65.4%
75.1%
68.5%
66.7%
67.9%
MRCR 1M (長文)
92.9%
—
76.3%
—
83.5%
Gemini 3.1 Pro公式発表表(2026-02時点)
ベンチマーク
Gemini 3.1 Pro
Gemini 3 Pro
Opus 4.6 Max
GPT-5.2 xHigh
Humanity's Last Exam
44.4%
37.5%
40.0%
34.5%
ARC-AGI-2
77.1%
31.1%
68.8%
52.9%
ベンチマーク
GLM-5.1
Kimi K2.6
Qwen3.6-Max-Preview
DeepSeek V4-Pro
SWE-Bench Pro
58.4%
58.6%
57.3%
—
SWE-Bench Verified
—
80.2%
—
80.6%
Terminal-Bench 2.0
63.5%
66.7%
65.4%
67.9%
HLE-Full (w/tools)
—
54.0%
—
—
LiveCodeBench
—
89.6%
—
93.5%
Codeforces Rating
—
—
—
3206
CyberGym
68.7%
—
—
—
BrowseComp
68.0%
83.2%
—
83.4%
モデル
強み
代表スコア
GPT-5.5
長時間自律実行・システム全体把握・computer use
Terminal-Bench 82.7%, SWE Pro 58.6%
Claude Opus 4.7
精密な命令追従・自己検証・ループ耐性
CursorBench 70%, XBOW visual 98.5%
DeepSeek V4-Pro-Max
コード競技性能トップ
LiveCodeBench 93.5%, Codeforces 3206
Gemini 3.1 Pro
長文コードリポジトリ全体理解
BrowseComp 85.9%
Kimi K2.6
長時間エージェントチェーン・スウォーム
SWE-Bench Pro 58.6%, HLE 54.0%
GLM-5.1
長時間自律実行(8時間ループ)
SWE-Bench Pro 58.4%, CyberGym 68.7%
Qwen3.6-Max-Preview
小規模MoEで高コーディング性能
SWE-Bench Pro 57.3% (35B/3B activated)
モデル
強み
代表スコア
GPT-5.5
数学・FrontierMath
FrontierMath T4: 35.4%
Claude Opus 4.7
法律・財務文書の精度
BigLaw Bench 90.9%
DeepSeek V4-Pro-Max
事実知識(SimpleQA等)・中国語
Chinese-SimpleQA 84.4%
Gemini 3.1 Pro
抽象推論・大学院レベル科学
ARC-AGI-2 77.1%, GPQA Diamond 94.3%
Kimi K2.6
多分野統合推論(HLEトップ)
HLE-Full with tools: 54.0% (#1)
モデル
コンテキスト長
長文ベンチ
DeepSeek V4-Pro
1M tokens
MRCR 1M: 83.5%(Gemini 76.3%を上回る)
Gemini 3.1 Pro
1M tokens
MRCR 1M: 76.3%
Qwen3.6-Max-Preview
260K tokens
Qwen3.6-Plusでは1M対応(Plus版)
Kimi K2.6
256K tokens
—
GPT-5.5
非公開
—
Claude Opus 4.7
非公開
Opus 4.6比で長文一貫性トップ(内部)
アジェンティック作業の実用性が最高水準 。Cursor・Codex等との統合前提。
GPT-5.4と同等のレイテンシを維持しながら性能向上。トークン効率も改善。
85%以上のOpenAI社員が毎週Codexを業務利用(経理・広報・財務も含む)。
API提供は「近日」——現時点では未提供。
サイバーセキュリティ能力の差別的削減 を実施(Mythos Previewより意図的に抑制)。
初の「リアルタイムサイバーセーフガード」実装モデル。悪用検知・自動ブロック付き。
visual-acuity(PCスクリーン読み取り)がOpus 4.6の98.5% vs 54.5%と劇的向上——computer use用途に大きく寄与。
価格据え置き: $5/$25 per MTok。
MITライセンスで完全公開 (1.6T paramsのウェイト含む)。実質最強のOSSモデル。
アーキテクチャ革新: CSA+HCA(KVキャッシュをV3.2比10%まで削減)+ mHC + Muon optimizer。
Huawei Ascend 950PR で学習・動作。NVIDIAアクセスを意図的に遮断。
3つの推論モード(Non-think / Think High / Think Max)で用途別チューニング可能。
V4-Flashは284B/13B activated——より軽量な選択肢として提供。
推奨サンプリング: temp=1.0, top_p=1.0。Think Maxには384K以上のコンテキストを推奨。
リリースは2026年2月——今回の「4月ラッシュ」の中では最も早い。
**ARC-AGI-2: 77.1%**は現時点で最高スコア(Gemini 3 Pro: 31.1%から大幅ジャンプ)。
ネイティブマルチモーダル(テキスト・音声・画像・動画の同時入力)。
ただし、GDPval(知識労働)では67.3%とGPT-5.5(84.9%)・Claude Opus 4.7(80.3%)に大きく劣る。
出力は最大64Kトークンに制限。
Qwen3.6-Max-Preview(4/24追記)
Alibaba初のクローズドウェイトフラッグシップ 。Qwen3.5までのOSS路線から転換。
35B総パラメータ / 3B activated (MoE)——この規模でSWE-Bench Pro 57.3%は異例の効率。
260Kコンテキスト。OpenAI + Anthropic API仕様と互換(Alibaba Cloud経由)。
preserve_thinking機能により、マルチターンエージェントワークフローで思考状態を保持。
6ベンチマーク(SWE-Bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench, SciCode)でリリース時に#1を主張。
1T params / 32B activated (MoE)。Modified MITライセンスでウェイト公開 (Hugging Face / GitHub)。
HLE-Full with tools: 54.0% ——これは4月時点で全モデル中トップ(GPT-5.4: 52.1, Opus 4.6: 53.0, Gemini 3.1 Pro: 51.4)。
SWE-Bench Pro: 58.6(GLM-5.1の58.4を上回り、Qwen3.6-Max-PreviewやGPT-5.4も凌駕)。
Agent Swarm アーキテクチャで最大300サブエージェント・4000ステップの同時並列実行。
ネイティブマルチモーダル対応。Cloudflare Workers AI経由でも提供。
Moonshot AI(北京)は中国最速成長のAI企業の一つ。256Kコンテキスト。
Z.ai(旧Zhipu AI) 。Tsinghua大学スピンオフ。2026年1月に香港IPO(世界初の上場基盤モデル企業)。
754B MoE。MITライセンスでウェイト公開 。
2026年4月7日リリース時点でSWE-Bench Pro 58.4%——GPT-5.4(57.7%)・Opus 4.6(57.3%)を上回り一時グローバル#1。後にKimi K2.6(58.6%)に抜かれる。
8時間の自律実行 を実証済み。「plan→execute→test→fix→optimize」ループを655イテレーション。
Terminal-Bench 2.0: 63.5%、CyberGym: 68.7%、BrowseComp: 68.0%。
DeepSeek V4-Proとともに「Huawei Ascendエコシステム」に注力するとされる。
Claude Mythos Preview : SWE-bench 93.9%, GPQA Diamond 94.6%。サイバーセキュリティリスクにより非公開。限定パートナー向けのみ(Project Glasswing)。Opus 4.7はMythosの「サイバー能力を意図的に抑えた版」という位置付け。
6. SWE-Bench Pro リーダーボード推移(4月)
時期
#1モデル
スコア
4/7以前
GPT-5.4
57.7%
4/7
GLM-5.1
58.4%
4/20
Kimi K2.6
58.6%
4/20〜
Qwen3.6-Max-Preview, GPT-5.5など追撃
—
→ 4月の中国系3モデルが立て続けに「コーディング世界一」を更新するという展開。
用途
推奨モデル
理由
自律エージェント・長時間コーディング
GPT-5.5
持続性・システム把握・computer use総合トップ
精密なエンタープライズ作業
Claude Opus 4.7
命令追従精度・自己検証・法律/財務文書
コード競技・OSS・コスト重視
DeepSeek V4-Pro
LiveCodeBench/Codeforces #1・MIT・$0.30/MTok
抽象推論・科学・マルチモーダル
Gemini 3.1 Pro
ARC-AGI-2 #1・GPQA Diamond #1・音声/動画対応
エージェントスウォーム・OSS大規模
Kimi K2.6
HLE #1・SWE-Bench Pro #1・MIT 1T params
長時間自律・OSS中規模
GLM-5.1
8時間ループ実証・SWE-Bench Pro 58.4%・MIT
効率的コーディング(小型MoE)
Qwen3.6-Max-Preview
3B activated でSWE-Bench Pro 57.3%・260K
4月の中国系モデルは「OSSで世界#1」という共通戦略 をとっており、KimiとGLMはいずれも大規模MoEをMITで公開している。一方でQwenは初めてクローズドに転向した。DeepSeekは依然として価格対性能比でOSS最強($0.30/MTok・1M context・MITフルウェイト)。