OpenAIのGPT-6 AstraがAGIテストで99.9%を達成した真相と、GoogleのGemini 3.1 Proおよびemini 3.8 Flashとの性能差を比較してみました。主要ベンチマークの一次情報や公式発表をもとに、各モデルの特徴や実務における最適な選び方を解説します。
GPT-6 Astraとは?
OpenAIの新モデル「GPT-6 Astra」が発表され、AGIテストで99.9%を記録したというニュースが大きな話題を呼んでいます。一方で「GoogleのGeminiは取り残されてオワコン化したのか」と疑問を持つ方も多いのではないでしょうか。
結論からお伝えすると、99.9%という数値は特定の推論テストにおけるスコアであり、汎用人工知能(AGI)そのものが完成したわけではありません。また、GoogleのGeminiも独自の強みを発揮しており、決して劣勢に甘んじているわけではありません。
本記事では、公式発表やベンチマークの一次情報に基づいて各モデルの実態を客観的に比較し、実務で役立つ選び方を解説します。
GPT-6 Astraの「AGI 99%達成」報道の真相
メディアやSNSで拡散されている「GPT-6 AstraによるAGI 99%達成」という情報の根拠と、その実態を整理します。
ARC-AGI-3で99.9%を記録した背景
2026年9月3日にOpenAIが発表したGPT-6 Astraは、人間には簡単で従来のAIには難問とされてきた抽象的推論テスト「ARC-AGI-3」において99.9%という数値を記録しました。前モデルのGPT-5.6 Solが7.8%、競合であるAnthropicのClaude Opus 5が30.2%にとどまっていた中、この結果は業界に大きな衝撃を与えています。
詳細については、PC Watchの速報記事「AGI能力テストで99.9%、ChatGPTの新モデル『GPT-6 Astra』登場」にて仕様やAPI提供価格と併せて報じられています。
AGI到達率ではなく特定ベンチマークの正答率
注意が必要なのは、この99.9%という数値はあくまでARC-AGI-3という単一のパズル的推論テストの正答率を指している点です。
AGI(汎用人工知能)の定義や到達度を統一的に判定する国際的な合意規格は存在せず、特定テストの正答率をもって汎用的な知能が完成したと結論付けることはできません。ARC-AGIの詳細な設計や問題形式は、ARC Prize公式Webサイトにて公開されています。
Geminiは本当にオワコンなのか?Google陣営の現状
GPT-6 Astraの躍進により「Gemini 3.1 Proは時代遅れになったのではないか」という懸念も見られますが、Google陣営も実務に直結する独自の進化を続けています。
Gemini 3.1 Proが持つ大容量コンテキストの強み
Gemini 3.1 Proの最大の強みは、100万トークンを超える大容量コンテキストを安定して処理できる点にあります。
数十万行のソースコード、分厚い仕様書、長時間の動画データをそのままプロンプトに投入して網羅的に検索・分析するタスクにおいて、Gemini 3.1 Proの安定感は現在もトップクラスです。技術的な仕様やAPI提供形態の詳細は、Google AI for Developers公式ドキュメントで確認できます。
Gemini 3.8 Flashの推論性能とコストパフォーマンス
2026年9月に投入されたGemini 3.8 Flashは、高速性と低コストを両立したFlashシリーズの設計思想を継承しつつ、推論能力とコード生成性能を大幅に引き上げています。最新のアップデート情報やモデル性能については、Google公式ブログ(Google The Keyword)にてアナウンスされています。
主要AIモデルのベンチマーク徹底比較
各社のフラッグシップモデルおよび高速モデルの性能を、公開されている一次情報や報道資料に基づいて比較します。
性能スコア比較表
各ベンチマークテストにおける測定結果は以下の通りです。
| 評価指標 | 測定内容 | GPT-6 Astra | Gemini 3.1 Pro | Gemini 3.8 Flash | 競合モデル(参考) |
|---|---|---|---|---|---|
| ARC-AGI-3 | 抽象推論・汎用問題解決 | 99.9% | 未公表(ARC-AGI-2: 77.1%) | 未公表 | Claude Opus 5: 30.2% |
| Humanity’s Last Exam | 難関学術・ツール利用総合 | 57.2% | 51.4% | 54.9% | Claude Fable 5.1: 65.0% |
| Agents’ Last Exam | 金融・専門実務エージェント | 59.3% | 未公表 | 未公表 | Claude Opus 5: 55.5% |
| OSWorld 2.0(オフライン) | PC画面の自律操作成功率 | 72.6% | 未公表 | 未公表 | GPT-5.6 Sol: 65.7% |
| Terminal-Bench 2.1 | コマンドライン自律操作 | 未公表 | 未公表 | 89.4% | Claude Opus 5: 89.1% |
| 生成速度 | 出力スループット | 非公開 | 約100 tokens/sec | 約300 tokens/sec | – |
| 100万トークン利用料 | 入力 / 出力コスト(目安) | $10 / $50 | 標準価格帯 | 超低価格帯 | モデルごとに変動 |
実務における最適なモデルの選び方
モデル選定においては、単一のベンチマーク数値だけでなく、運用コスト、処理速度、取り扱うデータの性質を総合的に判断する必要があります。
目的別モデル選択の基準
実務でAIモデルを選定する際は、以下のステップに沿って判断します。
- PC操作や複雑な自律タスクの自動化を行いたい場合 画面を見ながら複数のソフトウェアを操作して作業を完結させる用途には、OSWorldで高い成功率を記録したGPT-6 Astraが最適です。ただしAPIコストが高額なため、重要な自動化プロセスに絞って運用します。
- 膨大な資料やマルチメディアの分析を行いたい場合 複数冊のマニュアルや大規模なソースコード群、長時間の録音データを一括処理したい場合は、大容量コンテキストを安定して処理できるGemini 3.1 Proを選択します。
- 日常のプログラミング支援や大規模なシステム連携を行いたい場合 日常的なコード生成、要約、高頻度なAPI通信を伴うWebアプリ開発には、圧倒的な速度と高い推論力を低コストで両立したGemini 3.8 Flashが最も経済的で効果的です。
関連コンテンツ


コメント