OpenAIは、最新モデル「GPT-5.6 Sol」のARC-AGI-3ベンチマークにおける低スコアが、モデルの能力不足ではなく評価環境の設計に起因していたと発表した。推論の保持とコンテキスト圧縮という二つの設定を有効にするだけで、スコアが3倍に跳ね上がった事実は、現在のAI評価指標が抱える構造的な脆弱性を浮き彫りにしている。

なぜベンチマークのスコアは「3倍」も跳ね上がったのか

OpenAIのGPT-5.6 Solは、当初ARC-AGI-3ベンチマークの公式ハーネスで7.8%という低スコアを記録し、困惑を招いた。しかし、同社独自のResponses APIで「Retained Reasoning(推論保持)」と「Compaction(圧縮)」の二つの設定を有効にしたところ、スコアは13.3%から38.3%へと約3倍に劇的に改善したとOpenAIは報告している。ExplainXの技術解説によれば、これはモデルの能力そのものよりも、評価環境の設計が結果に大きく影響することを示す決定的な証拠である。

評価環境がモデルの思考を阻害していた構造的欠陥とは何か

従来のARC-AGI-3ベンチマークの評価用ハーネスは、モデルが行動するたびに推論プロセスを破棄し、古いコンテキストを強制的に切り捨てる「ローリング・トランケーション」を行っていた。OpenAIの技術文書では、この設計がモデルの過去の思考や戦略維持を妨げ、複雑な課題に対する学習能力を著しく制限していたと指摘されている。推論保持と圧縮を適用することで、出力トークン数を6分の1に削減しつつ、性能を向上させることに成功したという。

開発者が直面する「環境設計力」という新たな勝負所

今回の発表は、エンタープライズ領域でAI導入を検討するインフラ運用担当者にとって重要な示唆を与える。ベンチマークスコアだけを見てモデルを選定するのではなく、APIの挙動やコンテキスト管理、推論の保持といった「周辺設定」が、実運用におけるAIの性能とコスト効率に決定的な影響を与えることが明らかになった。導入効果を最大化するには、モデルのパラメータ数以上に、これらの環境設計と最適化のスキルが不可欠となる。

ベンチマークの信頼性は今後どう再構築されるべきか

今回の件は、AIベンチマークの公平性と信頼性に対し、根本的な問いを投げかけている。The Decoderの分析によれば、単なる正解率の競争から、いかに効率的かつ持続的に思考を維持できるかという「アーキテクチャの質」を問うフェーズへ移行している。今後は、モデル固有のAPI機能やメモリ管理設定をどのように標準化された評価に取り込むか、あるいは実運用に近い設定を反映した新たな評価基準を構築できるかが、AI開発競争の焦点となるだろう。