Amazon Web Services(AWS)は、Amazon BedrockにおいてOpenAIの最新モデル「GPT-5.6」シリーズの提供を開始した。本モデルは「明示的プロンプトキャッシュ」機能を導入しており、長文コンテキストの処理効率化とAPIコストの劇的な最適化を狙う。
Amazon Bedrockで提供が開始されたGPT-5.6シリーズは、明示的プロンプトキャッシュ機能により、AIアプリケーションのコスト構造を根本から変える可能性を秘めている。AWSの技術ブログによれば、キャッシュされた入力トークンは通常価格から90%割引で請求されるため、システム指示や参照ドキュメントなど、頻繁に繰り返される長文コンテキストを多用するエージェント型ワークフローの経済性が飛躍的に向上する。ただし、キャッシュ書き込みには通常入力トークンの1.25倍のコストがかかる点には留意が必要である。
GPT-5.6シリーズは、最高性能の「Sol」、バランス型の「Terra」、高速処理に特化した「Luna」の3階層で構成されている。AWSの発表によれば、GPT-5.6 Solの入力トークンは100万あたり$5.00、出力トークンは100万あたり$30.00であり、キャッシュされた入力トークンは100万あたり$0.50、キャッシュ書き込みトークンは100万あたり$6.25で提供される。さらに、タスクの難易度に応じて計算リソースを最適化する「推論負荷(Reasoning Effort)」の動的調整機能が追加され、noneからxhighまで5段階で設定可能となった。これにより、レイテンシと精度のバランスを自律的に制御できる。
AWSがAmazon Bedrockを通じてGPT-5.6シリーズを単にホスティングするだけでなく、明示的プロンプトキャッシュのような独自機能を統合する背景には、企業向けAIプラットフォームとしての競争優位性を確立する狙いがある。AWSの堅牢なセキュリティやガバナンス、既存のAWSコミットメントへの計上といったメリットとOpenAIの最先端モデルを密結合させることで、他クラウドプロバイダーに対する差別化を図り、顧客の囲い込みを強化する戦略と見られる。
明示的プロンプトキャッシュの有効期間が30分に限定されている点は、AIアプリケーション開発者にとって重要な制約となる。これは、長期間にわたるユーザーセッションや、不定期なアクセスが発生するアプリケーションにおいては、キャッシュの再構築が必要になることを意味する。特に、エージェント型アプリケーションで複雑な対話状態を維持する場合、30分を超えるセッションではキャッシュの有効期限切れを考慮した再キャッシュ戦略や、状態管理の設計が不可欠となる。
今回のアップデートにより、次世代AIアプリケーションの運用コスト削減において、いかに効率的なキャッシュ設計を実装できるかが鍵となる。キャッシュ書き込みコストが通常入力の1.25倍、読み出しが90%割引という価格体系から、キャッシュの損益分岐点となるリクエスト頻度を正確に把握し、アプリケーションのアクセスパターンに合わせた戦略的なキャッシュ利用が求められる。開発者にとっては、モデルの性能向上を享受しつつ、コスト効率を最大化するキャッシュ戦略の最適化が、今後のAIアプリケーションの成否を分ける重要な焦点となる。