メインコンテンツまでスキップ

GPT-6 Astra レビュー:価格・機能・コミュニティの反応と Claude / Gemini 比較

· 約10分
Claude Dev
Claude Dev

OpenAI は、複雑な推論、ソフトウェア開発、コンピューター操作、調査、文書作成に対応する新しい旗艦モデル GPT-6 Astra を公開しました。単に「より賢い」だけではありません。Astra はコード、ブラウザー、業務ソフトをまたぐワークフローを実行し、結果を左右する不確実性がある場合には確認を求めるよう設計されています。

API では gpt-6-astra というモデル ID で利用できます。OpenAI によると、まず一部の組織への提供から始まり、ChatGPT Plus、Pro、Business、Enterprise、さらに Azure と Amazon Bedrock へ段階的に拡大しています。API Standard の価格は入力 100 万トークンあたり 10 ドル、出力 100 万トークンあたり 50 ドルです。キャッシュと Fast モードは別料金で、Fast は Standard の 2 倍です。

この価格は Claude Fable 5.1 と同じプレミアム帯ですが、Google Gemini 3.8 Flash はトークン単価が大幅に安いままです。初期コミュニティの反応は単純な比較を難しくしています。コーディングと調査能力は高く評価される一方、トークン消費、過剰な先回り、提供範囲の混乱、創作文章での弱さを指摘する声もあります。

実務上の結論は明快です。GPT-6 Astra は強力なエスカレーション用モデルであり、Claude や Gemini のすべての呼び出しを置き換えるモデルではありません。

OpenAI が公開したもの

OpenAI は GPT-6 Astra を、広く展開された中で最も高性能なモデルと説明しています。複数段階の推論、ツール呼び出し、検証、継続的なフォローアップが必要な仕事を主な対象にしています。

現在の API 仕様は次のとおりです。

  • モデル ID: gpt-6-astra
  • コンテキスト: 1,050,000 トークン
  • 最大出力: 128,000 トークン
  • 推論 effort: lowmediumhighxhighmax
  • 入力: テキスト、画像
  • 出力: テキスト
  • 知識カットオフ: 2026 年 4 月 30 日
  • エンドポイント: Responses、Chat Completions、Realtime、Batch など
  • 機能: computer use、構造化出力、streaming、プログラマブルな tool calling、prompt caching、永続化推論、compaction、マルチエージェント・オーケストレーション

モデルガイドには、エージェント向けの機能も記載されています。Astra は非同期ツールの実行中も推論を続け、WebSocket 経由でターン途中の指示を受け取り、キャッシュ済みのプロンプト接頭辞を維持したまま推論 effort を変更できます。

移行時は注意が必要です。ツール呼び出しには Responses API を使い、temperaturetop_ptop_logprobs などの非対応パラメーターを削除します。以前の noneminimal は、Astra の最低設定である low を基準に再評価してください。

GPT-6 Astra のベンチマーク:強力だが、注記を読むべき

OpenAI の発表資料では、computer use と業務タスクで高い結果が報告されています。

評価GPT-6 AstraGPT-5.6 SolClaude Opus 5注記
Agents’ Last Exam59.3%53.6%55.5%OpenAI 公開の比較
OSWorld 2.0 部分スコア72.6%65.7%70.2%OpenAI 指定のオフラインセット
BrowseComp91.5%90.4%90.8%調査・ブラウジング
AutomationBench41.4%18.1%26.9%業務オートメーション
BenchCAD95.9%83.3%82.1%CAD タスク

これらは有用なシグナルですが、GPT-6、Claude、Gemini を独立に比較した三者テストではありません。OpenAI の発表時比較に基づき、一部のモデルには数値がなく、エージェントのツール設定によってスコアは大きく変わります。この表には Gemini 3.8 Flash も含まれていません。

妥当な読み方は、Astra が computer use、ブラウジング、エンドツーエンドの業務タスクで特に強そうだ、ということです。すべての会話、コードベース、文章作成で最適だという意味ではありません。

GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash の比較

モデルコンテキスト最大出力入力 / 出力価格推論制御主な強み
GPT-6 Astra1.05M128K$10 / $50lowmaxエンドツーエンドのエージェント、computer use、coding
Claude Fable 5.11M128K$10 / $50Adaptive effort長時間推論、調査、難しいエンジニアリング
Gemini 3.8 Flash1M64K2026 年末まで $0.75 / $3.75low / medium / highマルチモーダル、Google grounding、速度、コスト

価格は 100 万トークン単位で、ツール、キャッシュ保存、検索・grounding、リトライ、人によるレビューは含みません。Gemini の導入価格は 2027 年 1 月 1 日に変更される予定です。

GPT-6 Astra と Claude Fable 5.1

価格と対象ユーザーが最も近い組み合わせです。どちらも約 100 万トークンのコンテキストと 128K の最大出力を持ち、高度な推論を対象にしています。

Astra はブラウザー制御、computer use、業務ソフト、非同期ツール、ターン途中の steering など、ワークフロー全体の広さが特徴です。リポジトリ、ブラウザー、文書エディター、外部ツールを横断するエージェントに向いています。

Fable 5.1 は Anthropic の長時間・高難度タスク向けエスカレーション層です。日常作業は Sonnet 5、複雑な開発は Opus 5、Opus でも解けない問題は Fable 5.1、という階層が Claude Code チームには分かりやすいでしょう。

GPT-6 Astra と Gemini 3.8 Flash

Gemini は価格と対応モダリティで大きく異なります。API はテキスト、画像、動画、音声、PDF を受け付け、Google Search grounding、Maps grounding、URL Context、File Search、Code Execution、Function Calling、preview 版 Computer Use を提供します。Astra の文書化された入力はテキストと画像ですが、出力は 128K で Gemini の 64K より大きく、xhighmax も利用できます。

大量抽出、マルチモーダル入力、下書き、単純なエージェント手順では Gemini が大幅に安くなります。移行、調査、computer use での失敗コストが高い場合は、Astra の価格差を正当化できる可能性があります。

受け入れ可能な成果 1 件あたりのコスト
= トークン + ツール呼び出し + grounding + リトライ + レビュー時間

GPT-6 Astra に対するコミュニティの反応

初期の反応は熱狂的ですが、意見は一致していません。

ポジティブ:コーディングと調査

複雑な coding や reverse engineering で巧みな判断をするという報告があります。GPT-5.6 Sol より明らかに高性能だというユーザーや、文書の完成、調査内容の確認、複数ツールを使うプロジェクトを評価するユーザーもいます。

ネガティブ:トークンと quota

最も多い不満は消費量です。Plus と Pro の一部ユーザーは、目に見える回答が出る前の推論だけで大量の quota を使うと報告しています。計画や検証が増えれば成果は改善するかもしれませんが、「1 回のリクエスト」はコスト単位として分かりにくくなります。

推論予算、チェックポイント、実装前の計画、日常的なサブタスクの安価なモデルへのルーティングが有効です。

混合:主体性とスコープ

Claude と Codex の両方を使う開発者は Astra の能力を認めつつ、新しいインフラを提案し、方向性が合意される前に実装を始めることを批判しました。高い知能が、そのまま良い協働体験になるわけではありません。プロンプト、workspace の指示、ツール設定が重要です。

創作文章は別に評価する

コーディングは高く評価しながら、創作では流れが悪い、拒否が多い、用意した writing workspace を独自解釈で上書きするという声もあります。frontier model という呼び名だけで万能とは判断できません。文体、継続性、制約遵守、編集の抑制、拒否動作を別々に試してください。

安全性とアクセスも製品の一部

OpenAI は、GPT-6 Astra が Preparedness Framework におけるサイバーセキュリティ能力の Critical レベルに達したと説明しています。有害なサイバー行為、prompt injection、許可範囲外の操作への保護と、ツール使用時の misalignment monitoring を強化したとしています。

アクセスはプラン、workspace 管理者、API アカウント、地域、ツール設定によって異なる場合があります。Enterprise 管理者は Astra を有効化できますが、公開開始時の Enterprise workspace ではデフォルトで無効です。コミュニティの画面ではなく、実際のモデル選択画面と API のモデル一覧で確認してください。

実務的なモデルルーティング

タスク最初に試すモデルエスカレーション / fallback
複雑な computer useGPT-6 Astra取り消せない操作には人の承認
大規模移行・根本原因のデバッグGPT-6 Astra または Fable 5.1受け入れたパッチと総コストを比較
日常の coding・テスト修正Sonnet 5 または Gemini 3.8 Flash失敗が続く、または範囲が曖昧なら Astra
文書・音声・動画・地図のマルチモーダル処理Gemini 3.8 Flash難しい統合は Claude または Astra
大量の抽出・分類Gemini 3.8 Flash low / medium品質重視のサンプルは Sonnet 5
長いコード・文書の生成GPT-6 Astra または Fable 5.1規約と事実を人が確認

小さな replay set から始め、モデル、推論設定、ツール呼び出し、レイテンシー、トークン数、人による最終判断を記録しましょう。受け入れ可能な成果の経済性が改善した場合だけルーティングを変更します。

結論:GPT-6 Astra は価値があるか

GPT-6 Astra は、コード、ブラウザー、文書、業務ソフトをまたいで動くエージェントにとって重要なアップデートです。100 万トークン級のコンテキスト、128K 出力、設定可能な推論、非同期ツール、ターン途中の steering により、単なる大きなチャットモデルではありません。

一方で価格はプレミアムで、深い推論は quota を急速に消費し、提供範囲にはまだ混乱があります。Claude Fable 5.1 と比べると、Astra は OpenAI ネイティブの computer use とエージェントに強く、Fable は長時間推論と Claude Code のエスカレーションで有力です。Gemini 3.8 Flash と比べると、Astra は出力容量と高性能エージェント機能で勝り、Gemini はトークン経済性と Google のマルチモーダル統合で勝ります。

多くのチームは Claude や Gemini をすぐに置き換える必要はありません。Astra を測定可能なエスカレーション先に置き、大量のマルチモーダル処理を Gemini に任せ、すでに効果を確認できている codebase-aware planning や長文成果物には Claude を使い続けるのが現実的です。

2026 年の競争単位は、発表資料で最も目立つモデルではなく、受け入れ可能で検証できる成果へ最小コストで到達する経路です。

参考資料