THINKLAB
NEWSモデル・製品企業公式ブログ

Amazon Bedrock上のOpenAIモデル比較:正答あたりコストなどベンチマーク結果を公開

AWSは同一のオープンソースベンチマークハーネスを用い、gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solの三構成とgpt-5.4-mini、gpt-5.4-nanoの二基線をResponses API経由で評価した。測定項目は単一呼び出しの正答コスト、エージェントのターンによる軌跡コスト、職業的成果物のルブリック採点で、出力は各実行のタイムスタンプ付きJSONから生成されている。 主な結果例として、AIMEではsolが75%の正答率でminiの37%を上回り、価格改定後の記録ではlunaのAIME正答あたりコストが0.0021ドル、miniは0.0139ドルと報告…

LEAD

リード

AWSは同一のオープンソースベンチマークハーネスを用い、gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solの三構成とgpt-5.4-mini、gpt-5.4-nanoの二基線をResponses API経由で評価した

測定項目は単一呼び出しの正答コスト、エージェントのターンによる軌跡コスト、職業的成果物のルブリック採点で、出力は各実行のタイムスタンプ付きJSONから生成されている

主な結果例として、AIMEではsolが75%の正答率でminiの37%を上回り、価格改定後の記録ではlunaのAIME正答あたりコストが0.0021ドル、miniは0.0139ドルと報告…

ARTICLE

本文

AWSは同一のオープンソースベンチマークハーネスを用い、gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solの三構成とgpt-5.4-mini、gpt-5.4-nanoの二基線をResponses API経由で評価した。測定項目は単一呼び出しの正答コスト、エージェントのターンによる軌跡コスト、職業的成果物のルブリック採点で、出力は各実行のタイムスタンプ付きJSONから生成されている。

主な結果例として、AIMEではsolが75%の正答率でminiの37%を上回り、価格改定後の記録ではlunaのAIME正答あたりコストが0.0021ドル、miniは0.0139ドルと報告されている。エージェント課題ではminiは平均7.6ターンを要し、質問ごとの入力トークン量がterraの2.3倍に達した試料があり、DeepSearchQAの合格あたりコストはterraが0.31ドル、miniが0.40ドル、lunaが0.05ドルと記録された。GDPvalではlunaの合格率が56%でminiの42%を上回り、合格あたりコストはlunaが0.010ドル、miniが0.030ドル、nanoが0.012ドルと示されている。

ORIGINAL

原文リンク

AWS Machine Learning Blog

公式発表を見る(外部リンク) →

参照日 2026年9月12日

Next

次に見るコンテンツ

Newsletter

THINKLABの最新情報を受け取る

AIニュース・ツール・ガイドの要点を、仕事で使える形でお届けする予定です。

メール登録機能は準備中です

現在はメールの受付・保存を行っていません。開始時は本欄とプライバシーポリシーを更新します。