Amazon Bedrock、AgentCore Evaluationsでフレームワーク非依存のエージェント評価を発表
AWSは、AgentCore EvaluationsがOpenTelemetry経由のトレースを用いてエージェント評価をフレームワークから切り離す仕組みを紹介しました。サービスはCloudWatchからスパンを取得し、invoke agent/inference/execute toolの3種類のスパン役割を読み取ってセッションを再構築し、同一の評価器で評価を行います。 対応はOpenTelemetryおよびOpenInferenceの命名規約を橋渡しする形で行われ、対応フレームワーク一覧やscope.nameの規約に従うことで追加フレームワークへの適用が可能です。
LEAD
リード
AWSは、AgentCore EvaluationsがOpenTelemetry経由のトレースを用いてエージェント評価をフレームワークから切り離す仕組みを紹介しました
サービスはCloudWatchからスパンを取得し、invoke agent/inference/execute toolの3種類のスパン役割を読み取ってセッションを再構築し、同一の評価器で評価を行います
対応はOpenTelemetryおよびOpenInferenceの命名規約を橋渡しする形で行われ、対応フレームワーク一覧やscope.nameの規約に従うことで追加フレームワークへの適用が可能です
ARTICLE
本文
AWSは、AgentCore EvaluationsがOpenTelemetry経由のトレースを用いてエージェント評価をフレームワークから切り離す仕組みを紹介しました。サービスはCloudWatchからスパンを取得し、invoke agent/inference/execute toolの3種類のスパン役割を読み取ってセッションを再構築し、同一の評価器で評価を行います。
対応はOpenTelemetryおよびOpenInferenceの命名規約を橋渡しする形で行われ、対応フレームワーク一覧やscope.nameの規約に従うことで追加フレームワークへの適用が可能です。
ORIGINAL
原文リンク
Related
関連記事
- 研究・技術
AWS、AgentCore EvaluationsとAWS DevOps Agentで本番エージェントのライフサイクル監視を解説
AWSはAgentCore EvaluationsとAWS DevOps Agentを組み合わせ、マルチエージェント本番システムで発生する「ツール呼び出しは成功するが目的を達成できない」や「IAM権限欠如で例外を出さない」などのサイレントな不具合を検出する監視設計を示しました。AgentCore Evaluationsはライブ対話を継続的にスコアリングし、ツール選択ミスやタスク失敗を検出して改善提案を生成します。一方、AWS DevOps AgentはAmazon CloudWatchのログやトレースを横断して障害を自律的に調査し、IAMやAmazon Bedrockなどサービス間の相関を特…
- 研究・技術
OpenAIが自動化研究インターン到達を発表
OpenAIは、深層学習とアライメントの進展を人間の監督下で支援する「自動化された研究インターン」を目標に据え、この目標を9月までに達成したと発表した。研究インターンは、技能ある研究者が数日で行うような明確に定義された研究タスクを人間の指示の下で実行できるシステムと説明している(出典:発表)。 同社は今年、研究者の日常業務にコーディングエージェントを広く導入し、コードの寄与や実験実行の増加、より複雑なタスクの成功率向上などの変化があったと報告している。また、安全性とアライメント作業を能力拡大と並行して強化し、重大な安全リスクが確認された場合は開発や展開を遅らせるか中止すると述べた(出典:sr…
- 研究・技術
OpenAI、サイバー評価に関する報告を公開
OpenAIがサイバー評価について公式に報告した。製品の一般提供開始ではなく、評価・検証の文脈で読む。
- モデル・製品
Amazon Bedrock上のOpenAIモデル比較:正答あたりコストなどベンチマーク結果を公開
AWSは同一のオープンソースベンチマークハーネスを用い、gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solの三構成とgpt-5.4-mini、gpt-5.4-nanoの二基線をResponses API経由で評価した。測定項目は単一呼び出しの正答コスト、エージェントのターンによる軌跡コスト、職業的成果物のルブリック採点で、出力は各実行のタイムスタンプ付きJSONから生成されている。 主な結果例として、AIMEではsolが75%の正答率でminiの37%を上回り、価格改定後の記録ではlunaのAIME正答あたりコストが0.0021ドル、miniは0.0139ドルと報告…
Editor's pick
注目ニュース(編集部選定)
直近7日 · 編集部選定
- 1Amazon Bedrock上のOpenAIモデル比較:正答あたりコストなどベンチマーク結果を公開AWSは同一のオープンソースベンチマークハーネスを用い、gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solの三構成とgpt-5.4-mini、gpt-5.4-nanoの二基線をResponses API経由で評価した。測定項目は単一呼び出しの正答コスト、エージェントのターンによる軌跡コスト、職業的成果物のルブリック採点で、出力は各実行のタイムスタンプ付きJSONから生成されている。 主な結果例として、AIMEではsolが75%の正答率でminiの37%を上回り、価格改定後の記録ではlunaのAIME正答あたりコストが0.0021ドル、miniは0.0139ドルと報告…
- 2Amazon Bedrock AgentCoreでMCP Appsの対話型HTMLウィジェットを提供開始AWSは、MCP AppsとAmazon Bedrock AgentCoreを組み合わせ、AIホスト内で直接レンダリングされる対話型HTMLウィジェットを備えたMCPサーバーの構築と展開手順を示した。AgentCore runtimeはサーバーレスでセッション分離されたホスティング環境を提供し、AgentCore Gatewayが単一のセキュアなエンドポイントを公開する構成を説明している。サンプルアプリ「Unicorn Rentals」を通じて、AIホストからのツール呼び出しでリスト表示や予約、返却などの操作を処理し、ウィジェットはMCPのリソースURIで配信される点を解説する。 記事はまた…
- 3Tailscale、AI Gateway上で顧客向けモデルルーターを構築したことを発表Tailscaleは自社のプライベートネットワーク「tailnet」をAIに拡張するApertureで、VercelのAI GatewayとSandboxを採用し、顧客向けにモデルアクセスとエージェント実行を提供する仕組みを作ったと説明しています。AI Gatewayは数百のモデルに対して単一APIとリクエストごとのコストや利用情報を返し、Sandboxはエージェントの隔離実行環境を担います。これにより、Apertureはネットワークの加入・除外で利用権を管理でき、ゼロデータ保持(ZDR)設定やper-requestのzeroDataRetentionフラグでZDR準拠プロバイダへのルーティ…
- 4GitHub、イベント運用をIssue起点で自動化する事例を紹介Tomoko氏は、単一のGitHub IssueとIssueフォーム、ラベル、GitHub Actionsを組み合わせることで、ランディングページ複製、UTM付きURL生成、招待メール草案の作成、プロジェクトボードへの追加など、従来数日かかっていたイベント準備を数分で行う仕組みを構築した。 毎朝の登録者スクリーニングはcronトリガーのワークフローで実行され、招待制イベントは基準に沿って待機者を精査する。DRY_RUNというリポジトリ変数で外部操作を行わずにリハーサルでき、/lead-uploadと/event-reportのスラッシュコマンドで事後のリスト整形やレポート作成を自動化している。
- 5AWS、AgentCore EvaluationsとAWS DevOps Agentで本番エージェントのライフサイクル監視を解説AWSはAgentCore EvaluationsとAWS DevOps Agentを組み合わせ、マルチエージェント本番システムで発生する「ツール呼び出しは成功するが目的を達成できない」や「IAM権限欠如で例外を出さない」などのサイレントな不具合を検出する監視設計を示しました。AgentCore Evaluationsはライブ対話を継続的にスコアリングし、ツール選択ミスやタスク失敗を検出して改善提案を生成します。一方、AWS DevOps AgentはAmazon CloudWatchのログやトレースを横断して障害を自律的に調査し、IAMやAmazon Bedrockなどサービス間の相関を特…
Latest
最新記事
- モデル・製品
Amazon Bedrock上のOpenAIモデル比較:正答あたりコストなどベンチマーク結果を公開
AWSは同一のオープンソースベンチマークハーネスを用い、gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solの三構成とgpt-5.4-mini、gpt-5.4-nanoの二基線をResponses API経由で評価した。測定項目は単一呼び出しの正答コスト、エージェントのターンによる軌跡コスト、職業的成果物のルブリック採点で、出力は各実行のタイムスタンプ付きJSONから生成されている。 主な結果例として、AIMEではsolが75%の正答率でminiの37%を上回り、価格改定後の記録ではlunaのAIME正答あたりコストが0.0021ドル、miniは0.0139ドルと報告…
- モデル・製品
Amazon Bedrock AgentCoreでMCP Appsの対話型HTMLウィジェットを提供開始
AWSは、MCP AppsとAmazon Bedrock AgentCoreを組み合わせ、AIホスト内で直接レンダリングされる対話型HTMLウィジェットを備えたMCPサーバーの構築と展開手順を示した。AgentCore runtimeはサーバーレスでセッション分離されたホスティング環境を提供し、AgentCore Gatewayが単一のセキュアなエンドポイントを公開する構成を説明している。サンプルアプリ「Unicorn Rentals」を通じて、AIホストからのツール呼び出しでリスト表示や予約、返却などの操作を処理し、ウィジェットはMCPのリソースURIで配信される点を解説する。 記事はまた…
- 企業導入・活用事例
Tailscale、AI Gateway上で顧客向けモデルルーターを構築したことを発表
Tailscaleは自社のプライベートネットワーク「tailnet」をAIに拡張するApertureで、VercelのAI GatewayとSandboxを採用し、顧客向けにモデルアクセスとエージェント実行を提供する仕組みを作ったと説明しています。AI Gatewayは数百のモデルに対して単一APIとリクエストごとのコストや利用情報を返し、Sandboxはエージェントの隔離実行環境を担います。これにより、Apertureはネットワークの加入・除外で利用権を管理でき、ゼロデータ保持(ZDR)設定やper-requestのzeroDataRetentionフラグでZDR準拠プロバイダへのルーティ…
- モデル・製品
GitHub、イベント運用をIssue起点で自動化する事例を紹介
Tomoko氏は、単一のGitHub IssueとIssueフォーム、ラベル、GitHub Actionsを組み合わせることで、ランディングページ複製、UTM付きURL生成、招待メール草案の作成、プロジェクトボードへの追加など、従来数日かかっていたイベント準備を数分で行う仕組みを構築した。 毎朝の登録者スクリーニングはcronトリガーのワークフローで実行され、招待制イベントは基準に沿って待機者を精査する。DRY_RUNというリポジトリ変数で外部操作を行わずにリハーサルでき、/lead-uploadと/event-reportのスラッシュコマンドで事後のリスト整形やレポート作成を自動化している。
- 研究・技術
AWS、AgentCore EvaluationsとAWS DevOps Agentで本番エージェントのライフサイクル監視を解説
AWSはAgentCore EvaluationsとAWS DevOps Agentを組み合わせ、マルチエージェント本番システムで発生する「ツール呼び出しは成功するが目的を達成できない」や「IAM権限欠如で例外を出さない」などのサイレントな不具合を検出する監視設計を示しました。AgentCore Evaluationsはライブ対話を継続的にスコアリングし、ツール選択ミスやタスク失敗を検出して改善提案を生成します。一方、AWS DevOps AgentはAmazon CloudWatchのログやトレースを横断して障害を自律的に調査し、IAMやAmazon Bedrockなどサービス間の相関を特…
Category
カテゴリ記事
- 研究・技術
AWS、AgentCore EvaluationsとAWS DevOps Agentで本番エージェントのライフサイクル監視を解説
AWSはAgentCore EvaluationsとAWS DevOps Agentを組み合わせ、マルチエージェント本番システムで発生する「ツール呼び出しは成功するが目的を達成できない」や「IAM権限欠如で例外を出さない」などのサイレントな不具合を検出する監視設計を示しました。AgentCore Evaluationsはライブ対話を継続的にスコアリングし、ツール選択ミスやタスク失敗を検出して改善提案を生成します。一方、AWS DevOps AgentはAmazon CloudWatchのログやトレースを横断して障害を自律的に調査し、IAMやAmazon Bedrockなどサービス間の相関を特…
- 研究・技術
OpenAIが自動化研究インターン到達を発表
OpenAIは、深層学習とアライメントの進展を人間の監督下で支援する「自動化された研究インターン」を目標に据え、この目標を9月までに達成したと発表した。研究インターンは、技能ある研究者が数日で行うような明確に定義された研究タスクを人間の指示の下で実行できるシステムと説明している(出典:発表)。 同社は今年、研究者の日常業務にコーディングエージェントを広く導入し、コードの寄与や実験実行の増加、より複雑なタスクの成功率向上などの変化があったと報告している。また、安全性とアライメント作業を能力拡大と並行して強化し、重大な安全リスクが確認された場合は開発や展開を遅らせるか中止すると述べた(出典:sr…
- 研究・技術
OpenAI、サイバー評価に関する報告を公開
OpenAIがサイバー評価について公式に報告した。製品の一般提供開始ではなく、評価・検証の文脈で読む。
Next
次に見るコンテンツ
Newsletter
THINKLABの最新情報を受け取る
AIニュース・ツール・ガイドの要点を、仕事で使える形でお届けする予定です。
メール登録機能は準備中です
現在はメールの受付・保存を行っていません。開始時は本欄とプライバシーポリシーを更新します。