AI TOOL DATABASE v2
Arize Phoenix
OpenTelemetry/OpenInferenceでAIアプリをtraceし、失敗例をdataset・eval・experimentへ戻せるlocal-firstのオープンソースLLMOps基盤。
選定サマリー
30秒で向き不向きを確認
AI位置づけ
AIネイティブ(AIそのものが中核のサービス)
向いている
RAGやAIエージェントの内部挙動をOpenTelemetryで詳細に追跡したい開発チーム
向いていない
LLM APIのprovider routingやfailoverを主目的とする用途
料金
Phoenix OSSは無料でセルフホスト可能。マネージドのArize AXはFree $0、Pro $50/月、Enterpriseは個別見積もり。
最大の強み
Phoenix OSSを無料でlocal/self-host運用できる
注意点
高度な評価はdataset・evaluator・instrumentation設計の知識が必要
THINKLAB判定
RAGやagentの内部挙動を標準的なOpenTelemetryで深く観測し、そのtraceを評価・dataset・experimentへつなげたいチームには特に強いOSS候補です。
概要
Arize PhoenixはArize AIが開発するオープンソースのAI observability / evaluationプラットフォームです。
OpenTelemetryとOpenInferenceを使ってLLM、RAG、agent、tool call等をtraceし、token、latency、cost、retrieval document、agent trajectoryを可視化できます。
概要の続きを読む概要を閉じる
traceにLLM-as-a-judgeやcode evaluator、人手annotationを付与し、問題例をdatasetへ保存してExperimentでprompt・model・agent変更を比較できます。
Phoenixはlocal-firstでセルフホストでき、より大規模なmanaged運用、online eval、monitoring、enterprise securityが必要な場合はArize AXへ移行できる構成です。
主な機能
OpenTelemetry-native observability
OTel互換で既存observability stackと合わせやすく、OpenInferenceによりAI固有のspan属性を標準化できます。
RAG debugging
retriever spanと取得documentを追跡し、retrieval relevance等をdocument/span単位で評価して検索と生成のどちらが原因か切り分けられます。
Agent trajectory analysis
multi-step agentのtool callや分岐をtraceとして追跡し、どのstepで失敗・遅延・cost増加が起きたかを調査できます。
Datasets and experiments
production traceを再利用可能なdatasetへ変換し、変更前後を同じtest setで比較する継続評価ループを構築できます。
Open source / self-host
Phoenixはlocal-first OSSとして自社環境へ配置でき、managed運用が必要になればArize AXを選択できます。
AI機能の詳細・制約はページ下部の「詳細情報」にまとめています
活用例
個人・一般
RAGの検索・回答品質デバッグ
query、retrieved documents、LLM responseをtraceし、relevanceやhallucination評価を付けて原因を特定する。
AIエージェントの可観測性
agentのmulti-step trajectory、tool call、latency、token/costを追跡し、失敗stepを分析する。
Prompt・model変更の実験
traceから作ったdatasetでExperimentを実行し、同じevaluatorを使って変更前後の品質を比較する。
業務・組織
本番AIの品質改善ループ
実ユーザーの失敗traceをdataset化し、次回リリース前の回帰評価へ再利用する。
OSSからenterprise運用への段階導入
Phoenixをローカル/セルフホストで検証し、必要に応じてArize AXのmanaged observability・online evalへ拡張する。
料金
Arize Phoenixはオープンソースで無料利用・セルフホストが可能です。
managedのArize AXはFreeが$0、Proが$50/月、Enterpriseは個別見積もり。
2026年8月時点でAX Freeは25k spans/月・1GB・15日保持、Proは50k spans/月・10GB・30日保持です。
無料枠あり
Phoenix OSS
$0
オープンソース/local-first。自社環境でのインフラ・運用コストは利用者側。
AX Free
$0
25k trace spans/月、1GB ingestion/月、15日retention、SaaS、users/evals unlimited。
AX Pro
$50 / 月
50k trace spans/月、10GB ingestion/月、30日retention、SaaS、users/evals unlimited。
AX Enterprise
要問い合わせ
Custom volume/retention、SaaSまたはself-hosted、enterprise SSO、audit logs等。
公式 Pricing ページを開く料金確認:2026年8月26日
強み・弱み
強み
- Phoenix OSSを無料でlocal/self-host運用できる
- OpenTelemetry/OpenInference中心でframework横断のinstrumentationを設計しやすい
- RAGのdocument/spanレベル評価とagent traceに強い
- Tracing・Datasets・Experiments・Promptを一つの改善ループにできる
- Arize AXへmanaged/enterprise運用を拡張できる
弱み
- 高度な評価はdataset・evaluator・instrumentation設計の知識が必要
- Phoenix OSSとArize AXで機能境界があり、managed機能を含めた比較が必要
- Gateway routingやprovider failover自体は主機能ではない
比較・競合
迷うときの比較軸
- OpenTelemetry
- Tracing
- RAG評価
- Agent observability
- Datasets
- Experiments
- Self-host
- 料金
Arize Phoenix vs Langfuse
両者ともOSS/self-hostのobservability・evalを提供。OpenTelemetry/OpenInferenceとRAG/agent debuggingを軸にするならPhoenix、prompt/metricsを含むLLMOps製品体験はLangfuseと比較。
Arize Phoenix vs Braintrust
Experiment・Scorer・CI/CDを中心に評価開発体験を重視するならBraintrust、OSS/local-firstとOTel-native tracingを重視するならPhoenixが候補。
Arize Phoenix vs LangSmith
LangChain/LangGraph ecosystemとdeploymentまで統合するならLangSmith、framework-neutralなOpenTelemetryとOSS self-hostを重視するならPhoenixを比較。
THINKLABの結論
選定サマリーの判定を、選び方として整理したものです。
選ぶべき場合
frameworkに縛られずOTel-nativeにAI observabilityを構築したい、またはまずlocal/self-hostで始めて将来managed運用へ拡張したい場合。
別製品を選ぶべき場合
必要なのがLLM providerのrouting/failover中心ならHeliconeやPortkey、評価CIの開発体験を最優先するならBraintrustも比較してください。
確信度: high
詳細情報
導入判断の本線から外した補足です。必要な項目だけ開いてください。
AI機能の詳細
OpenTelemetry / OpenInference Tracing
OpenTelemetry互換のtrace/spanとOpenInference semantic conventionsでLLM、retrieval、tool、agent等を記録し、処理経路とtoken・latency・costを分析します。
制約
frameworkごとの自動instrumentation範囲は異なり、独自処理ではmanual instrumentationが必要になる場合があります。
LLM / RAG Evaluations
LLM-as-a-judge、code evaluator、retrieval relevance、hallucination等の評価をtrace/span/documentやexperimentへ紐付け、品質問題を定量化します。
制約
judge modelのbias・variance・costがあるため、重要指標ではhuman annotationやdeterministic評価との校正が必要です。
Datasets / Experiments
traceや既存データからdatasetを作り、taskとevaluatorを実行してprompt・model・agent変更を同じ入力集合で比較します。
制約
評価品質はdatasetの代表性とground truth/evaluator設計に依存します。
Prompt Management
promptを保存・version管理し、playgroundやexperimentと接続して変更前後の挙動を比較します。
Arize AX managed evaluation
managed版AXではonline eval、monitoring、Signal等を含む運用機能を提供し、Phoenixで作った評価ワークフローを本番規模へ拡張できます。
制約
Phoenix OSSとAXでは提供機能・deployment・料金が異なるため導入時に境界を確認してください。
向き不向き(一覧)
こんな人におすすめ
- RAGやAIエージェントの内部挙動をOpenTelemetryで詳細に追跡したい開発チーム
- OSS/self-hostでLLM observabilityとevalを始めたい組織
- production traceをdataset・experimentへ戻す継続評価を構築したいチーム
おすすめしないケース
- LLM APIのprovider routingやfailoverを主目的とする用途
- trace・dataset・evaluatorを設計する開発リソースがないケース
プラットフォーム / API
対応プラットフォーム
- Web
- Linux
API
あり · API / Docs
セキュリティ / データの扱い
Phoenix OSSは自社環境に配置でき、AX Enterpriseはself-hosted deploymentやenterprise SSO、audit logs等を提供します。
AXのdata regionはUS/EU/CAが案内されています。
取扱い: traceにはprompt、response、retrieved document、tool引数等の機密情報が入り得るため、送信項目、redaction、retention、RBAC、deployment方式を自社要件に合わせて設定してください。
学習・送信: Phoenix/Arize側のデータ条件と、evaluationで利用する外部LLM providerの学習・保持条件は分けて最新契約文書を確認してください。