THINKLAB

AI TOOL DATABASE v2

Arize Phoenix

OpenTelemetry/OpenInferenceでAIアプリをtraceし、失敗例をdataset・eval・experimentへ戻せるlocal-firstのオープンソースLLMOps基盤。

AIネイティブ分類 A開発ツール公式サイト

選定サマリー

30秒で向き不向きを確認

AI位置づけ

AIネイティブ(AIそのものが中核のサービス)

向いている

RAGやAIエージェントの内部挙動をOpenTelemetryで詳細に追跡したい開発チーム

向いていない

LLM APIのprovider routingやfailoverを主目的とする用途

料金

Phoenix OSSは無料でセルフホスト可能。マネージドのArize AXはFree $0、Pro $50/月、Enterpriseは個別見積もり。

最大の強み

Phoenix OSSを無料でlocal/self-host運用できる

注意点

高度な評価はdataset・evaluator・instrumentation設計の知識が必要

THINKLAB判定

RAGやagentの内部挙動を標準的なOpenTelemetryで深く観測し、そのtraceを評価・dataset・experimentへつなげたいチームには特に強いOSS候補です。

概要

Arize PhoenixはArize AIが開発するオープンソースのAI observability / evaluationプラットフォームです。

OpenTelemetryとOpenInferenceを使ってLLM、RAG、agent、tool call等をtraceし、token、latency、cost、retrieval document、agent trajectoryを可視化できます。

概要の続きを読む

traceにLLM-as-a-judgeやcode evaluator、人手annotationを付与し、問題例をdatasetへ保存してExperimentでprompt・model・agent変更を比較できます。

Phoenixはlocal-firstでセルフホストでき、より大規模なmanaged運用、online eval、monitoring、enterprise securityが必要な場合はArize AXへ移行できる構成です。

主な機能

OpenTelemetry-native observability

OTel互換で既存observability stackと合わせやすく、OpenInferenceによりAI固有のspan属性を標準化できます。

RAG debugging

retriever spanと取得documentを追跡し、retrieval relevance等をdocument/span単位で評価して検索と生成のどちらが原因か切り分けられます。

Agent trajectory analysis

multi-step agentのtool callや分岐をtraceとして追跡し、どのstepで失敗・遅延・cost増加が起きたかを調査できます。

Datasets and experiments

production traceを再利用可能なdatasetへ変換し、変更前後を同じtest setで比較する継続評価ループを構築できます。

Open source / self-host

Phoenixはlocal-first OSSとして自社環境へ配置でき、managed運用が必要になればArize AXを選択できます。

AI機能の詳細・制約はページ下部の「詳細情報」にまとめています

活用例

個人・一般

RAGの検索・回答品質デバッグ

query、retrieved documents、LLM responseをtraceし、relevanceやhallucination評価を付けて原因を特定する。

AIエージェントの可観測性

agentのmulti-step trajectory、tool call、latency、token/costを追跡し、失敗stepを分析する。

Prompt・model変更の実験

traceから作ったdatasetでExperimentを実行し、同じevaluatorを使って変更前後の品質を比較する。

業務・組織

本番AIの品質改善ループ

実ユーザーの失敗traceをdataset化し、次回リリース前の回帰評価へ再利用する。

OSSからenterprise運用への段階導入

Phoenixをローカル/セルフホストで検証し、必要に応じてArize AXのmanaged observability・online evalへ拡張する。

料金

Arize Phoenixはオープンソースで無料利用・セルフホストが可能です。

managedのArize AXはFreeが$0、Proが$50/月、Enterpriseは個別見積もり。

2026年8月時点でAX Freeは25k spans/月・1GB・15日保持、Proは50k spans/月・10GB・30日保持です。

無料枠あり

Phoenix OSS

$0

オープンソース/local-first。自社環境でのインフラ・運用コストは利用者側。

AX Free

$0

25k trace spans/月、1GB ingestion/月、15日retention、SaaS、users/evals unlimited。

AX Pro

$50 / 月

50k trace spans/月、10GB ingestion/月、30日retention、SaaS、users/evals unlimited。

AX Enterprise

要問い合わせ

Custom volume/retention、SaaSまたはself-hosted、enterprise SSO、audit logs等。

公式 Pricing ページを開く料金確認:2026年8月26日

強み・弱み

強み

  • Phoenix OSSを無料でlocal/self-host運用できる
  • OpenTelemetry/OpenInference中心でframework横断のinstrumentationを設計しやすい
  • RAGのdocument/spanレベル評価とagent traceに強い
  • Tracing・Datasets・Experiments・Promptを一つの改善ループにできる
  • Arize AXへmanaged/enterprise運用を拡張できる

弱み

  • 高度な評価はdataset・evaluator・instrumentation設計の知識が必要
  • Phoenix OSSとArize AXで機能境界があり、managed機能を含めた比較が必要
  • Gateway routingやprovider failover自体は主機能ではない

比較・競合

迷うときの比較軸

  • OpenTelemetry
  • Tracing
  • RAG評価
  • Agent observability
  • Datasets
  • Experiments
  • Self-host
  • 料金

Arize Phoenix vs Langfuse

両者ともOSS/self-hostのobservability・evalを提供。OpenTelemetry/OpenInferenceとRAG/agent debuggingを軸にするならPhoenix、prompt/metricsを含むLLMOps製品体験はLangfuseと比較。

Arize Phoenix vs Braintrust

Experiment・Scorer・CI/CDを中心に評価開発体験を重視するならBraintrust、OSS/local-firstとOTel-native tracingを重視するならPhoenixが候補。

Arize Phoenix vs LangSmith

LangChain/LangGraph ecosystemとdeploymentまで統合するならLangSmith、framework-neutralなOpenTelemetryとOSS self-hostを重視するならPhoenixを比較。

THINKLABの結論

選定サマリーの判定を、選び方として整理したものです。

選ぶべき場合

frameworkに縛られずOTel-nativeにAI observabilityを構築したい、またはまずlocal/self-hostで始めて将来managed運用へ拡張したい場合。

別製品を選ぶべき場合

必要なのがLLM providerのrouting/failover中心ならHeliconeやPortkey、評価CIの開発体験を最優先するならBraintrustも比較してください。

確信度: high

詳細情報

導入判断の本線から外した補足です。必要な項目だけ開いてください。

AI機能の詳細

OpenTelemetry / OpenInference Tracing

OpenTelemetry互換のtrace/spanとOpenInference semantic conventionsでLLM、retrieval、tool、agent等を記録し、処理経路とtoken・latency・costを分析します。

制約

frameworkごとの自動instrumentation範囲は異なり、独自処理ではmanual instrumentationが必要になる場合があります。

LLM / RAG Evaluations

LLM-as-a-judge、code evaluator、retrieval relevance、hallucination等の評価をtrace/span/documentやexperimentへ紐付け、品質問題を定量化します。

制約

judge modelのbias・variance・costがあるため、重要指標ではhuman annotationやdeterministic評価との校正が必要です。

Datasets / Experiments

traceや既存データからdatasetを作り、taskとevaluatorを実行してprompt・model・agent変更を同じ入力集合で比較します。

制約

評価品質はdatasetの代表性とground truth/evaluator設計に依存します。

Prompt Management

promptを保存・version管理し、playgroundやexperimentと接続して変更前後の挙動を比較します。

Arize AX managed evaluation

managed版AXではonline eval、monitoring、Signal等を含む運用機能を提供し、Phoenixで作った評価ワークフローを本番規模へ拡張できます。

制約

Phoenix OSSとAXでは提供機能・deployment・料金が異なるため導入時に境界を確認してください。

向き不向き(一覧)

こんな人におすすめ

  • RAGやAIエージェントの内部挙動をOpenTelemetryで詳細に追跡したい開発チーム
  • OSS/self-hostでLLM observabilityとevalを始めたい組織
  • production traceをdataset・experimentへ戻す継続評価を構築したいチーム

おすすめしないケース

  • LLM APIのprovider routingやfailoverを主目的とする用途
  • trace・dataset・evaluatorを設計する開発リソースがないケース
プラットフォーム / API

対応プラットフォーム

  • Web
  • Linux

API

あり · API / Docs

セキュリティ / データの扱い

Phoenix OSSは自社環境に配置でき、AX Enterpriseはself-hosted deploymentやenterprise SSO、audit logs等を提供します。

AXのdata regionはUS/EU/CAが案内されています。

取扱い: traceにはprompt、response、retrieved document、tool引数等の機密情報が入り得るため、送信項目、redaction、retention、RBAC、deployment方式を自社要件に合わせて設定してください。

学習・送信: Phoenix/Arize側のデータ条件と、evaluationで利用する外部LLM providerの学習・保持条件は分けて最新契約文書を確認してください。

情報源 / 最終確認日