AI TOOL DATABASE v2
Langfuse
LLM・エージェントのtraceを観測し、prompt・dataset・evaluation・metricsまで同じ基盤で改善できるOSSのAIエンジニアリングプラットフォーム。
選定サマリー
30秒で向き不向きを確認
AI位置づけ
AIネイティブ(AIそのものが中核のサービス)
向いている
LLM・AIエージェントのobservabilityとevaluationを一体で運用したいチーム
向いていない
単発の生成AI利用だけで開発・監視基盤が不要なユーザー
料金
CloudはHobby無料、Core $29/月、Pro $199/月、Enterprise $2,499/月。OSSセルフホストも可能。
最大の強み
OSSでセルフホスト可能
注意点
Cloudはbase料金にusage課金が加わり大量traceでは費用管理が必要
THINKLAB判定
OSS/self-hostの自由度を残しながら、traceを見るだけで終わらずprompt・dataset・evaluationまで一つのAI改善基盤にまとめたいチームに強い選択肢です。
概要
LangfuseはLLMアプリケーションとAIエージェント向けのオープンソースAIエンジニアリング基盤です。
trace、session、user、token、costを追跡するObservabilityに加え、Prompt Management、datasetを使ったexperiment、LLM-as-a-judge、人手annotation、custom dashboardやalertを同じ製品で扱えます。
概要の続きを読む概要を閉じる
Python/JavaScript SDK、OpenTelemetry、API、LiteLLM経由のloggingなど複数の取り込み方法があり、Langfuse CloudのほかDocker Compose、Kubernetes、AWS/GCP/Azureでセルフホストできます。
主な機能
Observability
agent graph、chat/thread、user、token/costまで追跡し、本番の失敗や遅延をtraceから調査できます。
Online / offline evaluation
dataset experimentとproduction scoreを同じ基盤で管理し、変更前後の品質を比較できます。
Prompt lifecycle
prompt version、release、caching、Playground、experimentをつなぎ、prompt変更を評価可能な形で運用できます。
OpenTelemetry / API integrations
Python・JavaScript SDKだけでなくOpenTelemetry、LiteLLM、公開APIなどから既存スタックへ組み込めます。
Cloud or self-host
Langfuse Cloudに加えDocker Compose、Kubernetes、主要クラウド向けガイドで自社環境へ配置できます。
AI機能の詳細・制約はページ下部の「詳細情報」にまとめています
活用例
個人・一般
AIエージェントの本番監視
traceとagent graphを使い、model call・tool call・latency・cost・errorを調査する。
プロンプト・モデルの回帰評価
datasetへ新旧promptやmodelを実行し、custom scoreやLLM-as-a-judgeで比較する。
RAG品質改善
retrievalからgenerationまでのtraceと評価結果を結び付け、失敗例をdatasetへ戻して改善する。
業務・組織
生成AI品質の共通基盤
開発者、プロダクト担当、評価者が同じtrace・prompt・dataset・scoreを参照してリリース判断を標準化する。
自社管理LLMOps
セルフホストを選び、観測データを自社クラウド・Kubernetes環境で管理しながらLLMOpsを構築する。
料金
Langfuse CloudはHobby無料、Core $29/月、Pro $199/月、Enterprise $2,499/月。
Core以上は100k units/月を含み、追加usageは基本$8/100k unitsからvolumeに応じて低下します。
OSS版はセルフホスト可能です。
無料枠あり
Hobby
$0 / 月
50k units/月、30日data access、2 users。POCや個人開発向け。
Core
$29 / 月 + usage
100k units/月込み、追加は$8/100k unitsから。90日data access、unlimited users。
Pro
$199 / 月 + usage
100k units/月込み、3年data access、高rate limits、retention管理。Teams add-onは$300/月。
Enterprise
$2,499 / 月 + usage
Audit Logs、SCIM、custom rate limits、uptime/support SLA、専任support等。
公式 Pricing ページを開く料金確認:2026年8月26日
強み・弱み
強み
- OSSでセルフホスト可能
- Tracing・Prompt Management・Evaluation・Metricsを統合
- OpenTelemetryやSDK/APIなど取り込み手段が広い
- Cloudは無料Hobbyから始められる
- CloudでUS・EU・JPのデータregionを選択可能
弱み
- Cloudはbase料金にusage課金が加わり大量traceでは費用管理が必要
- セルフホストではClickHouse等を含むインフラ運用責任が利用者側に増える
- SSO・細粒度RBAC等の企業統制は上位プランやTeams add-onが必要
比較・競合
迷うときの比較軸
- Tracing
- Evaluation
- Prompt管理
- OpenTelemetry
- Self-host
- データregion
- 料金
- RBAC/SSO
Langfuse vs LangSmith
OSS/self-hostとvendor-neutralなobservability・prompt/eval基盤を重視するならLangfuse、LangChain/LangGraphとの統合やagent deploymentまで一体化したいならLangSmithを比較。
Langfuse vs Arize Phoenix
両者ともOSSのLLM observability/evaluation候補。Langfuseはprompt managementとCloud運用を含む統合製品として比較しやすいです。
Langfuse vs Helicone
LLM Gateway/Proxy経由の導入とAPI observabilityを素早く始めたい場合はHelicone、dataset・prompt・evaluationまで一体運用する場合はLangfuseを比較。
THINKLABの結論
選定サマリーの判定を、選び方として整理したものです。
選ぶべき場合
複数framework/modelを使うLLM・agentアプリを継続改善し、Cloudとセルフホストの選択肢、OpenTelemetry、prompt管理を重視する場合。
別製品を選ぶべき場合
LangChain/LangGraphのdeploymentまで一体で任せたい場合や、単純なAPIログだけを最小構成で収集したい場合は他候補も比較してください。
確信度: high
詳細情報
導入判断の本線から外した補足です。必要な項目だけ開いてください。
AI機能の詳細
LLM / Agent Tracing
trace、observation、session、user単位でLLM・tool・agent処理を記録し、token、cost、latency、errorを追跡します。
OpenTelemetryやSDK、APIから取り込めます。
制約
Cloudではプランごとにデータ参照期間、ingestion throughput、API rate limitが異なります。
Evaluation
datasetとexperimentを使ったoffline評価、本番traceへのscore、LLM-as-a-judge、外部evaluation pipeline、人手annotationを組み合わせます。
制約
自動評価はjudge modelや評価設計に依存するため、重要な品質基準では人手レビューとの併用が必要です。
Prompt Management
promptをversion管理し、release label、composability、server/client caching、Playground、experimentへ接続できます。
制約
本番promptの変更権限やdeployment label保護など一部の統制機能は上位プラン・add-on条件を確認する必要があります。
Langfuse Assistant
Langfuse内のデータを調査するin-app agentとして、traceやmetricsの分析を補助します。
制約
AIによる分析結果は運用判断前に元traceやmetricsで検証する必要があります。
向き不向き(一覧)
こんな人におすすめ
- LLM・AIエージェントのobservabilityとevaluationを一体で運用したいチーム
- OSS/self-hostの選択肢を重視する企業
- prompt・dataset・traceを同じ改善ループで管理したい開発者
おすすめしないケース
- 単発の生成AI利用だけで開発・監視基盤が不要なユーザー
- traceや評価設計を行う開発リソースがなく完成品のAIアプリだけを求めるケース
プラットフォーム / API
対応プラットフォーム
- Web
- Linux
API
あり · API / Docs
セキュリティ / データの扱い
CloudはUS・EU・JPのdata regionを提供し、Pro/EnterpriseではHIPAA-ready regionも案内されています。
SOC 2 Type II・ISO 27001 reports、GDPR DPA、client-side data masking等の企業向け機能があります。
取扱い: Cloudではtrace・prompt・evaluation dataを選択regionで処理します。セルフホストではDocker/KubernetesやAWS/GCP/Azureの自社環境へ配置でき、データ基盤の運用責任は利用者側になります。
学習・送信: LLM providerへ送るデータの学習条件は接続先モデルごとに別途確認してください。Langfuseへ送信する観測データについても最新Privacy/DPAを確認してください。