AI TOOL DATABASE v2
Cloudflare Workers AI
Workers AIは、Cloudflareのグローバルネットワーク上でAI推論をserverlessに実行し、Workersアプリと近い場所で組み込めるサービスです。
選定サマリー
30秒で向き不向きを確認
AI位置づけ
AIネイティブ(AIそのものが中核のサービス)
向いている
Cloudflare Workers/Pagesを既に使う開発チーム
向いていない
特定GPU instanceを長時間専有して細かなruntime tuningを行いたい用途
料金
Free/Paid Workersで利用可能。1日10,000 Neuronsの無料枠があり、Paidでは超過分をモデル別従量課金。
最大の強み
serverless GPUでidle infrastructureを持たずに利用できる
注意点
model catalogとrate limitがCloudflare側の提供条件に依存する
THINKLAB判定
Workers AIは、Cloudflare上でWeb applicationを運用しているチームにとって特に自然なAI inference layerです。GPUを借りてmodel serverを管理するのではなく、Workersからserverless modelを呼び、必要ならVectorizeやAI Gatewayまで同じecosystemで組めます。一方、特定GPU・custom runtimeを徹底的に最適化する専用serving用途とは方向性が異なります。
概要
Cloudflare Workers AIは、Cloudflareが管理するserverless GPU上でAIモデルを実行する推論サービスです。
50以上のopen-sourceモデルを含むmodel catalogを提供し、LLM、embeddings、画像生成、音声認識・音声生成などをWorkers binding、REST API、OpenAI互換endpoint、AI Gateway経由で利用できます。
概要の続きを読む概要を閉じる
GPU instanceを予約・管理する方式ではなく、実際に使った推論量に応じて課金されます。
Cloudflare Workers、Vectorize、AI Gateway、Durable Objectsなどと組み合わせることで、Webアプリのlogic、RAG、推論、state管理、observabilityをCloudflare platform内で構成しやすい点が特徴です。
主な機能
Cloudflare global networkで推論
serverless GPU inferenceをCloudflare network上で実行し、Workers applicationと統合できます。
50+ open-source models
テキスト生成だけでなくembeddings、画像、音声など複数modalitiesのmodel catalogを利用できます。
GPU管理不要
GPU VMの予約やautoscaling clusterを直接管理せず、pay-for-what-you-use型で推論できます。
AI Gateway
logging、analytics、caching、rate control、security、複数provider accessを推論trafficの前段に置けます。
Cloudflare AI stack
Workers、Vectorize、Durable Objects等と組み合わせてRAGやstateful AI applicationを同一ecosystemで構築できます。
OpenAI-compatible access
対応するOpenAI互換endpointを利用し、既存のchat-completions型integrationから移行しやすい経路があります。
AI機能の詳細・制約はページ下部の「詳細情報」にまとめています
活用例
個人・一般
WebアプリへのLLM組み込み
Cloudflare WorkersからLLMを呼び出し、chat、要約、分類、生成機能を提供する。
RAG
Workers AI embeddingsとVectorize等を組み合わせ、検索結果を使う生成AI applicationを構築する。
画像・音声AI
画像生成、speech-to-text、text-to-speech等をserverless inferenceとしてapplicationへ追加する。
Edge寄りのAI API
Cloudflare上のfrontend/backend logicとAI inferenceを近いplatformで運用し、architectureを簡素化する。
業務・組織
既存CloudflareサービスへのAI追加
Workers/Pagesを利用する企業が新たなGPU基盤を構築せずAI機能を追加する。
AI gateway統合運用
Workers AIと外部providerのtraffic、cost、loggingをAI Gatewayで一元管理する。
低運用負荷のAIプロトタイプ
GPU capacity planningを持たずに複数modelを比較し、production候補を検証する。
料金
Workers AIはFreeとPaid Workers planで利用でき、1アカウントあたり1日10,000 Neuronsの無料allocationがあります。
Paidでは無料枠超過分が$0.011 / 1,000 Neuronsで課金され、公式Pricingにはmodelごとのtoken・image・audio単位の換算価格も掲載されています。
一部resource-intensive/frontier modelはPaid billing methodまたはAI Gateway creditsが必要です。
無料枠あり
Workers Free
10,000 Neurons/日まで無料
無料allocation内で対応modelを利用。上限超過後はPaidへのupgradeが必要。
Workers Paid + Workers AI
$0.011 / 1,000 Neurons(無料allocation超過分)
1日10,000 Neuronsのallocationを含み、超過利用をmodel別換算で従量課金。Workers Paid自体の最低料金等はWorkers pricingを確認。
AI Gateway Unified Billing
prepaid credits + 購入時5% fee
Workers AIや対応外部providerをAI Gateway creditsで支払い、統一billingとcontrol layerを利用。
公式 Pricing ページを開く料金確認:2026年8月27日
強み・弱み
強み
- serverless GPUでidle infrastructureを持たずに利用できる
- WorkersとAI inferenceの統合が簡潔
- 複数modalitiesのmodel catalogを利用できる
- AI Gateway・Vectorize等Cloudflare AI stackとの連携が強い
弱み
- model catalogとrate limitがCloudflare側の提供条件に依存する
- 一部高負荷modelはPaid plan等が必要
- 専用GPU serving基盤ほどhardware/runtimeを細かく制御できない
比較・競合
迷うときの比較軸
- model catalog
- serverless GPU
- 料金
- 無料枠
- latency
- Workers統合
- AI Gateway
- embeddings
- 画像・音声
- rate limits
Cloudflare Workers AI vs DeepInfra
DeepInfraもopen modelを従量課金APIで提供。Workers AIはCloudflare Workers、AI Gateway、Vectorizeなどedge/application platformとの統合が大きな特徴です。
Cloudflare Workers AI vs Baseten
Basetenはcustom model deploymentやdedicated infrastructureを含むproduction servingに強い一方、Workers AIはcatalog modelをserverlessに呼ぶ用途から始めやすい構成です。
Cloudflare Workers AI vs Amazon Bedrock
BedrockはAWS上で複数foundation modelと企業向けAI機能を提供。Workers AIはCloudflare networkとWorkers runtimeに近いserverless inferenceが中心です。
Cloudflare Workers AI vs Vercel AI Gateway
Vercel AI Gatewayは複数providerへのrouting/control layerが中心。Workers AIはCloudflare自身がhostするAI inferenceも提供し、AI Gatewayと組み合わせられます。
THINKLABの結論
選定サマリーの判定を、選び方として整理したものです。
選ぶべき場合
Cloudflare Workers/Pagesを中心にWeb applicationを構築しており、LLM・embedding・画像・音声などをGPU運用なしで追加したい場合。
別製品を選ぶべき場合
専用GPUを予約してcustom model serverや低レベルruntimeを細かく制御することが主要要件の場合。
確信度: high
詳細情報
導入判断の本線から外した補足です。必要な項目だけ開いてください。
AI機能の詳細
Serverless GPU inference
Cloudflareが管理するGPU infrastructure上でmodel inferenceを実行し、利用者はGPU serverのprovisioningやidle capacityを管理せずにrequest単位で利用できます。
制約
利用可能model、rate limit、capacityはmodelやplanによって異なり、一部frontier modelはPaid planまたはAI Gateway creditsが必要です。
Workers AI model catalog
LLM、embeddings、image、audio、classification等の複数modelを@cf/で始まるmodel IDから選択して実行します。
制約
catalogとmodel availabilityは更新が速いため、本番採用時はmodel pageとchangelogの継続確認が必要です。
Workers binding / REST API
WorkersではAI bindingからenv.AI.run()を利用でき、Cloudflare外のapplicationからはREST APIでも推論を呼び出せます。
制約
認証、request format、streaming、model固有parameterは利用するinterfaceとmodel仕様に合わせる必要があります。
AI Gateway integration
AI Gatewayをcontrol layerとしてWorkers AI requestのanalytics、logging、caching、security、billingをまとめ、外部AI providerも同じgatewayで扱えます。
制約
Unified Billingで購入するprepaid creditsには手数料があり、外部provider利用条件は各providerにも依存します。
向き不向き(一覧)
こんな人におすすめ
- Cloudflare Workers/Pagesを既に使う開発チーム
- GPU infrastructureを管理せずAI推論を組み込みたい開発者
- LLM・embeddings・画像・音声を一つのplatformで試したいチーム
- AI GatewayやVectorizeと組み合わせたAI applicationを構築したい組織
おすすめしないケース
- 特定GPU instanceを長時間専有して細かなruntime tuningを行いたい用途
- Cloudflare ecosystemを使わず専用model serverを完全管理したいチーム
プラットフォーム / API
対応プラットフォーム
- Web
API
あり
セキュリティ / データの扱い
Workers AIを含むCloudflare AI applicationではAPI token、Workers bindings、AI Gateway security controlsなどを使ってaccessを設計します。
企業利用ではCloudflareのsecurity/privacy文書と利用するmodel/providerの条件を確認してください。
取扱い: Workers AIとAI Gatewayのlogging設定、application側の保存処理、外部provider routingの有無によってdata flowが変わるため、機密データでは各componentの保持・logging設定を確認する必要があります。
学習・送信: Workers AI上の各modelと外部provider経由では条件が異なる可能性があるため、model/providerおよびCloudflareの最新data usage termsを個別に確認してください。