Nếu bạn đang chạy AI workloads trên Cloudflare, bạn đã phải quản lý hai sản phẩm riêng biệt: Workers AI cho inference trên GPU infrastructure của Cloudflare, và AI Gateway để proxy requests đến external providers như Anthropic, OpenAI, và Gemini. Từ ngày 7 tháng 8 năm 2026, hai sản phẩm này đã trở thành một.

Việc hợp nhất không chỉ mang tính tổ chức — API surface, billing model, và observability stack đã merge thành một control plane duy nhất. Đây là những gì thay đổi và ý nghĩa thực tế.

Những Gì Đã Thay Đổi

Trước: Bạn có hai đường cho AI trong Cloudflare Workers:

// Đường 1: Workers AI (models hosted bởi Cloudflare)
const response = await env.AI.run('@cf/meta/llama-3.3-70b-instruct', {
  messages: [{ role: 'user', content: prompt }]
});

// Đường 2: AI Gateway (external providers, qua proxy URL)
const response = await fetch('https://gateway.ai.cloudflare.com/v1/.../openai/chat/completions', {
  method: 'POST',
  headers: { 'Authorization': `Bearer ${OPENAI_KEY}` },
  body: JSON.stringify({ model: 'gpt-4o', messages: [{ role: 'user', content: prompt }] })
});

Sau: Một binding xử lý cả hai:

// Thống nhất: env.AI.run() cho cả Cloudflare-hosted và external models
const cfModel = await env.AI.run('@cf/meta/llama-3.3-70b-instruct', {
  messages: [{ role: 'user', content: prompt }]
});

const externalModel = await env.AI.run('@anthropic/claude-opus-5', {
  messages: [{ role: 'user', content: prompt }]
});

// Cùng call signature, cùng observability, cùng billing

Prefix @cf/ route đến GPU fleet của Cloudflare. Các prefix khác route qua AI Gateway đến provider tương ứng. Từ góc nhìn của Worker, đây là cùng một call.

Những Gì Bạn Nhận Được Từ Việc Hợp Nhất

Billing duy nhất. Prepaid AI Gateway credits giờ trả cho cả Workers AI inference. Trước đây bạn quản lý hai cost center riêng với billing cadence khác nhau. Với teams xây dựng multi-model pipelines kết hợp open-source models của Cloudflare với commercial APIs, điều này đơn giản hóa financial management đáng kể.

Observability thống nhất. Logs, latency metrics, error rates, và cost tracking giờ đều chảy qua một dashboard duy nhất cho tất cả models bất kể chúng hosted ở đâu. Nếu bạn đang debug slow response trong pipeline gọi llama-3.3 rồi claude-opus-5, bạn thấy cả hai trong cùng một trace.

Access controls nhất quán. Security policies, rate limiting, và access logging áp dụng đồng đều. Trước đây Workers AI và AI Gateway có configuration surface riêng biệt cho các concerns tương tự.

Dynamic routing across tất cả models. Routing capabilities của AI Gateway — vốn đã hỗ trợ load balancing, fallback, và A/B testing giữa các providers — giờ mở rộng đến Workers AI models. Bạn có thể cấu hình routing rules fall back từ commercial model sang Cloudflare-hosted model khi latency vượt ngưỡng hoặc khi external provider trả về errors.

Ý Nghĩa Với Quyết Định Infrastructure

Việc hợp nhất thay đổi phép tính cho một số quyết định phổ biến:

Open-source vs. commercial model routing

Trước khi merge, kết hợp Cloudflare-hosted open-source models với commercial APIs đòi hỏi quản lý hai hệ thống billing và monitoring riêng. Friction đủ lớn để nhiều team default về một trong hai. Giờ bạn có thể xây genuinely cost-optimized routing:

// Route theo task complexity với unified cost tracking
async function callModel(task: Task, env: Env) {
  if (task.complexity === 'low') {
    // Cloudflare-hosted Llama: nhanh, rẻ, không cần external API calls
    return env.AI.run('@cf/meta/llama-3.3-70b-instruct', {
      messages: task.messages
    });
  } else {
    // Commercial model cho complex tasks
    return env.AI.run('@anthropic/claude-opus-5', {
      messages: task.messages
    });
  }
}

Cả hai calls giờ đều observable từ cùng dashboard, billable từ cùng credits pool, và configurable từ cùng security policies.

Latency-first architectures

Cloudflare Workers chạy ở edge — cùng infrastructure phục vụ hàng tỷ HTTP requests mỗi ngày. Workers AI models chạy trên GPU hardware co-located với edge network đó. Với latency-sensitive applications, routing simple inference tasks đến Workers AI-hosted models tránh round-trip đến centralized API endpoint.

Gateway thống nhất giúp dễ dàng hơn để đo và hành động dựa trên sự khác biệt latency đó. Bạn có thể chạy A/B tests so sánh Cloudflare-hosted inference vs. provider-hosted inference trực tiếp trong gateway configuration mà không cần thay đổi application code.

Cost predictability

Credits-based billing cho hệ thống thống nhất cho teams kiểm soát tốt hơn AI spend. Thay vì monthly bills biến động từ nhiều providers, teams có thể pre-purchase credits và track consumption trên toàn bộ model portfolio từ một nơi. Với các tổ chức có finance constraints về AI spend, tính predictability này rất có giá trị.

Những Đánh Đổi

Đây không phải free lunch.

Model selection trên Workers AI vẫn bị giới hạn. Cloudflare host một tập curated open-source models — các llama variants, Mistral, Gemma, và specialized models cho embeddings và image tasks. Nếu bạn cần GPT-5.6 Sol mới nhất hay Claude Opus 5 full capability, vẫn route đến external provider.

Hệ thống thống nhất vẫn là Cloudflare-specific. Nếu bạn multi-cloud hoặc cần chạy cùng AI pipeline trong AWS hay GCP, bạn cần abstract ở application layer, không phải infrastructure layer. Việc hợp nhất là cải thiện quality-of-life cho teams đã committed với Cloudflare, không phải lý do để chuyển sang Cloudflare.

Vendor coupling. Dùng env.AI.run() cho cả Cloudflare-hosted và external models giúp dễ swap models, nhưng lock pattern vào Cloudflare’s runtime. Đây là đánh đổi giống bất kỳ platform-native API nào.

Bước Tiếp Theo Thực Tế Cho Teams Đang Dùng Cloudflare

Nếu bạn đang chạy Workers AI hoặc AI Gateway riêng biệt:

  1. Audit usage hiện tại. List các models bạn gọi qua Workers AI vs. AI Gateway, và observability hiện tại cho mỗi loại.

  2. Consolidate về unified binding. Migration path đơn giản — thay thế AI Gateway proxy calls bằng env.AI.run() calls cho external models. Cloudflare changelog có migration steps chi tiết.

  3. Implement routing rules. Giờ cả hai model types đều observable từ một nơi, hãy identify workloads nơi routing đến Cloudflare-hosted open-source models sẽ giảm cost mà không ảnh hưởng chất lượng đáng kể. Chạy A/B test từ gateway layer.

  4. Consolidate credits. Nếu bạn có AI Gateway và Workers AI budgets riêng, migrate về unified credits pool để đơn giản hóa tracking.

Trend Lớn Hơn

Việc hợp nhất của Cloudflare là một phần của pattern trên các cloud providers: AI infrastructure đang consolidate từ “AI như một feature trên existing services” sang “AI như một first-class primitive với control plane thống nhất”. AWS có Bedrock, Google có Vertex AI, Azure có AI Studio. Entry của Cloudflare vào không gian này được differentiated bởi edge deployment model và tích hợp với existing Workers runtime.

Với teams đã deep trong Cloudflare Workers ecosystem, AI control plane thống nhất là cải thiện quality-of-life có nghĩa giúp giảm barrier cho việc xây multi-model, cost-optimized AI pipelines. Với teams đang đánh giá nơi chạy AI workloads, nó làm Cloudflare trở thành option đầy đủ hơn cho latency-sensitive edge AI use cases.


Thuận Lương là Tech Lead với hơn 15 năm kinh nghiệm .NET, kiến trúc cloud và hệ thống AI. Anh viết về những bài học thực tế từ việc xây dựng production systems.

Xuất nội dung

Bình luận