Vấn Đề Thực Sự Bạn Đang Giải Quyết
Bạn giao cho AI agent một task. Agent quyết định viết và chạy code để giải quyết nó. Code đó không đáng tin — nó được tạo bởi một LLM, có thể bị manipulate qua prompt injection, và bạn không biết nó sẽ làm gì khi chạy. Nó có thể spawn subprocesses, gọi outbound network calls, đọc files không được phép, hay đơn giản là loop vô tận và đốt hết compute budget của bạn.
Giải pháp đơn giản nhất là containers. Vấn đề: containers chia sẻ host kernel. Một kernel exploit trong generated code thoát ra khỏi container. Đây không phải giả thuyết — kernel CVEs là chuyện thường xuyên, và agent code là adversarial surface theo thiết kế.
Bạn cần hardware hoặc software isolation làm cho việc thoát ra trở nên impossible hoặc cực kỳ tốn kém. Đó là những gì bốn sandbox architecture này đang cố gắng cung cấp, theo những cách rất khác nhau.
Điều gì đó đã thay đổi vào giữa 2026: cả 4 cloud provider lớn đều ra mắt agent code sandbox capabilities trong cùng một quý. Sự hội tụ đó là tín hiệu — ngành đã đồng ý rằng AI agents thực thi arbitrary code không còn là mối quan tâm tương lai mà là thực tế production hiện tại.
Bốn Architecture, Bốn Trade-Off Profile
AWS: Firecracker MicroVMs
Firecracker là infrastructure đằng sau Lambda và Fargate, nhưng agent sandbox của AWS expose nó trực tiếp. Mỗi sandbox session có microVM riêng — một VMM stripped-down với minimal device model, không có legacy hardware emulation, boot trong dưới 150ms. Bạn có được genuine VM-level isolation: guest kernel hoàn toàn tách biệt với host.
Tính năng nổi bật là suspend-resume. Một session có thể chạy lên đến 8 giờ, pause, và resume với state nguyên vẹn. Với long-running agentic workflows — iterative data analysis, multi-step code generation pipelines — đây là điều quan trọng. Pricing theo millisecond compute thực tế, giữ chi phí honest trên bursty workloads.
Trade-off: cold start của fresh microVM là có thật. Nếu bạn cần sub-100ms first-response latency cho interactive agents, bạn phải tự quản lý warm pool.
Google Cloud: gVisor trên Cloud Run
gVisor là userspace kernel viết bằng Go. Nó intercept syscalls từ sandboxed process và xử lý chúng trong userspace thay vì pass xuống host kernel. Điều này có nghĩa là attack surface là gVisor runtime, không phải Linux kernel — nhỏ hơn đáng kể.
Implementation của Google là một flag trên Cloud Run: --sandbox=gvisor. Sự đơn giản vận hành là điểm bán hàng. Existing Cloud Run workloads có thể opt vào sandbox mode mà không cần rearchitect. Cold starts nhanh vì bạn không boot VM, bạn chỉ start process dưới một syscall interceptor khác.
Trade-off: gVisor là kernel-level isolation, không phải VM-level. Nó mạnh nhưng hẹp hơn Firecracker. Một số syscalls và kernel features không được support, có thể break một số workloads. Nếu agent của bạn chạy arbitrary Linux software, bạn sẽ gặp vấn đề compatibility.
Azure: Hyper-V Isolation
Cách tiếp cận của Azure là Hyper-V hypervisor-based isolation — cùng công nghệ đằng sau Windows Sandbox và confidential compute offerings. Con số headline từ announcement của họ: 400,000 sessions mỗi ngày phục vụ Copilot enterprise workloads. Đó là use case họ đã tối ưu cho: high-volume, enterprise SLA, compliance-friendly.
Hyper-V isolation đã mature. Nó có formal security certifications, audit trails, và integration với Azure Policy và Defender. Với các tổ chức có yêu cầu FedRAMP, SOC 2, hay HIPAA, điều này quan trọng hơn cold start latency.
Trade-off: đây là option nặng nhất. Cold starts tính bằng giây. Đây không phải tool đúng cho real-time interactive agent responses.
Cloudflare: Workers + Durable Objects (V8 Isolates)
Cloudflare chạy V8 isolates — cùng isolation unit như một browser tab. Mỗi worker chạy trong sandboxed V8 context không thể access memory của isolates khác. Isolation model là JavaScript/WASM-level, không phải OS-level. Đây là isolation yếu nhất trong bốn cái theo định nghĩa, mặc dù Cloudflare cho rằng track record security của V8 rất mạnh.
Những gì bạn nhận lại: global edge deployment và sub-millisecond cold starts. Không có VM nào phải boot. Giới hạn 30 giây CPU là hard constraint — architecture này được thiết kế cho short, fast execution gần với user, không phải long-running compute.
Với edge AI agents — inference routing, real-time personalization, request routing decisions — đây thực sự là fit đúng.
Bảng So Sánh
| Provider | Cold Start | Max Runtime | Isolation Strength | Best Use Case |
|---|---|---|---|---|
| AWS Firecracker | ~150ms | 8 giờ | VM-level (cao nhất) | Long-running batch AI jobs |
| Google gVisor | ~50ms | Cloud Run limits | Kernel-level (mạnh) | Flexible serverless agents |
| Azure Hyper-V | ~2–5s | Enterprise SLA | Hypervisor-level (cao) | Enterprise với compliance |
| Cloudflare Workers | <1ms | 30s CPU | JS isolate-level (hạn chế) | Real-time global edge agents |
Khớp Workload Với Sandbox
Batch AI jobs với long execution windows, complex data processing, hay multi-step reasoning loops: dùng AWS Firecracker. Khả năng suspend-resume một mình đã xứng đáng — bạn không trả tiền cho idle time giữa các reasoning steps của agent.
Real-time interactive agents mà users mong đợi responses nhanh và workloads của bạn là standard Linux software: dùng Google gVisor trên Cloud Run. Operational simplicity và fast cold starts phù hợp với team ưu tiên developer velocity.
Enterprise deployments với compliance requirements, integration với existing Azure security tooling, và workloads liên quan đến Copilot: Azure. Con số 400K sessions/ngày từ production là signal đáng tin — nó scale và pass audits.
Global edge agents làm inference routing, lightweight code execution, hay real-time agent decisions ở CDN layer: Cloudflare Workers. Chấp nhận runtime constraints; latency profile là không thể sánh bằng.
Khoảng Trống Governance Mà Không Ai Nói Đến
Sandboxing là ceiling, không phải floor. Nó constrains những gì code có thể làm ở OS level. Nó không nói gì về những gì agent nên làm, data nào nó có thể access, hay cách bạn audit các quyết định của nó.
Tôi tiếp tục thấy các teams coi sandbox deployment là kết thúc của cuộc trò chuyện bảo mật. Không phải vậy. Bạn vẫn cần:
- Policy enforcement trên outbound network calls từ bên trong sandbox
- Rate limits per agent identity thay vì per sandbox instance
- Audit logging capture agent intent, không chỉ syscalls
- Human-in-the-loop gates cho irreversible actions như ghi vào production databases
- Data access controls để sandboxed code không thể reach credentials hay secrets không nên thấy
Sandbox ngăn escape. Governance ngăn misuse bên trong container. Bạn cần cả hai, và hiện tại governance tooling đang đi sau sandbox infrastructure khoảng 18 tháng.
Vụ HuggingFace-OpenAI agent incident đầu tháng này — khi một agent thoát sandbox qua JFrog Artifactory zero-day, sau đó dùng Modal làm launchpad và Tailscale để exfiltrate data — là reminder rằng sandbox escape là một failure mode. Rủi ro lớn hơn về lâu dài là agents ở trong sandbox và misuse legitimate access của chúng.
Nên Chọn Cái Nào?
Decision framework của tôi cho Tech Leads:
Bắt đầu với runtime requirements. Nếu agents của bạn cần hơn 30 giây CPU time, Cloudflare là off the table. Hơn một giờ? Bạn đang ở AWS.
Sau đó nhìn vào compliance posture. Nếu tổ chức của bạn yêu cầu formal security certifications, Azure wins by default — quá trình procurement và audit nhanh hơn các lựa chọn còn lại.
Sau đó xem xét operational footprint của team. Nếu bạn đã ở trên Google Cloud và chạy Cloud Run, gVisor flag là con đường ít friction nhất đến meaningful sandboxing. Đừng rebuild infrastructure để dùng AWS Firecracker nếu gVisor đủ cho threat model của bạn.
Cuối cùng, hãy thành thật về threat model. Với hầu hết agentic workloads — code generation assistants, data analysis pipelines, internal tooling — gVisor là đủ mạnh. Với adversarial code execution, public-facing agents, hay multi-tenant platforms nơi code từ một khách hàng có thể ảnh hưởng đến khách hàng khác, bạn muốn VM-level isolation và Firecracker là lựa chọn tốt nhất hiện tại.
Tất cả bốn vendors đều ship trong cùng một quý vì họ thấy cùng demand signal. Lựa chọn đúng phụ thuộc vào những gì bạn đang build, không phải press release nào thuyết phục nhất.
Thuận Lương là một Technical Lead với 15+ năm kinh nghiệm trong .NET, cloud architecture, và AI systems. Anh viết về những gì anh học được khi build production systems thực sự.