Gemini 3.8 Flash và Claude: Cuộc đua mới về chi phí và hiệu năng cho AI Agent
Google phát hành Gemini 3.8 Flash vào ngày 2 tháng 9 năm 2026, gọi đây là mô hình Flash thông minh nhất của hãng và mở cho việc sử dụng trong môi trường production. Cùng đợt ra mắt còn có Gemini 3.8 Flash Cyber, dành cho các chuyên gia phòng thủ an ninh mạng qua cơ chế truy cập tin cậy.
Gemini 3.8 Flash không cạnh tranh bằng kích thước mô hình lớn nhất. Điểm nhấn là sự kết hợp giữa context 1 triệu token, đầu vào đa phương thức, Google grounding, thinking có thể cấu hình, tốc độ phục vụ nhanh và mức giá API giới thiệu 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026.
Điều này làm thay đổi phép so sánh với Claude. Claude Fable 5.1 có định hướng gần nhất ở các tác vụ dài và khó, nhưng có giá 10/50 USD cho mỗi triệu token. Claude Opus 5 có giá 5/25 USD, còn Sonnet 5 có giá 2/10 USD. Gemini rẻ hơn nhiều theo đơn giá token, nhưng Google cũng nói rằng các tác vụ khó có thể dùng nhiều reasoning token và tool call hơn.
Phản hồi ban đầu t ừ cộng đồng khá tích cực nhưng chưa thể xem là kết luận. Một số người dùng thấy 3.8 Flash kỹ lưỡng và ít vội vàng hơn 3.7; những người khác báo cáo độ trễ cao hơn, quota bị tiêu thụ nhiều hơn và quá trình rollout không đồng nhất. Câu hỏi đúng không phải “mô hình nào thông minh hơn về mặt trừu tượng?”, mà là: mô hình nào tạo ra kết quả được chấp nhận tốt hơn trên mỗi đô la, mỗi phút và mỗi vòng review của con người?
Google đã phát hành gì?
Model production API có model ID ổn định là gemini-3.8-flash. Google định vị nó cho kỹ thuật phần mềm dài hạn, autonomous agent và các quy trình doanh nghiệp phức tạp.
Thông số API chính:
- Đầu vào: văn bản, hình ảnh, video, audio và PDF.
- Đầu ra: văn bản.
- Giới hạn đầu vào: 1.048.576 token.
- Giới hạn đầu ra: 65.536 token, bao gồm reasoning token trong phần output tính phí.
- Mức thinking:
low,medium,high; mặc định làmedium; không hỗ trợminimal. - Công cụ: Search grounding, Google Maps grounding, URL context, file search, code execution, function calling, structured outputs, caching và computer use ở bản preview.
- Chế độ phục vụ: Standard, Batch, Flex và Priority.
Giá Standard giới thiệu đến hết năm 2026 là 0,75/3,75 USD cho mỗi triệu token đầu vào/đầu ra. Từ ngày 1 tháng 1 năm 2027, giá thành 1,50/7,50 USD. Batch và Flex có giá token bằng một nửa Standard, còn Priority đắt hơn. Context caching có thêm phí token và phí lưu trữ.
Google AI Studio có free tier, nhưng Google cho biết nội dung ở free tier có thể được dùng để cải thiện sản phẩm. Theo trang pricing, dữ liệu từ API trả phí không được dùng cho mục đích này. Đây là khác biệt cần đưa vào bài toán chi phí và compliance khi triển khai production.
Lựa chọn thiết kế cốt lõi: Gemini làm nhiều hơn khi tác vụ khó
Google cho biết 3.8 Flash cải thiện về software engineering, tác vụ agentic, reasoning chuyên ngành và enterprise workflow. Về cách vận hành, mô hình có thể thực hiện nhiều bước reasoning hơn, gọi công cụ lặp lại và kiểm tra kết quả trong quá trình làm việc.
low phù hợp với incident pipeline, chat thời gian thực, bản nháp và phân tích nhanh. medium là điểm bắt đầu hợp lý cho coding phức tạp và agent. high tối đa hóa reasoning và orchestration công cụ.
Claude có cơ chế đánh đổi tương tự nhưng thể hiện khác:
- Gemini 3.8 Flash:
low/medium/high, mặc địnhmedium. - Claude Sonnet 5: adaptive thinking và điều khiển
effort, phù hợp cho thực thi hằng ngày. - Claude Opus 5: adaptive thinking, effort cao mặc định, context 1 triệu và giá 5/25 USD.
- Claude Fable 5.1: adaptive thinking luôn bật, effort cao mặc định, context 1 triệu và giá 10/50 USD cho tác vụ dài khó nhất.
Vì vậy token price không đồng nghĩa với task price. Một mô hình rẻ có thể dùng gấp đôi token, thực hiện nhiều tool call hơn hoặc cần nhiều thời gian sửa kết quả hơn.
Gemini 3.8 Flash và Claude: so sánh thông số
| Mô hình | Context | Output tối đa | API input / output | Điều khiển reasoning | Phù hợp nhất với |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | 1M | 64K | 0,75 / 3,75 USD đến hết 2026 | low / medium / high | Agent nhanh, đa phương thức và nhạy cảm với chi phí |
| Claude Sonnet 5 | 1M | 128K | 2 / 10 USD | Adaptive + effort | Coding hằng ngày và agent tổng quát |
| Claude Opus 5 | 1M | 128K | 5 / 25 USD | Adaptive + effort | Kỹ thuật phức tạp và công việc doanh nghiệp |
| Claude Fable 5.1 | 1M | 128K | 10 / 50 USD | Adaptive, luôn bật | Reasoning dài, nghiên cứu và migration khó |
Đây không phải bảng xếp hạng chất lượng. Gemini có bề mặt input được tài liệu hóa rộng hơn với audio, video và PDF, cùng Search grounding, Maps grounding, URL context và computer use preview. Claude cung cấp text/image input, vision và tool use. Với sản phẩm xoay quanh hệ sinh thái Google, Gemini có thể giảm công sức tích hợp.
Claude phản công bằng khả năng output lớn hơn: Opus 5 và Fable 5.1 cho phép tối đa 128K output token. Anthropic cũng tài liệu hóa thinking block, trạng thái agent dài hạn và fallback. Vì vậy một harness đa nhà cung cấp phải test riêng tool call, context compaction, structured output và retry.
Giá là lợi thế lớn nhất của Gemini — và cũng là cái bẫy
Theo giá Standard giới thiệu năm 2026, Gemini 3.8 Flash có giá cho cả input và output tương đương khoảng 37,5% Sonnet 5, 15% Opus 5 và 7,5% Fable 5.1.
Những tỷ lệ này chưa tính Search request, Maps query, lưu cache, thực thi tool, retry, review của con người hay reasoning overhead. Chỉ số phù hợp hơn là:
chi phí cho mỗi kết quả được chấp nhận
= token + tool call + grounding + retry + thời gian review
Với extraction khối lượng lớn, tạo bản nháp và sub-agent nhỏ, lợi thế giá của Gemini rất thuyết phục. Với migration khó, thêm một giờ review của kỹ sư có thể xóa sạch khoản tiết kiệm token. Fable 5.1 đắt vì nó dành cho công việc mà bỏ sót root cause còn tốn kém hơn inference.
Những điểm Gemini có câu chuyện sản phẩm mạnh hơn
1. Input đa phương thức và Google grounding
Gemini 3.8 Flash nhận văn bản, hình ảnh, video, audio và PDF, sau đó kết nối với Search, Maps, URL context, File Search và Code Execution. Đây là nền tảng thuận tiện cho trợ lý phải chuyển qua lại giữa tài liệu, trang web, bản đồ, codebase và kết quả từ công cụ.
2. Routing agent theo chi phí
Dùng low cho lượt thông thường, medium cho agent bình thường và high khi tác vụ thực sự cần tạo thành một policy dễ hiểu. Batch và Flex bổ sung các lựa chọn đánh đổi chi phí-latency. Nếu chất lượng accepted task tương đương trong replay eval, kinh tế học sẽ nghiêng về Gemini.
3. Biến thể cyber riêng
Google cung cấp Gemini 3.8 Flash Cyber cho defender được tin cậy thông qua Fairwind Program. Anthropic cũng tách Fable 5.1 và Mythos 5.1 có quyền truy cập hạn chế. Với công việc phòng thủ an ninh mạng, cần kiểm tra access program, logging, retention và nhóm tác vụ được phép.