Chuyển tới nội dung chính

Gemini 3.8 Flash và Claude: Cuộc đua mới về chi phí và hiệu năng cho AI Agent

· 11 phút để đọc
Claude Dev
Claude Dev

Google phát hành Gemini 3.8 Flash vào ngày 2 tháng 9 năm 2026, gọi đây là mô hình Flash thông minh nhất của hãng và mở cho việc sử dụng trong môi trường production. Cùng đợt ra mắt còn có Gemini 3.8 Flash Cyber, dành cho các chuyên gia phòng thủ an ninh mạng qua cơ chế truy cập tin cậy.

Gemini 3.8 Flash không cạnh tranh bằng kích thước mô hình lớn nhất. Điểm nhấn là sự kết hợp giữa context 1 triệu token, đầu vào đa phương thức, Google grounding, thinking có thể cấu hình, tốc độ phục vụ nhanh và mức giá API giới thiệu 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026.

Điều này làm thay đổi phép so sánh với Claude. Claude Fable 5.1 có định hướng gần nhất ở các tác vụ dài và khó, nhưng có giá 10/50 USD cho mỗi triệu token. Claude Opus 5 có giá 5/25 USD, còn Sonnet 5 có giá 2/10 USD. Gemini rẻ hơn nhiều theo đơn giá token, nhưng Google cũng nói rằng các tác vụ khó có thể dùng nhiều reasoning token và tool call hơn.

Phản hồi ban đầu từ cộng đồng khá tích cực nhưng chưa thể xem là kết luận. Một số người dùng thấy 3.8 Flash kỹ lưỡng và ít vội vàng hơn 3.7; những người khác báo cáo độ trễ cao hơn, quota bị tiêu thụ nhiều hơn và quá trình rollout không đồng nhất. Câu hỏi đúng không phải “mô hình nào thông minh hơn về mặt trừu tượng?”, mà là: mô hình nào tạo ra kết quả được chấp nhận tốt hơn trên mỗi đô la, mỗi phút và mỗi vòng review của con người?

Google đã phát hành gì?

Model production API có model ID ổn định là gemini-3.8-flash. Google định vị nó cho kỹ thuật phần mềm dài hạn, autonomous agent và các quy trình doanh nghiệp phức tạp.

Thông số API chính:

  • Đầu vào: văn bản, hình ảnh, video, audio và PDF.
  • Đầu ra: văn bản.
  • Giới hạn đầu vào: 1.048.576 token.
  • Giới hạn đầu ra: 65.536 token, bao gồm reasoning token trong phần output tính phí.
  • Mức thinking: low, medium, high; mặc định là medium; không hỗ trợ minimal.
  • Công cụ: Search grounding, Google Maps grounding, URL context, file search, code execution, function calling, structured outputs, caching và computer use ở bản preview.
  • Chế độ phục vụ: Standard, Batch, Flex và Priority.

Giá Standard giới thiệu đến hết năm 2026 là 0,75/3,75 USD cho mỗi triệu token đầu vào/đầu ra. Từ ngày 1 tháng 1 năm 2027, giá thành 1,50/7,50 USD. Batch và Flex có giá token bằng một nửa Standard, còn Priority đắt hơn. Context caching có thêm phí token và phí lưu trữ.

Google AI Studio có free tier, nhưng Google cho biết nội dung ở free tier có thể được dùng để cải thiện sản phẩm. Theo trang pricing, dữ liệu từ API trả phí không được dùng cho mục đích này. Đây là khác biệt cần đưa vào bài toán chi phí và compliance khi triển khai production.

Lựa chọn thiết kế cốt lõi: Gemini làm nhiều hơn khi tác vụ khó

Google cho biết 3.8 Flash cải thiện về software engineering, tác vụ agentic, reasoning chuyên ngành và enterprise workflow. Về cách vận hành, mô hình có thể thực hiện nhiều bước reasoning hơn, gọi công cụ lặp lại và kiểm tra kết quả trong quá trình làm việc.

low phù hợp với incident pipeline, chat thời gian thực, bản nháp và phân tích nhanh. medium là điểm bắt đầu hợp lý cho coding phức tạp và agent. high tối đa hóa reasoning và orchestration công cụ.

Claude có cơ chế đánh đổi tương tự nhưng thể hiện khác:

  • Gemini 3.8 Flash: low / medium / high, mặc định medium.
  • Claude Sonnet 5: adaptive thinking và điều khiển effort, phù hợp cho thực thi hằng ngày.
  • Claude Opus 5: adaptive thinking, effort cao mặc định, context 1 triệu và giá 5/25 USD.
  • Claude Fable 5.1: adaptive thinking luôn bật, effort cao mặc định, context 1 triệu và giá 10/50 USD cho tác vụ dài khó nhất.

Vì vậy token price không đồng nghĩa với task price. Một mô hình rẻ có thể dùng gấp đôi token, thực hiện nhiều tool call hơn hoặc cần nhiều thời gian sửa kết quả hơn.

Gemini 3.8 Flash và Claude: so sánh thông số

Mô hìnhContextOutput tối đaAPI input / outputĐiều khiển reasoningPhù hợp nhất với
Gemini 3.8 Flash1M64K0,75 / 3,75 USD đến hết 2026low / medium / highAgent nhanh, đa phương thức và nhạy cảm với chi phí
Claude Sonnet 51M128K2 / 10 USDAdaptive + effortCoding hằng ngày và agent tổng quát
Claude Opus 51M128K5 / 25 USDAdaptive + effortKỹ thuật phức tạp và công việc doanh nghiệp
Claude Fable 5.11M128K10 / 50 USDAdaptive, luôn bậtReasoning dài, nghiên cứu và migration khó

Đây không phải bảng xếp hạng chất lượng. Gemini có bề mặt input được tài liệu hóa rộng hơn với audio, video và PDF, cùng Search grounding, Maps grounding, URL context và computer use preview. Claude cung cấp text/image input, vision và tool use. Với sản phẩm xoay quanh hệ sinh thái Google, Gemini có thể giảm công sức tích hợp.

Claude phản công bằng khả năng output lớn hơn: Opus 5 và Fable 5.1 cho phép tối đa 128K output token. Anthropic cũng tài liệu hóa thinking block, trạng thái agent dài hạn và fallback. Vì vậy một harness đa nhà cung cấp phải test riêng tool call, context compaction, structured output và retry.

Giá là lợi thế lớn nhất của Gemini — và cũng là cái bẫy

Theo giá Standard giới thiệu năm 2026, Gemini 3.8 Flash có giá cho cả input và output tương đương khoảng 37,5% Sonnet 5, 15% Opus 5 và 7,5% Fable 5.1.

Những tỷ lệ này chưa tính Search request, Maps query, lưu cache, thực thi tool, retry, review của con người hay reasoning overhead. Chỉ số phù hợp hơn là:

chi phí cho mỗi kết quả được chấp nhận
= token + tool call + grounding + retry + thời gian review

Với extraction khối lượng lớn, tạo bản nháp và sub-agent nhỏ, lợi thế giá của Gemini rất thuyết phục. Với migration khó, thêm một giờ review của kỹ sư có thể xóa sạch khoản tiết kiệm token. Fable 5.1 đắt vì nó dành cho công việc mà bỏ sót root cause còn tốn kém hơn inference.

Những điểm Gemini có câu chuyện sản phẩm mạnh hơn

1. Input đa phương thức và Google grounding

Gemini 3.8 Flash nhận văn bản, hình ảnh, video, audio và PDF, sau đó kết nối với Search, Maps, URL context, File Search và Code Execution. Đây là nền tảng thuận tiện cho trợ lý phải chuyển qua lại giữa tài liệu, trang web, bản đồ, codebase và kết quả từ công cụ.

2. Routing agent theo chi phí

Dùng low cho lượt thông thường, medium cho agent bình thường và high khi tác vụ thực sự cần tạo thành một policy dễ hiểu. Batch và Flex bổ sung các lựa chọn đánh đổi chi phí-latency. Nếu chất lượng accepted task tương đương trong replay eval, kinh tế học sẽ nghiêng về Gemini.

3. Biến thể cyber riêng

Google cung cấp Gemini 3.8 Flash Cyber cho defender được tin cậy thông qua Fairwind Program. Anthropic cũng tách Fable 5.1 và Mythos 5.1 có quyền truy cập hạn chế. Với công việc phòng thủ an ninh mạng, cần kiểm tra access program, logging, retention và nhóm tác vụ được phép.

Claude vẫn có lợi thế ở đâu?

1. Nhiều không gian output hơn

Giới hạn 128K output token của Opus 5 và Fable 5.1 hữu ích cho code lớn, report dài và agent phải trả về nhiều công việc có cấu trúc trong một response.

2. Lộ trình escalation rõ hơn trong Claude Code

Sonnet 5 phù hợp với thực thi rộng, Opus 5 với engineering phức tạp và Fable 5.1 với các vấn đề dài hạn khó nhất. Anthropic khuyên bắt đầu với Opus 5 cho phần lớn workload rồi chỉ chuyển sang Fable khi effort cao vẫn chưa đủ. Với đội ngũ đã dùng Claude Code, đây là lộ trình premium dễ hiểu.

3. State contract rõ cho agent tùy chỉnh

Fable 5.1 yêu cầu client xử lý cẩn thận thinking block, append-only history, tool call và trạng thái refusal/fallback. Điều này làm tăng chi phí migration nhưng giúp các phiên dài dễ test hơn. Không nên suy ra khả năng tương thích đa provider chỉ từ token price.

Người dùng ban đầu đang nói gì?

Trên r/GeminiAI, người dùng sớm mô tả 3.8 Flash vẫn rất nhanh, có tính thực tế và chi tiết hơn 3.7, đồng thời ít “lười” hơn trước prompt nghiêm túc. Người khác báo cáo lỗi, chậm hoặc rollout khác nhau tùy account và app.

Trong các cộng đồng Google Antigravity, một số người cho rằng 3.8 Flash phân tích repository kỹ hơn và tìm ra nhiều vấn đề hơn, nhưng tốn thời gian và quota hơn. Điều này phù hợp với tài liệu Google: tác vụ phức tạp có thể sử dụng nhiều reasoning token và tool call hơn.

Một bài test cộng đồng với 98 tác vụ MindTrial báo cáo Gemini 3.8 Flash đạt 86/98, Fable 5.1 đạt 90/98 và Opus 5 đạt 88/98. Cùng bài test cho thấy runtime của Gemini 3.8 tăng từ khoảng 1 giờ 03 phút ở 3.7 lên 1 giờ 46 phút, còn reasoning token tăng từ khoảng 660K lên 1,57M. Đây là tín hiệu định hướng từ một harness và một bộ tác vụ, không phải benchmark kết luận.

Chính sách routing thực tế

Tác vụModel nên test trướcEscalation
Extraction khối lượng lớn, bản nháp, chuyển đổi đơn giảnGemini 3.8 Flash low/mediumSonnet 5
Quy trình multimodal với tài liệu, audio, video, PDF hoặc bản đồGemini 3.8 FlashOpus 5
Sửa repo và vòng lặp test thông thườngGemini medium hoặc Sonnet 5Opus 5
Migration lớn hoặc debug liên serviceOpus 5Fable 5.1
Nghiên cứu tài liệu dài và nhiều quyết định phụ thuộcOpus 5 hoặc Fable 5.1Fable 5.1
Cyber phòng thủ đã được phê duyệtFlash Cyber hoặc MythosHuman review

Checklist đánh giá

Dùng cùng một task set và ghi lại accepted completion rate, partial credit, wall-clock time, time-to-first-useful-output, input/output/reasoning token, tool call và grounding request, retry, refusal, chỉnh sửa của con người, context khi thất bại, chi phí cho mỗi kết quả được chấp nhận và mức tuân thủ convention của project.

Với Gemini, hãy test cả ba thinking level. Đừng so sánh Gemini high với Claude low, hoặc chat không có tool với agent đã bật tool. Với Claude, test Sonnet 5, Opus 5 và Fable 5.1 ở các mức effort mà bạn thật sự trả tiền.

Kết luận

Gemini 3.8 Flash là ứng viên rất mạnh cho agent khối lượng lớn và workflow tích hợp Google: context 1 triệu, input đa phương thức, grounding và thinking có thể điều chỉnh ở mức giá thấp.

Claude vẫn có lộ trình premium rõ ràng: Sonnet 5 cho thực thi hằng ngày, Opus 5 cho engineering phức tạp và Fable 5.1 cho tác vụ dài mà root-cause tốt hơn có thể bù chi phí.

Thông số và phản hồi ban đầu cùng chỉ về một kết luận: Gemini rẻ, nhanh và có năng lực, nhưng có thể tiêu lợi thế đó vào reasoning và tool call bổ sung. Đừng chọn theo demo hay nhãn model. Hãy đo kết quả được chấp nhận và routing theo hình dạng tác vụ.

Nguồn tham khảo