Chuyển tới nội dung chính

11 bài viết được gắn thẻ "AI Agent"

Posts tagged with AI Agent

Xem tất cả thẻ

Đánh giá GPT-6 Astra: Giá, tính năng, phản hồi cộng đồng và so sánh với Claude, Gemini

· 11 phút để đọc
Claude Dev
Claude Dev

OpenAI đã phát hành GPT-6 Astra, mô hình flagship mới cho reasoning phức tạp, kỹ thuật phần mềm, điều khiển máy tính, nghiên cứu và tạo tài liệu. Điểm đáng chú ý không chỉ là “thông minh hơn”: Astra được thiết kế để thực hiện một workflow hoàn chỉnh qua code, trình duyệt và phần mềm chuyên nghiệp, đồng thời hỏi lại khi một quyết định chưa rõ có thể làm thay đổi kết quả.

Trong API, model có ID gpt-6-astra. OpenAI cho biết rollout bắt đầu với một số tổ chức giới hạn rồi mở rộng tới ChatGPT Plus, Pro, Business, Enterprise, Azure và Amazon Bedrock. Giá API Standard là 10 USD cho mỗi triệu input token và 50 USD cho mỗi triệu output token. Cache và Fast mode được tính riêng; Fast có giá gấp đôi Standard.

Mức giá này đưa Astra vào cùng phân khúc cao cấp với Claude Fable 5.1, trong khi Gemini 3.8 Flash vẫn rẻ hơn rất nhiều theo token. Phản hồi sớm của cộng đồng khiến bài toán so sánh phức tạp hơn: người dùng khen coding và research, nhưng cũng phản ánh token usage cao, initiative không ổn định, rollout gây nhầm lẫn và trải nghiệm viết sáng tạo chưa thuyết phục.

Kết luận thực tế: GPT-6 Astra là một model để escalation cho việc khó, không phải lựa chọn thay thế tự động cho mọi lời gọi Claude hay Gemini.

Claude Fable 5.1 và Mythos 5.1: Mô hình frontier bạn có thể dùng — và mô hình bạn không thể

· 15 phút để đọc
Claude Dev
Claude Dev

Anthropic phát hành Claude Fable 5.1Claude Mythos 5.1 vào ngày 1 tháng 9 năm 2026. Hai mô hình dùng cùng một mô hình nền, nhưng có safeguards khác nhau: Fable 5.1 được cung cấp rộng rãi, còn Mythos 5.1 chỉ dành cho các tổ chức đã được thẩm định thông qua chương trình trusted access của Anthropic.

Bản phát hành này đáng chú ý vì hai lý do. Thứ nhất, Anthropic tuyên bố Fable 5.1 tiến bộ đáng kể ở coding dài hạn, nghiên cứu, tài liệu, bảng tính, slide, vision và computer use. Thứ hai, công ty đang cố làm cho mô hình cấp Fable phù hợp hơn với production bằng cách giảm giá cache read, tinh chỉnh safety routing và giới thiệu kiến trúc giám sát doanh nghiệp do khách hàng kiểm soát.

Phản hồi ban đầu của cộng đồng rất hào hứng với công việc khó và nhiều phần, nhưng thận trọng hơn về tốc độ, usage limit, văn phong, safeguards, lưu trữ dữ liệu và việc giá theo đơn vị thấp hơn có thật sự làm hóa đơn giảm hay không. Cách đọc hợp lý nhất là: Fable 5.1 giống một động cơ làm việc chuyên biệt, không phải mô hình nên bật mù quáng cho mọi prompt.

Gemini 3.8 Flash và Claude: Cuộc đua mới về chi phí và hiệu năng cho AI Agent

· 11 phút để đọc
Claude Dev
Claude Dev

Google phát hành Gemini 3.8 Flash vào ngày 2 tháng 9 năm 2026, gọi đây là mô hình Flash thông minh nhất của hãng và mở cho việc sử dụng trong môi trường production. Cùng đợt ra mắt còn có Gemini 3.8 Flash Cyber, dành cho các chuyên gia phòng thủ an ninh mạng qua cơ chế truy cập tin cậy.

Gemini 3.8 Flash không cạnh tranh bằng kích thước mô hình lớn nhất. Điểm nhấn là sự kết hợp giữa context 1 triệu token, đầu vào đa phương thức, Google grounding, thinking có thể cấu hình, tốc độ phục vụ nhanh và mức giá API giới thiệu 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026.

Điều này làm thay đổi phép so sánh với Claude. Claude Fable 5.1 có định hướng gần nhất ở các tác vụ dài và khó, nhưng có giá 10/50 USD cho mỗi triệu token. Claude Opus 5 có giá 5/25 USD, còn Sonnet 5 có giá 2/10 USD. Gemini rẻ hơn nhiều theo đơn giá token, nhưng Google cũng nói rằng các tác vụ khó có thể dùng nhiều reasoning token và tool call hơn.

Phản hồi ban đầu từ cộng đồng khá tích cực nhưng chưa thể xem là kết luận. Một số người dùng thấy 3.8 Flash kỹ lưỡng và ít vội vàng hơn 3.7; những người khác báo cáo độ trễ cao hơn, quota bị tiêu thụ nhiều hơn và quá trình rollout không đồng nhất. Câu hỏi đúng không phải “mô hình nào thông minh hơn về mặt trừu tượng?”, mà là: mô hình nào tạo ra kết quả được chấp nhận tốt hơn trên mỗi đô la, mỗi phút và mỗi vòng review của con người?

Claude Opus 5: Mô hình frontier hằng ngày mà các đội Claude Code mong đợi

· 12 phút để đọc
Claude Dev
Claude Dev

Anthropic phát hành Claude Opus 5 vào ngày 24 tháng 7 năm 2026, định vị nó là mô hình frontier dùng hằng ngày trong gia đình Claude 5: gần với trí tuệ frontier của Claude Fable 5, nhưng vẫn giữ giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra như Opus 4.8.

Mức giá đó mới là câu chuyện chính.

Fable 5 vẫn dành cho công việc khó nhất, dài nhất và tự chủ nhất. Sonnet 5 là mô hình agent mặc định mà hầu hết đội có thể dùng rộng rãi. Opus 5 nằm giữa hai lớp đó: đủ mạnh cho kỹ thuật nghiêm túc, ít bị ràng buộc hơn Fable trong workflow thường ngày, và có giá phù hợp để dùng lặp lại thay vì chỉ gọi khi cần leo thang hiếm hoi.

Phản hồi cộng đồng ban đầu tích cực, nhưng chưa ổn định. Trên X, nhiều người hào hứng với chất lượng ở medium effort và hiệu quả token. Reddit và Hacker News thận trọng hơn, tập trung vào usage limit, tốc độ thay đổi mô hình, safety fallback, và liệu một bản Opus mới có thật sự tốt hơn trong các phiên coding lộn xộn hay không. Sự hoài nghi đó là đúng.

GPT-5.6 Sol, Terra, and Luna: What Claude Code Teams Should Actually Watch

· 9 phút để đọc
Claude Dev
Claude Dev

OpenAI released GPT-5.6 Sol, Terra, and Luna on July 10, 2026, and the interesting part is not just that another frontier model arrived. It is that OpenAI is now making the model family itself part of the developer workflow.

For Claude Code users, the useful question is not "is GPT-5.6 better than Claude?" That is too vague to help anyone ship software.

The better question is: which layer of work is each model trying to own?

OpenAI's answer is clear. Sol is the strongest reasoning and agent model, Terra is the faster coding workhorse, and Luna is the high-throughput batch option. Early community feedback on X, Reddit, and developer forums is still noisy, but the shape of the conversation is already familiar: excitement around coding and agents, skepticism around cost, and a lot of "show me on my repo" energy.

Claude Fable and the Real Skill of Agentic Coding: Finding Your Unknowns

· 8 phút để đọc
Claude Dev
Claude Dev

Anthropic's latest Claude Code post, "A field guide to Claude Fable 5: Finding your unknowns," is not really about a new prompt trick.

It is about a shift that every serious Claude Code user is going to feel: as models get better at carrying long tasks, the limiting factor moves from raw model capability to how well the human can expose the real shape of the work.

That is the point of the "map and territory" framing in the official post. The map is what we give Claude: prompts, skills, files, specs, screenshots, references, and context. The territory is the actual system: production constraints, old decisions, implicit taste, hidden business rules, edge cases, and the parts of the codebase nobody writes down.

The gap between those two is where agentic coding succeeds or fails.

Claude Sonnet 5: Mô hình agent mặc định mới cho Claude Code

· 10 phút để đọc
Claude Dev
Claude Dev

Anthropic đã phát hành Claude Sonnet 5 vào ngày 30 tháng 6 năm 2026, định vị nó là mô hình Sonnet agentic nhất từ trước đến nay và là mô hình mặc định mới cho người dùng Claude Free và Pro.

Thông điệp rất rõ: Sonnet 5 đưa nhiều loại agentic work gần đây vốn cần mô hình Opus-class xuống một tầng rẻ hơn, nhanh hơn và phổ biến hơn. Nó có thể lập kế hoạch, dùng browser và terminal, xử lý tác vụ coding dài, và mặc định chạy với adaptive thinking.

Với người dùng Claude Code, Sonnet 5 quan trọng hơn một lần refresh mô hình thông thường. Nó nhiều khả năng trở thành execution layer mặc định của nhiều đội ngũ: không phải mô hình mạnh nhất Anthropic có, nhưng là mô hình developer sẽ gọi thường xuyên nhất.

Việc nâng cấp không hoàn toàn trơn tru. Sonnet 5 có tokenizer mới, thay đổi hành vi API quanh thinking và sampling parameters, cyber safeguards thời gian thực, và câu chuyện giá rẻ hơn Opus nhưng không phải lúc nào cũng rẻ hơn theo từng task.

Claude Fable 5: Mạnh, đắt, và được thiết kế để bị giới hạn

· 11 phút để đọc
Claude Dev
Claude Dev

Anthropic đã phát hành Claude Fable 5 vào ngày 9 tháng 6 năm 2026, đưa một phiên bản Mythos-class có safeguards tới người dùng Claude trả phí và các nhà phát triển.

Điểm chính không chỉ là Fable 5 mạnh hơn. Quan trọng hơn, Anthropic đang thử một kiểu phát hành mới: cho công chúng truy cập vào họ mô hình mạnh nhất mà hãng từng cung cấp rộng rãi, nhưng chuyển các yêu cầu nhạy cảm ra khỏi mô hình khi chúng chạm tới cybersecurity, biology, chemistry, distillation hoặc một số hướng frontier AI development.

Điều đó khiến Fable 5 trở thành một bản phát hành Claude đặc biệt quan trọng với developer. Phản hồi ban đầu chia thành hai phía: kinh ngạc trước năng lực dài hơi của mô hình, và khó chịu với access, safety routing, chi phí cũng như cách xử lý dữ liệu doanh nghiệp.

Với đội ngũ Claude Code, câu hỏi thực tế không phải là "có nên chuyển mọi thứ sang Fable không?" Câu hỏi đúng hơn là: tác vụ nào đủ giá trị để dùng Fable 5, và tác vụ nào sẽ bị safeguards làm hỏng hoặc bóp méo?

Claude Managed Agents: vừa có gì được ra mắt

· 12 phút để đọc
Claude Dev
Claude Dev

Nếu bạn đang xây dựng với Claude, điều quan trọng nhất về Claude Managed Agents không phải là Anthropic vừa tung ra “thêm một tính năng agent”.

Điều quan trọng là Anthropic vừa tiến lên thêm một tầng trong stack.

Thay vì chỉ bán quyền truy cập model và các primitive công cụ, Anthropic giờ đang bán một runtime được quản lý cho các agent chạy dài hạn: định nghĩa agent, môi trường cloud, session, event streaming, built-in tools, và operational harness giữ cho toàn bộ hệ thống hoạt động.

Điều đó chuyển câu hỏi của developer từ:

  • “Làm sao tôi ghép một agent loop lại với nhau?”
  • “Làm sao để nó có thể resume, observable và secure?”

thành:

  • “Agent này thực sự nên làm gì?”
  • “Phần nào tôi muốn giữ quyền kiểm soát, và phần nào tôi sẵn sàng giao cho Anthropic quản lý?”

Dòng thời gian Conway: Anthropic đang xây agent always-on như thế nào

· 12 phút để đọc
Claude Dev
Claude Dev

Điểm quan trọng nhất cần hiểu về Conway là:

Conway hiện chưa phải là sản phẩm được Anthropic phát hành chính thức.

Những gì đang tồn tại lúc này là sự kết hợp của:

  • các đợt ra mắt chính thức của Anthropic quanh Cowork, Dispatch, computer use, scheduled tasksauto mode
  • tài liệu trợ giúp hiện tại cho thấy các mảnh ghép đó đang nối với nhau ra sao
  • một bài viết bên thứ ba ngày 1 tháng 4 năm 2026 hé lộ một môi trường nội bộ chưa phát hành tên là Conway

Nếu chỉ nhìn vào phần rò rỉ, bạn sẽ bỏ lỡ kiến trúc. Nếu chỉ nhìn vào các launch chính thức, bạn sẽ bỏ lỡ hướng đi của Anthropic.

Câu chuyện kỹ thuật thật sự nằm ở việc ghép hai phần đó lại với nhau.