§ blog · AI & ML25/07/2026
← Tất cả bài viết

Claude Opus 5: khi chi phí thật nằm ở token tiêu thụ, không phải giá niêm yết

Anthropic phát hành Claude Opus 5 ngày 24/7/2026 với giá giữ nguyên 5/25 USD mỗi triệu token — bằng một nửa Fable 5 — và theo Artificial Analysis là mô hình có điểm trí tuệ cao nhất hiện nay. Nhưng với đội kỹ thuật, con số đáng quan tâm hơn giá niêm yết là lượng token mô hình thực sự tiêu thụ, và tham số effort quyết định điều đó.

AI & MLLLMAnthropicCost Optimization8 phút đọc
By KonexForge Engineering Team
AA INTELLIGENCE INDEXOpus 561Fable 560GPT-5.6 Sol59Kimi K357GIÁ / TRIỆU TOKEN (IN / OUT)Fable 5$10 / $50Opus 5$5 / $25Opus 5 · batch$2.5 / $12.5cache hit$0.5CHI PHÍ THẬT = GIÁ × TOKEN TIÊU THỤadaptive thinking bật mặc định · token suy luận tính như outputđo được: đọc +50%, viết +65% token (CodeRabbit)THAM SỐ EFFORT · ĐÒN BẨY CHI PHÍlowđiểm 51mediumđiểm 56highđiểm 59xhighđiểm 60maxđiểm 61max → medium: mất 5 điểm, tiết kiệm đáng kể tokenCONTEXT 1M · OUTPUT 128K · KHÔNG PHỤ PHÍ NGỮ CẢNH DÀIanthropic.com

Ngày 24/7/2026, Anthropic phát hành Claude Opus 5 — theo Axios là bản phát hành thứ tư trong dòng Claude 5 chỉ trong chưa đầy hai tháng. Định vị được FortuneCNBC mô tả khá rõ: năng lực tiệm cận Fable 5 — mô hình mạnh nhất của Anthropic — nhưng với giá bằng một nửa. Sau hai bài phân tích về GLM-5.2 của Z.ai ở nhóm chi phí thấp và Kimi K3 của Moonshot AI ở nhóm mã nguồn mở, đây là mảnh ghép còn lại: nhóm mô hình đóng đầu bảng. Và với đội kỹ thuật, điểm đáng bàn nhất của Opus 5 không phải bảng benchmark, mà là cách nó tiêu thụ token.

Một lưu ý về độ tin cậy của số liệu trong bài

Chúng tôi tách rõ hai nhóm số liệu. Nhóm thứ nhất — giá, giới hạn context, tham số API — lấy trực tiếp từ tài liệu chính thức của Anthropic và có thể kiểm chứng ngay. Nhóm thứ hai — các con số benchmark — chỉ đến được với chúng tôi qua bản tin và trang đánh giá bên thứ ba, chưa đối chiếu được với văn bản gốc tại thời điểm viết. Chúng tôi ghi rõ nguồn cho từng con số để bạn tự đánh giá, thay vì trình bày mọi thứ ở cùng một mức độ chắc chắn.

Benchmark: dẫn đầu, nhưng khoảng cách tùy bài test

Artificial Analysis xếp Opus 5 đạt 61 điểm trên Intelligence Index — cao nhất tại thời điểm công bố, trên Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) và Opus 4.8 (56). Điểm đáng chú ý hơn con số tuyệt đối: cùng đơn vị đánh giá này ghi nhận Opus 5 rẻ hơn khoảng 26% chi phí mỗi tác vụ so với Fable 5, tức khoảng cách năng lực rất hẹp nhưng khoảng cách chi phí thì không.

Các benchmark do Anthropic công bố, được Vellumthe-decoder dẫn lại, cho thấy mức chênh lệch rất khác nhau tùy loại tác vụ: Frontier-Bench v0.1 (coding dạng agentic) đạt 43,3% so với 34,4% của GPT-5.6 Sol và 33,7% của Fable 5; ARC-AGI-3 đạt 30,2% so với 7,8% của GPT-5.6 Sol — một khoảng cách bất thường; OSWorld 2.0 (điều khiển máy tính) đạt 70,6% so với 66,1% của Fable 5. Đây là mẫu hình quen thuộc mà chúng tôi đã mô tả trong bài jagged frontier của AI: một mô hình vượt trội ở nhóm tác vụ này hoàn toàn có thể chỉ ngang bằng ở nhóm khác, nên chọn model theo điểm tổng hợp là cách chọn dễ sai nhất.

Điều quan trọng hơn giá niêm yết: token thực sự tiêu thụ

Giá Opus 5 giữ nguyên so với Opus 4.8: 5 USD mỗi triệu token input và 25 USD mỗi triệu token output, so với 10/50 USD của Fable 5. Cache hit chỉ tốn 0,5 USD mỗi triệu token, và Batch API giảm 50% còn 2,5/12,5 USD. Context 1 triệu token không tính phụ phí, output tối đa 128 nghìn token.

Nhưng đơn giá chỉ là một nửa phép tính. CodeRabbit đo được rằng trong tác vụ review code, Opus 5 đọc nhiều hơn khoảng 50% và viết nhiều hơn khoảng 65% token so với các mô hình frontier khác. Nguyên nhân nằm ở thiết kế: adaptive thinking bật mặc định, và token suy luận được tính như token output. Nghĩa là một mô hình rẻ hơn 50% trên bảng giá vẫn có thể cho hóa đơn tương đương hoặc cao hơn nếu nó suy nghĩ dài hơn cho cùng một tác vụ.

Đây là lý do khi đánh giá chi phí model cho khách hàng, chúng tôi luôn chạy một tập tác vụ đại diện và đo token thực tế thay vì nhân đơn giá với ước lượng. Đơn giá là thứ nhà cung cấp công bố; token tiêu thụ là thứ quyết định hóa đơn.

Tham số effort — đòn bẩy chi phí lớn nhất, và những cạm bẫy của nó

Opus 5 đưa ra tham số effort với 5 mức (low, medium, high, xhigh, max), mặc định là high. Artificial Analysis đo điểm theo từng mức: max 61, xhigh 60, high 59, medium 56, low 51 — nghĩa là hạ từ max xuống medium chỉ mất 5 điểm nhưng tiết kiệm đáng kể token. Với phần lớn tác vụ lặp lại trong một hệ thống production, đây là đánh đổi rất đáng cân nhắc.

Ba điểm trong tài liệu chính thức dễ gây bất ngờ khi triển khai thật: thứ nhất, không thể tắt thinking ở mức xhigh và max — API trả lỗi 400 nếu cố. Thứ hai, chính tài liệu ghi rõ rằng giảm effort không đảm bảo rút ngắn câu trả lời; muốn output ngắn thì phải yêu cầu trong prompt, không phải hạ effort. Thứ ba, đổi mức effort giữa chừng một hội thoại sẽ làm mất hiệu lực prompt caching — một chi tiết dễ khiến chi phí tăng ngược nếu lớp routing tự động đổi effort theo từng lượt.

Cách KonexForge đưa Opus 5 vào lớp model routing

Cũng như với GLM-5.2 và Kimi K3, Opus 5 được thêm vào lớp Router của KonexForge AI Core như một lựa chọn, không phải một cuộc thay thế. Điểm khác biệt là tham số effort cho phép định tuyến ở mức chi tiết hơn hẳn trước đây: thay vì chỉ chọn 'model nào', Router giờ chọn cả 'model nào ở mức suy luận nào'. Tác vụ sinh boilerplate hoặc phân loại đơn giản chạy ở mức thấp; tác vụ kiến trúc hoặc migration schema chạy ở mức cao. Với những tác vụ khối lượng lớn không đòi hỏi độ chính xác tuyệt đối, GLM-5.2 vẫn là lựa chọn chi phí thấp hợp lý — nguyên tắc không khóa cứng vào một nhà cung cấp AI duy nhất không thay đổi vì có thêm một model mạnh.

Về mức độ sẵn sàng tích hợp, Opus 5 có mặt trên GitHub Copilot ngay ngày đầu phát hành cho các gói Pro+, Max, Business và Enterprise — dù quản trị viên phải bật chính sách cho phép trước. Một số kết quả khách hàng công bố qua VentureBeat cũng đi theo hướng hiệu quả token: Harvey đạt chất lượng tương đương Opus 4.8 ở mức suy luận tối đa nhưng dùng ít hơn 26% token; Box ghi nhận cải thiện 8% tổng thể và 17% ở tác vụ thẩm định. Đây là số liệu do chính khách hàng của Anthropic công bố, nên nên đọc như tín hiệu tham khảo chứ không phải đo lường độc lập.

Hạn chế và rủi ro cần cân nhắc

  • **Độ trễ cao hơn theo mặc định** — Fast mode nhanh hơn khoảng 2,5 lần nhưng giá gấp đôi (10/50 USD), và hiện chỉ có trên API trực tiếp của Anthropic; không khả dụng trên Bedrock, Vertex hay Batch API. Với hệ thống buộc phải chạy qua cloud provider vì lý do tuân thủ dữ liệu, đây là ràng buộc cần xác nhận sớm.
  • **Chi phí khó dự đoán** — sự kết hợp giữa 5 mức effort, caching và Fast mode tạo ra nhiều hồ sơ chi phí khác nhau mà hóa đơn không tách bạch rõ, như finout phân tích. Cần tự gắn nhãn và đo ở tầng ứng dụng nếu muốn biết tiền đi đâu.
  • **Không phải mạnh nhất ở mọi hạng mục** — Fable 5 vẫn là lựa chọn cho nhóm tác vụ khó nhất, và một số nguồn ghi nhận GPT-5.6 Sol dẫn trước ở coding dài hơi. Một vài đánh giá cũng mô tả Opus 5 thận trọng quá mức ở các tác vụ liên quan đến bảo mật.
  • **Vấn đề an toàn cần theo dõi** — system card đánh giá rủi ro alignment ở mức rất thấp và mô hình từ chối sai ít hơn thế hệ trước, nhưng cũng ghi nhận mức độ nhận biết đang bị đánh giá (evaluation awareness) cao hơn. Đáng chú ý hơn, TechTimes dẫn lại kết quả từ các bài kiểm tra của UK AISI cho thấy mô hình xâm nhập thành công mạng doanh nghiệp mô phỏng trong 8 trên 10 lần. Với đội vận hành hạ tầng, đây là lời nhắc rằng năng lực agentic mạnh hơn đồng nghĩa bề mặt tấn công lớn hơn — đúng nguyên tắc zero-trust chúng tôi đã trình bày trong bài bảo mật trong thời đại AI.

Kết luận

Claude Opus 5 thu hẹp khoảng cách năng lực với model đắt nhất của chính Anthropic trong khi giữ nguyên mức giá cũ — đó là một bước tiến thật. Nhưng bài học kỹ thuật đáng mang đi không nằm ở bảng benchmark: với thế hệ model có suy luận thích ứng bật mặc định, đơn giá mỗi triệu token đã không còn là chỉ số đủ để so sánh chi phí. Thứ cần đo là token thực tiêu thụ cho một tác vụ cụ thể của bạn, và tham số effort là công cụ trực tiếp nhất để điều chỉnh nó. Tìm hiểu năng lực AI & ML của KonexForge, hoặc liên hệ nếu bạn muốn đánh giá lại chi phí model routing hiện tại dựa trên token thật thay vì giá niêm yết.

Bài viết liên quan

AI & ML

Z.ai GLM-5.2: mô hình lập trình Trung Quốc ngang ngửa GPT-5.5 với chi phí chỉ bằng 1/6

GLM-5.2 của Z.ai đạt điểm benchmark coding gần ngang Claude Opus 4.8 và vượt GPT-5.5, trong khi chi phí vận hành chỉ bằng khoảng 1/6. KonexForge đưa model này vào danh sách được hỗ trợ để khách hàng có thêm lựa chọn tối ưu chi phí — không thay thế, mà bổ sung vào lớp model routing hiện có.

AI & ML

Kimi K3: mô hình mã nguồn mở 2.8 nghìn tỷ tham số đầu tiên đạt tầm frontier

Kimi K3 của Moonshot AI là mô hình mã nguồn mở lớn nhất từng được phát hành — 2.8 nghìn tỷ tham số, kiến trúc Mixture-of-Experts với Kimi Delta Attention, đạt điểm gần ngang các mô hình đóng hàng đầu trên nhiều benchmark. KonexForge phân tích kiến trúc, chi phí và những đánh đổi cần cân nhắc trước khi đưa vào production.

AI & ML

RAG pipeline trong production: chunking strategy, vector search và đánh giá chất lượng retrieval

RAG (Retrieval-Augmented Generation) là kiến trúc phổ biến nhất khi cần LLM trả lời dựa trên data nội bộ — nhưng phần lớn implementation đầu tiên chỉ hoạt động tốt trong demo, không trong production. Chunking strategy ảnh hưởng đến recall; embedding model ảnh hưởng đến precision; nếu không có pipeline đánh giá retrieval, không có cách nào biết hệ thống đang kém ở đâu. Ba quyết định kỹ thuật quan trọng nhất và cách đo chất lượng trước khi deploy.

Có một bài toán tương tự đang cần giải?

Liên hệ team