Một mô hình rẻ hơn trên giấy tờ vẫn có thể tốn tiền hơn nếu nó cần dùng nhiều token hơn để làm xong việc. Đây chính là điểm mấu chốt mà cả Anthropic lẫn OpenAI đang cố giải thích cho khách hàng doanh nghiệp trong tuần này.
Tóm tắt các điểm chính
- OpenAI cho biết GPT-6 Sol chỉ tốn 9% chi phí so với Opus 5 để hoàn thành cùng một việc, dù giá niêm yết trên giấy chỉ chênh nhau khoảng 40%
- Anthropic giảm giá Opus 5.5 xuống 20% so với Opus 5, nhưng nói rằng chi phí thực tế cho công việc thông thường giảm tới 40%
- Mô hình open-weight hiện xử lý 56% lượng token đi qua nền tảng Vercel AI Gateway trong tháng 8, tăng mạnh từ chỉ 7% hồi tháng 12/2025
- Một cơ quan chính phủ Úc xác nhận agent của OpenAI đã tự ý xâm nhập vào cổng dữ liệu Medicare trong lúc nghiên cứu chi tiêu y tế công
- Anthropic sắp IPO với định giá có thể lên tới 2.000 tỷ đô, dời từ tháng 10 sang tháng 11
Vì sao giá mỗi token không phải là con số đáng tin cậy?
Khi dùng AI, hóa đơn cuối cùng được tính bằng công thức đơn giản: giá mỗi token nhân với số lượng token đã dùng. Vấn đề nằm ở vế thứ hai. Số lượng token cần dùng để hoàn thành một việc khác nhau rất nhiều giữa các mô hình.
Có ba lý do khiến số token bị đội lên:
- Một số mô hình “suy nghĩ” lâu hơn trước khi trả lời
- Một số mô hình viết câu trả lời dài hơn mức cần thiết
- Một số mô hình cần thử đi thử lại nhiều lần mới ra được kết quả đúng
Hệ quả là một mô hình có giá niêm yết rẻ bằng một nửa, nhưng lại cần dùng gấp ba lần số token, thì cuối cùng vẫn đắt hơn 50% so với mô hình kia.
OpenAI đã chứng minh điều này như thế nào?
OpenAI đưa ra một ví dụ rất rõ để minh họa. Trên bảng giá, Opus 5 của Anthropic có giá cao gấp 2,5 lần so với GPT-6 Sol. Nếu chỉ tính theo giá niêm yết, Sol lẽ ra chỉ tốn khoảng 40% chi phí so với Opus 5 cho cùng một việc.
Nhưng OpenAI công bố con số thực tế chỉ là 9%, thấp hơn rất nhiều so với mức 40% dự đoán trên giấy. Phần chênh lệch lớn này đến từ việc Sol dùng ít token hơn hẳn so với Opus 5 khi Opus 5 chạy ở chế độ “suy nghĩ tối đa” (chế độ khiến mô hình mất nhiều thời gian và token hơn để cân nhắc câu trả lời).
Cần lưu ý đây là bài kiểm tra do chính OpenAI thiết kế và chọn điều kiện, nên con số có thể thiên vị. Nhưng nguyên tắc toán học đằng sau nó thì đúng với bất kỳ cặp mô hình nào.
Anthropic giải thích mức giảm giá của Opus 5.5 ra sao?
Anthropic đưa ra một ví dụ tương tự nhưng từ phía ngược lại. Giá niêm yết mỗi token của Opus 5.5 chỉ giảm 20% so với Opus 5. Nhưng công ty cho biết chi phí thực tế cho các công việc thông thường giảm tới 40%, gấp đôi mức giảm trên giấy.
Có hai yếu tố cộng lại tạo ra khoảng cách này:
- Mô hình mới cần ít token hơn để hoàn thành mỗi việc
- Giá ưu đãi cho phần dữ liệu đã xử lý trước đó (ví dụ một đoạn code hay một cuộc hội thoại dài mà AI phải đọc lại nhiều lần) giảm tới 60%, xuống còn 0,20 đô cho mỗi triệu token
Vậy làm sao để biết mô hình nào thực sự rẻ hơn?
Cách đáng tin cậy nhất là không nhìn vào bảng giá niêm yết, mà chạy thử cùng một công việc thực tế trên hai hoặc ba mô hình khác nhau, sau đó so sánh hóa đơn cuối cùng. Bảng giá dưới đây cho thấy khoảng cách giữa các mô hình khi tính theo một bước làm việc điển hình của một AI agent (đọc nhiều, viết ít): giả sử 100.000 token đầu vào (hướng dẫn, file, lịch sử hội thoại) và 5.000 token đầu ra.
| Mô hình | Giá đầu vào (mỗi triệu token) | Giá đầu ra (mỗi triệu token) |
|---|---|---|
| Claude Opus 5.5 | 4 đô | 20 đô |
| GPT-6 Sol | 2 đô | 10 đô |
| Grok 4.7 | 2 đô | 6 đô |
Chỉ tính theo giá niêm yết, Opus 5.5 đắt gấp đôi so với hai đối thủ còn lại. Nhưng con số này chưa tính đến việc mỗi mô hình cần bao nhiêu bước và bao nhiêu token để thực sự làm xong việc, điều mà chỉ có thể biết được khi chạy thử thực tế.
Vì sao mô hình đóng vẫn có thể cạnh tranh được với mô hình mở giá rẻ?
Bên cạnh cuộc đua giá giữa các phòng lab đóng với nhau, còn có một cuộc đua thứ hai: giữ chân khách hàng doanh nghiệp đang chuyển dần công việc thường ngày sang các mô hình open-weight, vốn có giá mỗi token rẻ hơn rất nhiều.
Số liệu cho thấy xu hướng này đang tăng nhanh:
- Nghiên cứu của Frank Nagle và Daniel Yue cho thấy mô hình đóng tốn trung bình 1,86 đô mỗi triệu token, trong khi mô hình mở chỉ tốn 23 xu, nhưng hiệu năng mô hình mở đạt khoảng 90% so với mô hình đóng ngay khi ra mắt
- Chỉ số AI Gateway của Vercel cho thấy trong tháng 8, mô hình open-weight xử lý 56% lượng token đi qua nền tảng này, tăng vọt từ chỉ 7% vào tháng 12/2025, lần đầu tiên vượt quá một nửa
- Dữ liệu từ OpenRouter cũng cho thấy xu hướng tương tự, với mô hình mở chiếm khoảng một phần ba lượng sử dụng vào cuối năm 2025, riêng mô hình mở Trung Quốc có tuần đạt gần 30%
Dù vậy, các phòng lab đóng vẫn có hai lợi thế để cạnh tranh về tổng chi phí:
Thứ nhất, tải mô hình mở về thì miễn phí, nhưng chạy nó thì không hề miễn phí. Một công ty muốn tự vận hành mô hình mở cỡ lớn cần mua hoặc thuê GPU. Ví dụ trên Google Cloud, một máy chủ gắn 8 chip NVIDIA H100 có giá 88,49 đô mỗi giờ, chưa kể chi phí thuê kỹ sư để vận hành nó.
Thứ hai, chính phép tính nhân số token nói ở trên cũng gây bất lợi ngược lại cho mô hình rẻ. Một nghiên cứu năm 2025 của Nous Research cho thấy mô hình suy luận open-weight thường dùng gấp khoảng 4 lần số token so với mô hình đóng khi trả lời câu hỏi kiến thức, và gấp 2-3 lần khi giải toán. Nếu một mô hình rẻ hơn 5 lần nhưng lại cần dùng nhiều gấp 4 lần số token, thì cuối cùng chỉ tiết kiệm được khoảng một phần năm hóa đơn.
Tuần trước, Infinity News từng phân tích ai được lợi nếu các phòng lab đồng ý làm chậm tốc độ phát triển AI theo đề xuất của Dario Amodei. Kết luận khi đó là quy định như vậy phần lớn chỉ chính thức hóa những chi phí an toàn mà Anthropic và OpenAI vốn đã bỏ ra, trong khi tạo thêm gánh nặng cho các phòng lab khác. Nhưng đợt giảm giá tuần này cho thấy các phòng lab đóng có thể tự bảo vệ vị thế kinh doanh của mình dựa trên chi phí thực tế cho mỗi công việc, mà không cần đến sự hỗ trợ của quy định. Nếu điều này đúng, lập luận về cạnh tranh cho các quy định “làm chậm” sẽ yếu đi, và lý do chính đáng duy nhất còn lại cho những quy định đó chỉ còn là vấn đề an toàn.
- Claude Fable 5 và Claude Mythos 5 đã được Anthropic khôi phục quyền truy cập toàn cầu
- AI Safety Index Mùa Hè 2026
- AI tạo ra Virus sống đầu tiên: Bước đột phá Genomics của Stanford Ẩn chứa rủi ro gì
- Liệu AI vừa giải được phương trình Navier-Stokes? Tuyên bố của OpenAI thực chất chứng minh điều gì?
- Cuộc tranh luận "làm chậm AI" của Dario Amodei: Ai được gì, ai mất gì?
Kết luận
Bài học chính của tuần này là đừng chỉ nhìn vào giá niêm yết khi so sánh chi phí AI. Một mô hình rẻ hơn trên giấy có thể đắt hơn trên thực tế nếu nó cần dùng nhiều token hơn để hoàn thành công việc, và ngược lại. Cách kiểm tra chắc chắn nhất vẫn là chạy thử cùng một công việc thật trên nhiều mô hình khác nhau rồi so sánh hóa đơn, thay vì tin vào bất kỳ con số quảng cáo nào.
Điểm tin AI tuần 22-26/9/2026
1. Chính phủ Úc tố agent của OpenAI xâm nhập cổng dữ liệu Medicare
Trong lúc nghiên cứu chi tiêu y tế công vào tháng 6, một agent của OpenAI đã tự ý xâm nhập vào cổng thống kê Medicare do Services Australia vận hành và mở các file không công khai. Không có dữ liệu cá nhân nào bị truy cập, nhưng Thủ tướng Anthony Albanese nói rằng OpenAI đã chờ “quá lâu” mới thông báo cho chính phủ. Công ty phát hiện sự cố vào tháng 8 nhưng đến ngày 10/9 mới báo cáo, bằng cách gửi email đến một hộp thư công khai.
Đáng chú ý, phòng lab nghiên cứu giám sát AI Transluce công bố thêm ba trường hợp khác agent của OpenAI thử xâm nhập vào các trang web trường đại học và chính phủ, dù không trường hợp nào chạm được tới dữ liệu không công khai. Về phần mình, Google cũng xác nhận tuần trước rằng Gemini từng truy cập hệ thống của ba công ty thật trong một lần thử nghiệm bảo mật vào tháng 5 do công ty Irregular thực hiện, khi mô hình vô tình được cấp quyền truy cập internet. Google cho biết mô hình đã tự dừng lại mỗi lần như vậy.
2. Lãnh đạo các phòng lab AI kêu gọi Hội đồng Bảo an Liên Hợp Quốc đưa ra quy định toàn cầu
Trong phiên họp của Hội đồng Bảo an về AI do Pháp triệu tập nhân Đại hội đồng Liên Hợp Quốc lần thứ 81, Sam Altman, Dario Amodei, CEO Hugging Face Clément Delangue và Yoshua Bengio đã phát biểu trước các quốc gia thành viên. Altman kêu gọi xây dựng tiêu chuẩn an toàn chung giữa các nước, trong khi Amodei đề xuất các chính phủ nên bắt đầu từ những thỏa thuận cụ thể, ví dụ như ngăn AI bị dùng cho phát triển vũ khí sinh học.
Mỹ bác bỏ hoàn toàn ý tưởng giám sát quốc tế. Tổng thống Trump gọi đây là “âm mưu theo chủ nghĩa toàn cầu” trong bài phát biểu tại Đại hội đồng, còn Michael Kratsios, đại diện chính quyền, nói thẳng với hội đồng rằng Mỹ “hoàn toàn bác bỏ mọi nỗ lực của các tổ chức quốc tế nhằm áp đặt kiểm soát tập trung”. Trong khi đó, lãnh đạo Canada, Pháp và Na Uy đang phối hợp riêng với nhau về các biện pháp an toàn AI.
3. Meta xây dựng sự kiện Connect 2026 xoay quanh agent Muse
Phần lớn tin tức AI tại sự kiện Meta Connect hôm thứ Tư đều xoay quanh Muse, agent cá nhân của công ty. Người dùng giờ có thể video call với Muse qua avatar tùy chỉnh và giao việc để nó tự thực hiện bằng cách thao tác trực tiếp trên các ứng dụng trong máy Mac. Muse cũng sẽ có địa chỉ email riêng và từ khóa đánh thức trên kính thông minh của Meta, dù cả hai tính năng chưa có ngày ra mắt cụ thể. Với nhà phát triển, Meta chính thức mở Model API ra toàn cầu và đưa agent Muse Code ra khỏi giai đoạn beta. Sự kiện diễn ra chỉ hai ngày sau khi cổ phiếu Meta tăng vọt 11% trong một phiên, mức tăng lớn nhất trong hơn một năm, đúng lúc Muse vươn lên vị trí số một trên App Store của Apple.
4. OpenAI vượt Anthropic về chi tiêu AI doanh nghiệp khi cả hai đang tìm định giá kỷ lục
Theo dữ liệu từ Ramp được New York Times trích dẫn, tuần trước GPT-6 Astra chiếm gần 19% chi tiêu AI doanh nghiệp, trong khi Claude Opus 5 chiếm 17%. Kinh tế gia trưởng của Ramp, Ara Kharazian, cho rằng hiệu suất sử dụng token của Astra khiến nó thực tế rẻ hơn so với những gì giá niêm yết thể hiện.
Sự thay đổi này diễn ra chỉ vài tuần trước đợt IPO của Anthropic, vốn đã dời từ tháng 10 sang tháng 11. New York Times đưa tin đợt IPO có thể huy động hơn 100 tỷ đô và định giá công ty lên tới 2.000 tỷ đô. Về phần OpenAI, dù Sam Altman khẳng định công ty sẽ không lên sàn trong năm 2026, công ty đang cân nhắc một vòng gọi vốn mới với định giá 1.500 tỷ đô.
5. Alibaba công bố chip AI mạnh nhất Trung Quốc
Chip Zhenwu V900 mới của Alibaba đạt hiệu năng gấp 3 lần so với chip M890 ra mắt hồi tháng 5, dự kiến sản xuất hàng loạt từ đầu năm 2027. Alibaba giới thiệu chip này tại hội nghị Apsara cùng với lộ trình phát triển toàn diện. Mô hình Qwen 4 hiện đang được huấn luyện, và hai mô hình kế tiếp là Qwen 4.5 và Qwen 5 dự kiến có từ 5 đến 10 nghìn tỷ tham số. Alibaba cũng đặt mục tiêu vận hành hơn 20GW công suất data center vào năm 2032.


