Phía mở ghi nhận các mô hình nhỏ gọn chạy được trên laptop tiêu chuẩn cùng hai bước tiến lớn ở tầng frontier, trong khi phía đóng đồng loạt cập nhật mô hình flagship và mô hình nhẹ để cải thiện workflow và giảm chi phí vận hành. Dù người dùng chọn mô hình mở, đóng hay cả hai, cả hai hệ sinh thái đều đang mạnh lên và đa dạng hơn theo từng tuần.
Tóm tắt các điểm chính
- Muse Glimmer của Meta chỉ 30 tỷ tham số nhưng chạy được trên GPU tiêu dùng đơn lẻ, không cần cloud
- DeepSeek-V4-Pro đạt 1,6 nghìn tỷ tham số, context window 1 triệu token, xếp ngay dưới Kimi K3 và Fable 5
- Grok 4.6 của SpaceXAI ngang bằng Fable 5 và GPT-5.6 Sol Max trên Artificial Analysis Intelligence Index
- MAI-Code-1.1-Flash của Microsoft giảm chi phí vận hành xuống còn 1/4 so với phiên bản trước
- Qwen 3.8 Max chính thức mở trọng số trên Hugging Face, hiện có thể là mô hình mở mạnh thứ hai thế giới, chỉ sau Kimi K3
Những mô hình open-weight nào đáng chú ý nhất tuần này
Phía mở ghi nhận bốn cái tên đáng chú ý: Muse Glimmer và Muse Spark 1.2 từ Meta, Nemotron 3.5 Lightning từ NVIDIA, DeepSeek-V4-Pro, và trọng số chính thức của Qwen 3.8 Max. Đây là tuần mà cả mô hình cỡ nhỏ chạy cục bộ lẫn mô hình frontier quy mô lớn đều có bước tiến rõ rệt.
Muse Glimmer chạy được trên laptop thông thường như thế nào?
Muse Glimmer là mô hình 30 tỷ tham số của Meta, được thiết kế cho tác vụ agent cục bộ chạy liên tục, có thể tải trọng số trực tiếp từ Hugging Face và chạy dễ dàng trên Mac hoặc PC tiêu chuẩn với một GPU tiêu dùng đơn lẻ. Mô hình xử lý được workflow nhiều bước, gọi công cụ và tự phục hồi khi gặp lỗi mà không cần kết nối cloud. Song song đó, Meta cũng công bố kế hoạch mở trọng số Muse Spark 1.2, mô hình mạnh tiệm cận hiệu năng của GPT-5.6 Terra và Opus 5.

Nemotron 3.5 Lightning tối ưu tốc độ ra sao?
NVIDIA ra mắt Nemotron 3.5 Lightning, mô hình mixture-of-experts mở 30 tỷ tham số nhưng chỉ kích hoạt 3 tỷ tham số mỗi token, cho tốc độ xuất văn bản nhanh gấp 4 lần các mô hình cùng cỡ. Kiến trúc này khiến Nemotron 3.5 Lightning trở thành lựa chọn hiệu quả cho coding sub-agent và tác vụ bảo mật thông thường chạy trên phần cứng cục bộ, hướng đến các tác vụ tự động khối lượng lớn cần tốc độ cao.
DeepSeek-V4-Pro cạnh tranh trực tiếp với Kimi K3 và Fable 5 ở đâu?
DeepSeek chính thức phát hành phiên bản production của DeepSeek-V4-Pro, mô hình mixture-of-experts 1,6 nghìn tỷ tham số, hỗ trợ context window 1 triệu token và kiến trúc tối ưu giảm chi phí điện toán.
| Mô hình | Số tham số | Context window | Vị trí benchmark nội bộ |
|---|---|---|---|
| DeepSeek-V4-Pro | 1,6 nghìn tỷ | 1 triệu token | Thấp hơn nhẹ so với Kimi K3, Fable 5 |
| Kimi K3 | 2,8 nghìn tỷ | 1 triệu token | Dẫn đầu open-weight |
| Qwen 3.8 Max | 2,4 nghìn tỷ | Không công bố | Top 5 LLM Arena |
Dù xếp sau Kimi K3 và Fable 5 trên benchmark nội bộ, DeepSeek-V4-Pro vẫn là lựa chọn mạnh cho tác vụ coding phức tạp và workflow agentic kéo dài, đặc biệt nhờ chi phí điện toán thấp hơn.

Qwen 3.8 Max mở trọng số thay đổi gì so với tuần trước?
Qwen 3.8 Max, mô hình được Alibaba công bố tuần trước, chính thức có trọng số mở trên Hugging Face trong tuần này, đưa nó trở thành một trong những mô hình mở mạnh nhất thế giới, có thể chỉ đứng sau Kimi K3. Việc mở trọng số hoàn tất chu kỳ ra mắt của Qwen 3.8 Max, cho phép cộng đồng phát triển tự triển khai và tinh chỉnh mô hình thay vì chỉ truy cập qua API.
Các mô hình đóng nào được nâng cấp trong tuần này?
Ba nhà cung cấp lớn đồng loạt cập nhật mô hình đóng: Google với Gemini 3.7 Flash, SpaceXAI với Grok 4.6, và Microsoft với MAI-Code-1.1-Flash.
Gemini 3.7 Flash cải thiện gì so với phiên bản trước?
Gemini 3.7 Flash tập trung vào kỹ thuật phần mềm và workflow agent, cắt giảm giá token khởi điểm xuống còn một nửa so với phiên bản tiền nhiệm. Mô hình xử lý tốt hơn các lĩnh vực đòi hỏi kiến thức chuyên sâu như tài chính và luật, đồng thời tạo layout web hoạt động được với ít prompt hơn. Bản cập nhật này hiện đang vận hành Gemini Spark. Đáng chú ý, Gemini 3.7 Flash ra mắt giữa lúc thị trường vẫn chờ đợi Gemini 3.5 Pro vốn đã chậm tiến độ nhiều tháng theo Bloomberg, một trong những nguyên nhân có thể dẫn đến đợt tái cấu trúc lãnh đạo DeepMind được công bố tuần trước.
Grok 4.6 đạt vị trí nào trên bảng xếp hạng năng lực tổng hợp?
SpaceXAI phát hành Grok 4.6, mô hình nâng cấp cho tác vụ agent dài hạn và thiết kế thị giác, đạt điểm ngang bằng Fable 5 và GPT-5.6 Sol Max trên Artificial Analysis Intelligence Index, chỉ số tổng hợp từ 9 benchmark khác nhau. Đội nghiên cứu SpaceXAI định vị Grok 4.6 có khả năng biến ý tưởng sản phẩm còn mơ hồ thành phiên bản đầu tiên hoạt động được, thông qua nghiên cứu lĩnh vực chưa quen thuộc, cấu trúc ứng dụng và lặp lại theo phản hồi.

MAI-Code-1.1-Flash giảm chi phí vận hành ra sao?
Microsoft tích hợp trực tiếp MAI-Code-1.1-Flash vào GitHub Copilot, cải thiện hiệu suất token 25% và chất lượng code tổng thể trong khi cắt chi phí vận hành xuống còn 1/4 so với phiên bản trước. Đáp lại phản hồi từ nhà phát triển, Microsoft tập trung mô hình vào tác vụ command-line interface và hiệu năng .NET, đạt cải thiện 22% trên Terminal-Bench 2.1 và 15% trên tác vụ .NET. Trong môi trường thực tế, mô hình xuất token nhanh hơn 25% và dùng ít hơn 25% token để hoàn thành một tác vụ.
Điểm tin AI tuần 11-15/8/2026
DeepSeek ra mắt đối thủ mã nguồn mở của Claude Code
DeepSeek phát hành DeepSeek Harness, framework mã nguồn mở cho phép nhà phát triển xây dựng và quản lý AI agent, đạt 90.000 sao trên GitHub chỉ trong chưa đầy một ngày dù vẫn ở giai đoạn developer preview và có thể còn lỗi. Tương tự Claude Code của Anthropic, DeepSeek Harness là trợ lý coding agentic có khả năng đọc và chỉnh sửa codebase dự án. Tuy nhiên, trong khi Claude Code là sản phẩm hoàn chỉnh, độc quyền với hệ thống phân quyền tích hợp sẵn, DeepSeek Harness hoạt động như hạ tầng có thể tùy biến, cho phép nhà phát triển xây dựng lại hoặc mở rộng chính agent đó. Vì hỗ trợ mô hình từ nhiều nhà cung cấp khác nhau, framework này cho phép xây dựng workflow tùy chỉnh chạy cục bộ mà không bị giới hạn trong một môi trường đóng duy nhất.
NVIDIA hợp tác với Phố Wall lập quỹ hạ tầng AI 500 tỷ đô
NVIDIA ký thỏa thuận với 6 tổ chức tài chính lớn, bao gồm BlackRock và Goldman Sachs, thành lập chương trình tài trợ 500 tỷ đô cho data center AI. Cơ chế này cho phép các ngân hàng độc lập cung cấp vốn, giúp khách hàng công nghệ xây dựng cơ sở hạ tầng tốn kém mà không phải gánh nợ doanh nghiệp trực tiếp. Động thái này giúp NVIDIA giải quyết chỉ trích gần đây về tài trợ vòng tròn, khi công ty từng đầu tư tiền mặt vào startup rồi startup dùng chính khoản đó để mua phần cứng NVIDIA. Bằng cách dựa vào vốn bên ngoài, công ty bảo toàn được dự trữ tiền mặt và cho thấy nhu cầu thị trường độc lập. Tuy nhiên rủi ro cấu trúc vẫn tồn tại: Jensen Huang tiết lộ trên X rằng NVIDIA có thể vẫn phải bảo lãnh tới 25% các khoản vay mới này nếu startup vay vốn không có lãi và vỡ nợ.
Anthropic thêm watermark vô hình cho nội dung do AI tạo ra
Anthropic triển khai hệ thống đánh dấu nội dung tự động trên toàn bộ dòng mô hình Claude để đáp ứng yêu cầu minh bạch theo EU AI Act, áp dụng hai phương pháp khác nhau tùy định dạng. Với văn bản, hệ thống thêm các mẫu thống kê vô hình có thể tồn tại qua chỉnh sửa nhẹ. Với hình ảnh, hệ thống thêm metadata nguồn gốc có chữ ký, cho phép người dùng biết file có bị can thiệp hay không. Dù được kích hoạt bởi EU AI Act, bản cập nhật này áp dụng toàn cầu và không có tùy chọn tắt, được thực hiện ở tầng mô hình nên áp dụng cho mọi ứng dụng hoặc công cụ sử dụng mô hình Anthropic. Công ty lưu ý rằng việc phát hiện dấu watermark không xác nhận AI viết toàn bộ nội dung từ đầu, vì người dùng thường dùng Claude để dịch hoặc hiệu đính văn bản do con người viết. Ngược lại, việc không có dấu watermark cũng không đảm bảo nội dung do con người tạo ra.
Kết luận
Tuần này cho thấy cuộc đua model release không còn chỉ là chuyện của các phòng lab hàng đầu mà đã lan rộng thành một mặt trận song song giữa mô hình mở chạy được trên phần cứng tiêu dùng và mô hình đóng ngày càng rẻ hơn để vận hành ở quy mô doanh nghiệp. Với tốc độ phát hành hiện tại, khoảng cách năng lực giữa hai hệ sinh thái đang thu hẹp nhanh hơn khoảng cách chi phí, một xu hướng đáng theo dõi cho bất kỳ tổ chức nào đang lựa chọn stack AI dài hạn.


