Tóm tắt các điểm chính
- Claude Opus 4.7 cải thiện 10.9 điểm phần trăm trên SWE-bench Pro so với Opus 4.6, đạt 64.3% vượt GPT-5.4 và Gemini 3.1 Pro
- Hỗ trợ hình ảnh tới 3.75 megapixels, gấp 3 lần phiên bản cũ, đạt 86.6% trong CharXiv benchmark thị giác
- Mythos Preview nội bộ Anthropic đạt 77.8% SWE-bench Pro và 93.9% SWE-bench Verified nhưng chưa phát hành rộng rãi
- Giá không đổi so với Opus 4.6: 5 USD cho 1 triệu input tokens, 25 USD cho 1 triệu output tokens
- Thêm mức effort mới xhigh, lệnh /ultrareview trong Claude Code và task budgets trên API
Claude Opus 4.7 là gì?
Claude Opus 4.7 là mô hình ngôn ngữ lớn flagship mới nhất của Anthropic, đứng đầu họ model Claude phía trên Sonnet và Haiku. Opus 4.7 kế thừa Claude Opus 4.6 và được thiết kế cho các tác vụ đòi hỏi cao nhất, chẳng hạn như quy trình công việc tự động phức tạp và tác vụ suy luận nhiều bước yêu cầu hiệu năng bền vững qua các phiên làm việc dài.

So với Opus 4.6, phiên bản 4.7 tập trung vào ba lĩnh vực:
- Lập trình tự động mạnh hơn
- Cải thiện suy luận thị giác
- Hiệu năng tốt hơn khi sử dụng công cụ ở quy mô lớn
Mythos Preview nội bộ của Anthropic mà chúng ta đã đề cập trước đó dẫn đầu trên nhiều benchmarks, nhưng không được phát hành rộng rãi. Opus 4.7 về cơ bản là một model anh em được huấn luyện với khả năng an ninh mạng được giảm cố ý.
Có gì mới với Claude Opus 4.7?
Tuân thủ lệnh được cải thiện như thế nào?
Opus 4.7 tuân thủ lệnh chặt chẽ hơn các models trước đó. Đây tất nhiên là tính năng hữu ích cho bất kỳ loại quy trình công việc nào phụ thuộc vào độ tin cậy, nhưng cũng có thể có hậu quả ngoài ý muốn. Anthropic kêu gọi người dùng điều chỉnh lại prompts và harnesses của họ, vì các lệnh mà models trước đó bỏ qua hoặc diễn giải lỏng lẻo giờ sẽ được hiểu theo nghĩa đen.
Hỗ trợ đa phương thức được nâng cấp ra sao?
Khả năng xử lý hình ảnh độ phân giải cao được cải thiện để hỗ trợ hình ảnh lên tới 3.75 megapixels, cao hơn ba lần so với các models cũ chấp nhận. Các tác nhân sử dụng máy tính và quy trình trích xuất dữ liệu có thể hưởng lợi lớn từ mức độ chi tiết tăng lên này, vì chúng phụ thuộc vào khả năng đọc và độ chính xác, đôi khi lên tới mức pixel.
Bộ nhớ được cải thiện như thế nào?
Opus 4.7 tốt hơn trong bộ nhớ dựa trên hệ thống file, đề cập đến một pattern nơi model ghi ghi chú vào files khi làm việc và đọc lại chúng trong các lần chạy tương lai.
Claude Code là setting rõ ràng cho điều này: một file CLAUDE.md ở root của dự án mà Claude đọc khi phiên bắt đầu, cập nhật khi các quyết định được đưa ra và sử dụng khi bạn quay lại làm việc.
Tốt hơn ở đây có nghĩa là phán đoán tốt hơn về những gì đáng ghi lại và khả năng nhớ lại đáng tin cậy hơn trong các lượt sau. Anthropic cho biết điều này cho phép các tác vụ mới cần ít ngữ cảnh trước hơn, điều mà nếu bạn từng giải thích lại quy ước dự án của mình cho một model lần thứ năm, bạn sẽ đánh giá cao.
Vậy nên, điểm chính thực sự: Nếu bạn đang sử dụng Opus 4.7 cho công việc nhiều phiên, hãy để nó giữ ghi chú. Model sẽ làm tốt công việc đó hơn Opus 4.6, mặc dù Infinity News nghĩ Opus 4.6 đã giữ ghi chú khá tốt.
Benchmarks Claude Opus 4.7 như thế nào?
Lập trình tự động cải thiện bao nhiêu?
Trên SWE-bench Pro, Opus 4.7 đạt điểm 64.3%, vượt GPT-5.4 ở 57.7%, Gemini 3.1 Pro ở 54.2% và Opus 4.6 ở 53.4%. Trên SWE-bench Verified, Opus 4.7 đạt 87.6% so với Gemini 3.1 Pro ở 80.6% và Opus 4.6 ở 80.8%. GPT-5.4 không có điểm số được công bố trên SWE-bench Verified trong so sánh này.

SWE-bench kiểm tra khả năng của model để giải quyết các vấn đề GitHub thực tế trong các kho Python mã nguồn mở. Pro là biến thể khó hơn với các vấn đề phức tạp hơn. Mức tăng 10.9 điểm so với Opus 4.6 trên SWE-bench Pro là cải thiện lớn nhất trong phiên bản này (theo điểm phần trăm) và đặt Opus 4.7 rõ ràng vượt trước cả hai đối thủ cạnh tranh lớn trong tác vụ này.
Chỉ Mythos Preview nội bộ của Anthropic đạt điểm 77.8% trên SWE-bench Pro và 93.9% trên SWE-bench Verified, cho thấy vẫn còn headroom phía trên Opus 4.7. Tuy nhiên, Mythos không được phát hành rộng rãi, vì vậy cho sử dụng sản xuất, Opus 4.7 là trần hiện tại.
Kết quả về Terminal-Bench 2.0, benchmark chính cho lập trình tự động trong terminal, khá thú vị. Opus 4.7 cải thiện nhẹ so với phiên bản trước (69.4% vs 65.4%) và vượt qua Gemini 3.1 Pro với điểm 68.5%.
Điều đó nói rằng, Opus 4.7 không thể cạnh tranh với GPT-5.4 (75.1%) trong khía cạnh này, mặc dù caveat tự báo cáo về điểm số của GPT-5.4 đáng để ghi nhớ khi so sánh. Tuy nhiên, điều này có thể đáng thất vọng cho Anthropic rằng flagship model mới nhất (đã phát hành) của họ không dẫn đầu một benchmark trung tâm cho phát triển phần mềm tự động.
Suy luận được cải thiện như thế nào?
Humanity’s Last Exam là một bộ sưu tập câu hỏi cấp sau đại học trên khoa học, toán học và nhân văn, được thiết kế để khó khăn cho các frontier models hiện tại. Opus 4.7 dẫn đầu biến thể no-tools, kiểm tra suy luận thuần túy mà không có truy xuất bên ngoài. Khoảng cách with-tools ủng hộ GPT-5.4 (58.7%) là lĩnh vực rõ ràng nhất nơi Opus 4.7 (54.7%) không dẫn đầu.

Suy luận cấp sau đại học thường được đo trong GPQA-Diamond, khá bão hòa ngày nay: Giống như tất cả frontier models hiện tại, cả bốn models so sánh đạt điểm trên 90% và về cơ bản ngang nhau.
Kết quả benchmark thú vị hơn nhắm vào sinh học, một trong các lĩnh vực cũng được kiểm tra trong GPQA-Diamond cụ thể. Trong khi Infinity News không thể so sánh nó với các competitor models, bước nhảy giữa Opus 4.6 (30.9%) và Opus 4.7 (74.0%) chắc chắn đáng chú ý.
Suy luận thị giác cải thiện bao nhiêu?
Kết quả trong CharXiv benchmark, đo suy luận thị giác về biểu đồ và hình ảnh khoa học, phản ánh rằng đây là một trong những lĩnh vực tập trung chính trong phát triển Opus 4.7.

Cải thiện 13 điểm no-tools là mức tăng tương đối lớn nhất trong phiên bản này. Không có điểm số đối thủ để so sánh, khó để nói Opus 4.7 nằm ở đâu trong lĩnh vực rộng hơn trong tác vụ này, nhưng cải thiện so với Opus 4.6 là đáng kể.
Hỗ trợ hình ảnh độ phân giải cao hơn có khả năng là một trong những lý do cho suy luận thị giác được cải thiện. Biểu đồ điểm số Screenspot-Pro ở các độ phân giải khác nhau cho thấy sự tăng độ chính xác khổng lồ mà Opus 4.7 nhận được từ độ phân giải cao hơn, đặc biệt không có tool use (79.5% vs 69.0%).
Sử dụng công cụ và máy tính tự động như thế nào?
MCP-Atlas kiểm tra hiệu năng trên các quy trình công việc phức tạp, nhiều công cụ. Opus 4.7 đạt điểm 77.3% ở đây, cao nhất trong bất kỳ model nào trong so sánh. Model duy nhất vượt điểm số MCP-Atlas của Opus 4.7 rất nhẹ là Muse Spark, được báo cáo ở 78.3%.
OSWorld kiểm tra khả năng của model để hoàn thành tác vụ bằng cách kiểm soát giao diện máy tính, nhấp chuột, gõ và điều hướng các ứng dụng. Opus 4.7 đạt điểm 78.0%, tăng từ 72.7% trong Opus 4.6. GPT-5.4 đạt điểm 75.0%, và Gemini 3.1 Pro không có điểm số được công bố trên benchmark này. Mythos Preview đạt điểm 79.6%, chỉ cao hơn Opus 4.7 một chút.
Đây chắc chắn là một lĩnh vực mà Opus 4.7 xuất sắc: Model dẫn đầu cả MCP-Atlas và OSWorld-Verified với khoảng cách đáng kể so với flagship cạnh tranh từ Google và OpenAI, là kết quả mạnh cho bất kỳ ai xây dựng các hệ thống tác nhân sản xuất dựa vào điều phối công cụ và các tác nhân sử dụng máy tính.
Phân tích tài chính được cải thiện ra sao?
Kỹ năng phân tích tài chính của model xứng đáng được đề cập đặc biệt: Opus 4.7 dẫn đầu Finance Agent v1.1 leaderboard (64.4%), vượt đáng kể cả GPT-5.4 (61.5%) và Gemini 3.1 Pro (59.7%).

Trong Vending-Bench 2 hướng thực tế hơn, Infinity News thấy rằng Opus 4.7 tốt hơn với tiền. Trung bình, model kết thúc với số tiền 10,937 USD, so với 8,018 USD với Opus 4.6.
Truy cập Claude Opus 4.7 như thế nào?
Anthropic không để người dùng chờ đợi. Opus 4.7 hiện khả dụng trong:
- Tất cả sản phẩm Claude
- Claude API (claude-opus-4-7)
- Amazon Bedrock
- Vertex AI
- Microsoft Foundry
Giá Claude Opus 4.7 là bao nhiêu?
Người dùng luôn lo lắng, đặc biệt là bây giờ, về lạm phát. Nhưng may mắn thay, giá giống như Opus 4.6. Đó là 5 USD cho mỗi triệu input tokens và 25 USD cho mỗi triệu output tokens. Không có tăng giá giữa Opus 4.6 và Opus 4.7.
Như một lưu ý chung, nếu bạn đang sử dụng Opus trong Claude.ai: Mỗi tin nhắn bạn gửi bao gồm toàn bộ cuộc trò chuyện cho đến nay (câu hỏi mới của bạn + tất cả qua lại trước đó) cộng với trả lời của model. Tất cả điều đó được đo bằng tokens. Gói của bạn, dù là gì, có một token budget được nạp lại trên một cửa sổ cuộn.
Các models khác nhau tính phí khác nhau đối với budget đó. Opus đắt nhất vì mạnh nhất. Một tỷ lệ được công bố gần đúng: Opus tốn khoảng 5 lần Sonnet cho mỗi token.
So sánh Claude Opus 4.7 vs GPT-5.4 như thế nào?
Infinity News xem xét kỹ kết quả benchmark, và các kết quả đó chứa trong chúng một so sánh với các models khác. Ở mức độ cao, so sánh Opus 4.7 với GPT-5.4 trực tiếp:
Điểm chính cơ bản là Opus 4.7 tối ưu hóa cho tự chủ tầm xa. GPT-5.4 là một model đa năng thống nhất với hỗ trợ công cụ rộng hơn và giá ngắn hạn rẻ hơn.
| Claude Opus 4.7 | GPT-5.4 | |
|---|---|---|
| Tốt nhất ở | Lập trình chạy dài, sử dụng máy tính desktop, thị giác dày đặc | Nghiên cứu trình duyệt, tác vụ ngữ cảnh ngắn, steering giữa phản hồi |
| SWE-bench Pro | 64.3% | 57.7% |
| BrowseComp | 79.3% | 89.3% |
| Giá | Tỷ lệ cố định trên 1M context | Rẻ hơn dưới 272K, định giá lại toàn bộ phiên trên |
| Context window | ~1M tokens | ~1M tokens |
Người dùng nói gì về Claude Opus 4.7?
Một số người dùng báo cáo rằng pipelines của họ đang hoạt động sai vì Opus 4.7 đang tuân theo lệnh theo nghĩa đen hơn trước. Anthropic đã cảnh báo về nhu cầu điều chỉnh lại prompts.
Người dùng khác quan tâm về sử dụng token. Là một phần của phiên bản, Anthropic nâng giới hạn tỷ lệ cho tất cả người dùng để tính đến việc sử dụng token cao hơn, nhưng không hoàn toàn rõ ràng liệu đó có phải là một offset thực sự hay không.
- GPT-5.4: Tính Năng, Benchmark và Giá
- So sánh GLM-5 với GPT-5.3-Codex: Mô hình AI nào phù hợp với Agentic Workflow của bạn?
- Cursor Composer 2: rẻ hơn 86%, mạnh hơn Claude Opus 4.6, nhưng có giới hạn cứng cần biết
- Cursor 3 là gì và nó thay đổi cách lập trình như thế nào?
- Muse Spark là gì? Meta trở lại cuộc đua AI frontier với model mạnh nhất từ trước đến nay
- GPT-5.5 có gì mới? Benchmark, giá và phân loại an toàn của model mới nhất từ OpenAI
- DeepSeek V4 có gì mới? Benchmark, giá và so sánh với GPT-5.5 và Claude Opus 4.7
- GPT-Realtime-2 là gì? Ba model giọng nói mới của OpenAI và những gì thay đổi
- SubQ là gì? Model 12 triệu token của startup Subquadratic và những tuyên bố táo bạo cần kiểm chứng
- TML-Interaction-Small là gì? Thinking Machines Lab tái định nghĩa AI giọng nói với Interaction Model
Kết luận
Claude Opus 4.7 là model có khả năng nhất mà hầu hết mọi người thực sự có thể sử dụng ngay bây giờ. Các cải tiến đều chỉ vào cùng một hướng: công việc tác nhân chạy dài hơn, ít giám sát hơn, với lập trình mạnh hơn, thị giác sắc nét hơn và bộ nhớ cross-session tốt hơn hỗ trợ điều đó.
Điều làm cho phiên bản này thú vị là framing Mythos. Opus 4.7 là một test vehicle bị ràng buộc an ninh mạng trên con đường đến phiên bản Mythos-class rộng hơn, có nghĩa là giờ có một trần rõ ràng phía trên nó bạn không thể truy cập, nhưng cũng rằng các biện pháp bảo vệ vận chuyển với 4.7 là một preview về cách Anthropic lập kế hoạch xử lý các phiên bản frontier tiến lên.
Có gì khác ra mắt cùng Opus 4.7?
Mức effort mới xhigh là gì?
Một mức xhigh (extra high) effort mới giờ nằm giữa high và max. Điều này cho bạn một tùy chọn khác khi chọn giữa độ sâu suy luận và độ trễ. Trong Claude Code, mức effort mặc định đã được nâng lên xhigh trên tất cả các gói, và Anthropic khuyến nghị bắt đầu với high hoặc xhigh khi kiểm thử Opus 4.7 trên các tác vụ lập trình và tự động.
Lệnh /ultrareview là gì?
Claude Code có lệnh slash mới /ultrareview, chạy một review pass chuyên dụng qua các thay đổi của bạn và đánh dấu lỗi hoặc vấn đề thiết kế mà một người đánh giá con người cẩn thận sẽ bắt được. Người dùng Pro và Max nhận ba ultrareviews miễn phí để thử nghiệm.
Auto mode cho Max users là gì?
Max users giờ có quyền truy cập vào auto mode, một setting quyền hạn nơi Claude đưa ra quyết định thay mặt bạn. Đó là một middle ground giữa phê duyệt mọi bước và bỏ qua quyền hạn hoàn toàn.
Task budgets trên API là gì?
Task budgets giờ ở public beta trên Claude API. Chúng cho phép developers giới hạn chi tiêu token của Claude qua một lần chạy, đặc biệt hữu ích cho các quy trình công việc tác nhân dài hơn nơi bạn muốn model tự điều chỉnh tốc độ thay vì đốt cháy budget của nó.


