Tóm tắt các điểm chính
- Claude Opus 4.7 dẫn đầu lập trình cấp repository với 64.3% SWE-bench Pro, GPT-5.4 dẫn Terminal-Bench 2.0 với 75.1%
- Opus 4.7 tính giá cố định trên toàn bộ context window 1M tokens, GPT-5.4 định giá lại toàn bộ phiên khi vượt ngưỡng 272K tokens
- GPT-5.4 rẻ hơn gần một nửa cho tác vụ ngữ cảnh ngắn dưới 100K tokens (0.40 USD vs 0.75 USD)
- Opus 4.7 đạt 78.0% OSWorld-Verified cho desktop computer use, GPT-5.4 đạt 89.3% BrowseComp cho nghiên cứu web
- Tokenizer mới của Opus 4.7 tạo nhiều hơn tới 35% tokens so với 4.6 cho cùng input
Opus 4.7 và GPT-5.4 được định vị như thế nào?

OpenAI định vị GPT-5.4 ra sao?
OpenAI định vị GPT-5.4 là model đa năng thống nhất. GPT-5.4 hấp thụ khả năng lập trình trước đây tồn tại trong GPT-5.3-Codex, vì vậy developers không còn cần định tuyến requests đến các endpoints khác nhau theo loại tác vụ. Một model, một endpoint, bất kể tác vụ là gì.
Anthropic định vị Opus 4.7 hẹp hơn thế nào?
Anthropic định vị Opus 4.7 hẹp hơn: một model được tối ưu hóa cho lập trình, agents, computer use và quy trình doanh nghiệp, với tự chủ tầm xa là điểm phân biệt chính. Bạn giao công việc kỹ thuật khó và tin tưởng model để bắt lỗi của chính nó trước khi báo cáo lại. Đáng lưu ý rằng Opus 4.7 là model có khả năng nhất của Anthropic được phát hành rộng rãi, nhưng không phải model đỉnh của họ. Claude Mythos Preview nằm phía trên nó, bị hạn chế cho các quy trình an ninh mạng phòng thủ.
Sự phân biệt đó thể hiện ở các trường hợp cực đoan: các phiên lập trình chạy rất dài hoặc pipelines kết nối hàng chục công cụ.
Lập trình và quy trình tự động khác nhau như thế nào?
Opus 4.7 có tính năng gì nổi bật cho lập trình?
Opus 4.7 dẫn đầu trên các benchmarks mà mỗi nhà cung cấp chọn báo cáo về lập trình cấp repository. Opus 4.7 giới thiệu self-output verification, có nghĩa là model kiểm tra công việc của chính nó trước khi báo cáo lại, và Genspark đặc biệt gọi ra khả năng chống lặp vòng của nó: Opus 4.7 ít có khả năng bị mắc kẹt lặp trên một vấn đề duy nhất. Đó là loại điều bạn chỉ quan tâm một khi bạn đã có một agent lặp trong 40 phút trên không có gì.

GPT-5.4 có ưu điểm gì?
GPT-5.4 dẫn đầu Terminal-Bench 2.0 khoảng sáu điểm (75.1% so với 69.4%), mặc dù Anthropic đánh dấu rằng con số của GPT-5.4 đến từ một harness tự báo cáo. GPT-5.4 cũng giới thiệu điều chỉnh kế hoạch giữa phản hồi thông qua Interactive Thinking: trong quá trình suy luận phức tạp, bạn có thể can thiệp trước khi model hoàn thành tạo và chuyển hướng nó nếu đường đi trông sai. Opus 4.7 không có tính năng tương đương. Khoảng cách SWE-bench là thực: sáu điểm trên một benchmark do nhà cung cấp chọn là tín hiệu hữu ích, không phải phán quyết.
Context window và công việc ngữ cảnh dài khác nhau ra sao?
Cả hai model hỗ trợ context window thế nào?
Cả hai models đều hỗ trợ khoảng 1M tokens. Điều khác biệt là những gì xảy ra với hóa đơn của bạn khi bạn sử dụng context đó. Opus 4.7 tính phí cố định trên toàn bộ window, vì vậy một request 900K tokens có chi phí mỗi token giống như một request 9K. GPT-5.4 tính phí 2.50 USD cho mỗi triệu dưới 272K input tokens, nhưng vượt qua ngưỡng đó và toàn bộ phiên được định giá lại. Infinity News sẽ đề cập các con số chính xác trong phần giá.
Tokenizer mới ảnh hưởng thế nào?
Có một vấn đề tokenizer: Opus 4.7 có thể ánh xạ cùng văn bản đến nhiều hơn tới 35% tokens so với 4.6. Giá mỗi token không thay đổi, nhưng chi phí hiệu quả cho mỗi tác vụ có thể tăng.
Về hiệu năng long-context thực tế, kiểm thử đối tác đặt Opus 4.7 ngang hàng cho điểm số nhất quán cao nhất trên sáu modules nghiên cứu ở 0.715. RAG pipelines lấp đầy gần giới hạn 1M nên được kiểm thử trên workload riêng của bạn trước khi dựa vào benchmarks của nhà cung cấp.
Sử dụng công cụ và tương tác môi trường khác nhau thế nào?
Desktop computer use so sánh như thế nào?
Các bề mặt công cụ trông tương tự trên giấy tờ và khác biệt hơn trong thực tế. Trên OSWorld-Verified (desktop computer use), Opus 4.7 giờ dẫn đầu ở 78.0% so với 75.0% của GPT-5.4, với cả hai trên baseline chuyên gia con người 72.4%. Bức tranh đảo ngược trên nghiên cứu web dựa trên trình duyệt: GPT-5.4 đạt 89.3% trên BrowseComp (biến thể Pro) so với 79.3% của Opus 4.7. Một tiêu đề computer use duy nhất che khuất sự phân chia desktop-versus-browser.
Nâng cấp đa phương thức của Opus 4.7 là gì?
Nâng cấp đa phương thức headline của Opus 4.7 là độ phân giải thị giác: hình ảnh lên tới 2,576 pixels trên cạnh dài, khoảng 3.75 megapixels, hơn ba lần các Claude models trước, được xử lý ở độ trung thực cao hơn tự động không có tham số API. XBOW, một đối tác kiểm thử bảo mật, báo cáo độ nhạy thị giác nhảy từ 54.5% trên Opus 4.6 lên 98.5% trên 4.7, mức tăng single-benchmark sắc nhất trên bất kỳ đánh giá đối tác nào trong phiên bản này.
Kiến trúc công cụ khác nhau ra sao?
Hai model cũng khác nhau về kiến trúc công cụ. Hệ thống tool search của GPT-5.4 tải definitions theo yêu cầu thay vì nhúng tất cả chúng vào prompt, cắt giảm token overhead trong các hệ sinh thái công cụ lớn. Opus 4.7 suy luận qua một vấn đề trước khi tìm công cụ, sử dụng ít tool calls hơn tổng thể. Việc sử dụng công cụ tăng ở các mức effort cao hơn.
Khả năng điều khiển và phong cách output khác nhau thế nào?
Opus 4.7 xử lý lệnh như thế nào?
Opus 4.7 lấy lệnh theo nghĩa đen. Model sẽ không khái quát hóa từ một mục sang mục khác hoặc suy luận các requests bạn không thực hiện, vì vậy prompts được viết cho 4.6 có thể hoạt động bất ngờ. Anthropic khuyến nghị điều chỉnh lại. Mặt tích cực là độ tin cậy trong các vòng lặp tự động dài: team kỹ thuật của Ramp lưu ý cần ít hướng dẫn từng bước hơn đáng kể trong các quy trình nhiều công cụ, và kiểm thử của Hexagon thấy Opus 4.7 ở low effort khoảng tương đương với Opus 4.6 ở medium.
Các mức effort mới là gì?
Anthropic cũng giới thiệu xhigh như một mức effort mới giữa high và max, và nâng mặc định của Claude Code lên xhigh cho tất cả các gói. Kết hợp với tokenizer mới, số lượng output tokens có thể chạy cao hơn so với 4.6 trên các lượt tự động sau. Task Budgets (giờ ở public beta) cho phép bạn giới hạn những gì một agent chi tiêu trong một phiên.
Câu chuyện steerability của GPT-5.4 tập trung vào Interactive Thinking, và hướng dẫn prompt của OpenAI lưu ý model hoạt động tốt khi được cung cấp các output contracts rõ ràng.
Benchmarks kiểm thử cho kết quả gì?
Coding benchmarks so sánh như thế nào?
Bảng dưới đây bao gồm bằng chứng lập trình liên quan nhất từ tài liệu phát hành của mỗi nhà cung cấp:
| Benchmark | Claude Opus 4.7 | GPT-5.4 | Ghi chú |
|---|---|---|---|
| SWE-bench Pro | 64.3% | 57.7% | Do nhà cung cấp báo cáo; các cấu hình harness khác nhau |
| SWE-bench Verified | 87.6% | Không công bố | OpenAI chưa phát hành điểm số chính thức trên biến thể này |
| CursorBench | ~70% | Không công bố | Cursor là đối tác Anthropic; không độc lập |
| Terminal-Bench 2.0 | 69.4% | 75.1% | Anthropic lưu ý con số GPT-5.4 đến từ harness tự báo cáo; GPT-5.4 cũng giảm từ GPT-5.3-Codex (77.3%) |
| GPQA Diamond | 94.2% | 94.4% (Pro) | Về cơ bản ngang nhau; gần bão hòa ở mức này |
SWE-bench có nhiều biến thể và cả hai nhà cung cấp nhấn mạnh biến thể nơi họ hoạt động tốt nhất. Anthropic áp dụng các màn hình memorization và báo cáo rằng biên của Opus 4.7 giữ nguyên sau khi loại trừ các vấn đề được đánh dấu. Đáng lưu ý ngữ cảnh: GLM-5.1 open-weight của Z.ai tạm thời dẫn đầu SWE-bench Pro ở 58.4% vào đầu tháng 4 năm 2026 trước khi 64.3% của Opus 4.7 đến, vì vậy bất kỳ tuyên bố state of the art nào ở đây đều có thời hạn sử dụng ngắn.
Agent và computer-use benchmarks như thế nào?
Với phát hành Opus 4.7, Anthropic công bố các con số so sánh cho cả hai models trên hầu hết các agentic benchmarks. Bức tranh là hỗn hợp hơn là một chiều.
| Benchmark | Claude Opus 4.7 | GPT-5.4 | Ghi chú |
|---|---|---|---|
| OSWorld-Verified | 78.0% | 75.0% | Desktop computer use; cả hai trên baseline chuyên gia con người 72.4% |
| BrowseComp | 79.3% | 89.3% (Pro) | Nghiên cứu web với suy luận multi-hop; GPT-5.4 dẫn |
| MCP-Atlas | 77.3% | 68.1% | Sử dụng công cụ quy mô lớn trên nhiều dịch vụ kết nối |
| WebArena-Verified | Không công bố | 67.3% | Tác vụ điều hướng web tự động |
| Toolathlon | Không công bố | 54.6% | Điều phối công cụ nhiều bước; tăng từ 46.3% trên GPT-5.2 |
| Finance Agent v1.1 | 64.4% | 61.5% (Pro) | Agent nghiên cứu tài chính long-context |
| GDPval-AA | 1753 Elo | 1674 Elo | Công việc kiến thức chuyên nghiệp; Opus 4.7 dẫn 79 điểm Elo |
| BigLaw Bench | 90.9% ở high effort | Không công bố | Tác vụ tài liệu pháp lý; đánh giá đối tác Harvey |
Bức tranh phân chia theo môi trường: Opus 4.7 thắng trên desktop, tool use và knowledge work. GPT-5.4 thắng trên nghiên cứu trình duyệt. Một số con số GPT-5.4 đến từ biến thể Pro, vì vậy tier tiêu chuẩn có thể đạt điểm thấp hơn.
Giá Opus 4.7 vs GPT-5.4 khác nhau thế nào?
Cấu trúc giá API như thế nào?
Sự khác biệt về giá dễ hiểu nhất thông qua một vài scenarios cụ thể.

Ở request 100K tokens input và 10K tokens output (dưới ngưỡng 272K của GPT-5.4), GPT-5.4 có giá khoảng 0.40 USD so với 0.75 USD của Opus 4.7. Gần một nửa giá cho công việc ngữ cảnh ngắn đến trung bình.
Ở 500K input và 20K output, vượt qua ngưỡng của GPT-5.4, hai models có giá khoảng giống nhau: 2.95 USD so với 3.00 USD. Ở 900K input và 10K output, chúng gần như giống hệt nhau.
Ngưỡng định giá lại 272K hoạt động như thế nào?
Ngưỡng định giá lại 272K là phần khiến mọi người bất ngờ: nó áp dụng cho toàn bộ phiên, không chỉ các tokens trên cutoff. Một pipeline thường xuyên gửi prompts 280K tokens trả mức long-context đầy đủ trên mọi request duy nhất, không chỉ 8K thêm. Đây là định giá lại cấp phiên, không phải phụ phí cận biên.
Như Infinity News đã đề cập trong phần context window, tokenizer mới có thể ánh xạ cùng input đến nhiều hơn tới 35% tokens so với Opus 4.6. Giá mỗi token không thay đổi, nhưng chi phí thực tế của bạn cho mỗi tác vụ có thể tăng. Đo trên traffic thực; ngoại suy từ baselines 4.6 sẽ cho bạn một con số quá thấp.
Giảm giá nào có sẵn?
Cả hai platforms đều cung cấp khoảng 90% giảm giá trên cached input tokens: 0.50 USD cho mỗi triệu cho Opus 4.7, 0.25 USD cho mỗi triệu cho GPT-5.4 dưới 272K. Batch APIs thêm khoảng 50% giảm giá khác cho công việc không khẩn cấp. Cho workloads không đồng bộ, những giảm giá đó là đòn bẩy lớn nhất trên cả hai platforms.
Cũng có chi phí per-tool thường bị bỏ lỡ. Anthropic tính phí 10 USD cho mỗi 1,000 web searches, cộng chi phí tokens tiêu chuẩn cho nội dung được truy xuất. OpenAI tính phí cho file search storage và queries riêng biệt. Những điều này cộng dồn trong pipelines tool-heavy.
Claude Opus 4.7 có tốt hơn GPT-5.4 không?
Khi nào nên chọn Claude Opus 4.7?
Chọn Claude Opus 4.7 nếu công việc chính của bạn là kỹ thuật phần mềm chạy dài nơi self-verification quan trọng, agent của bạn vận hành desktop applications, prompts của bạn thường xuyên vượt quá 272K tokens, quy trình công việc của bạn đọc screenshots dày đặc hoặc sơ đồ kỹ thuật, hoặc bạn đã ở trên Claude Code, Cursor, Replit hoặc Devin.

Khi nào nên chọn GPT-5.4?
Chọn GPT-5.4 nếu agent của bạn thực hiện nghiên cứu web dựa trên trình duyệt nặng, workloads của bạn ở dưới 272K tokens và chi phí quan trọng, bạn muốn deferred tool loading trên một hệ sinh thái công cụ lớn, hoặc team của bạn đã ở trên OpenAI Responses API.
Khi nào nên kiểm thử cả hai?
Xem xét kiểm thử cả hai nếu công việc của bạn phân chia giữa nghiên cứu web tự động và lập trình dài. Điểm mạnh trình duyệt và terminal của GPT-5.4 phù hợp với quy trình web tự động. Khả năng chống lặp vòng và giá cố định của Opus 4.7 hoạt động tốt hơn cho các phiên kỹ thuật sâu và pipelines tài liệu nặng.
Một điều cắt ngang cả hai lựa chọn: Giảm giá Batch API có thể quan trọng hơn quyết định model cho workloads không đồng bộ. Và vì các benchmarks độc lập cho Opus 4.7 vẫn đang bắt kịp, một pilot trên một phần thực của công việc riêng của bạn đáng giá hơn bất kỳ bài viết so sánh nào, bao gồm cả bài này.
- Anthropic với OpenAI: So sánh hai gã khổng lồ trong lĩnh vực AI
- So sánh Gemini CLI với Claude Code: Công cụ lập trình AI nào phù hợp với bạn
- So sánh DeepSeek với Claude: Model AI nào phù hợp với công việc của bạn năm 2026?
- So sánh NanoClaw với OpenClaw: Đâu là trợ lý AI cá nhân phù hợp cho bạn
- So sánh Muse Spark với Claude Opus 4.6: Model AI nào nên chọn?
- So sánh Claude Opus 4.7 với Gemini 3.1 Pro: Model AI nào tốt hơn cho lập trình viên và công việc tự động?
- So sánh GPT-5.5 với Claude Opus 4.7: Model AI nào tốt hơn cho công việc phức tạp?
- So sánh GPT-5.5 với DeepSeek V4: Model AI nào phù hợp với bạn?
- So sánh DeepSeek V4 Flash với GPT-5.4 Mini và Nano: Chọn model nhỏ nào cho pipeline AI năm 2026?
- So sánh GPT-5.5 với Gemini 3.1 Pro: chọn model nào cho workflow của bạn?
Kết luận
Khoảng cách giữa Claude Opus 4.7 và GPT-5.4 ít về model nào thông minh hơn và nhiều về hình dạng công việc bạn đang làm.
Anthropic đặt cược vào tự chủ: một model được xây dựng để giữ coherence qua các lần chạy kỹ thuật dài và kiểm tra output của chính nó. OpenAI đặt cược vào độ rộng: một bề mặt công cụ rộng hơn và mức giá rẻ hơn cho phần lớn prompts ở dưới 272K tokens.
Giá là nơi hầu hết teams bị bắt bất ngờ, và như Infinity News đã đề cập trước đó, thay đổi giá ở phiên 272K là cái bẫy cụ thể. Điều thực sự di chuyển chi tiêu hàng tháng nhiều hơn lựa chọn mức giá cơ bản thường là caching và giảm giá Batch API trên cả hai platforms.
Khoảng cách benchmarks là các chữ số đơn, và cả hai nhà cung cấp đã shipping các models mới mỗi vài tuần. Chọn cái phù hợp với stack thực tế của bạn và xem xét lại trong một tháng.
Nguồn: Infinity News – trang tin tức chuyên cung cấp các bài phân tích chuyên sâu về Khoa học, Công nghệ và Đời sống, giúp cập nhật các xu hướng mới nhất. Trang web tập trung vào kiến thức, đổi mới và sáng tạo, mang đến thông tin hữu ích cho độc giả quan tâm đến sự phát triển của công nghệ và tác động của nó đến cuộc sống.


