Trợ lý AI
9 Khung Prompt
Dùng những khung này để ra prompt rõ ràng, có cấu trúc — làm chủ AI trong công việc.
R-T-F
- RVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- TNhiệm vụ: Nêu rõ nhiệm vụ bạn muốn AI thực hiện.
- FĐịnh dạng: Nêu rõ định dạng bạn muốn AI trả lời.
Ví dụ
- Vai trò
- Bạn là một chiến lược gia thương hiệu.
- Nhiệm vụ
- Viết sơ đồ tin nhắn cho người sáng lập B2B SaaS nhắm đội ngũ nội bộ.
- Định dạng
- Các gạch đầu dòng với mục tiêu cốt lõi, đề xuất giá trị, bằng chứng và CTA.
S-O-L-V-E
- SVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- OTình huống: Nêu rõ tình huống bạn muốn AI xem xét.
- LMục tiêu: Nêu rõ mục tiêu bạn muốn AI hướng tới.
- VGiới hạn: Nêu rõ giới hạn bạn muốn AI tuân thủ.
- EThực hiện: Nêu rõ cách thực hiện bạn muốn AI áp dụng.
Ví dụ
- Tình huống
- Bạn là trưởng nhóm nội dung tại một startup vừa ra mắt nền tảng B2B.
- Mục tiêu
- Tạo nội dung inbound thu hút khách hàng tiềm năng và nâng cao nhận diện thương hiệu.
- Giới hạn
- Không dùng thuật ngữ nội bộ. Phải đơn giản và dễ hiểu.
- Tầm nhìn
- Trở thành người dẫn đầu tư tưởng trong ngành SaaS vận hành.
- Thực thi
- Xem lại hiệu suất và tối ưu nội dung dựa trên dữ liệu.
T-A-G
- TNhiệm vụ: Nêu rõ nhiệm vụ bạn muốn AI thực hiện.
- AHành động: Nêu rõ hành động bạn muốn AI thực hiện.
- GMục tiêu: Nêu rõ mục tiêu bạn muốn AI đạt được.
Ví dụ
- Nhiệm vụ
- Giảm tỷ lệ khách hàng rời bỏ trong doanh nghiệp SaaS.
- Hành động
- Phân tích dữ liệu rời bỏ và đề xuất chương trình giữ chân khách hàng.
- Mục tiêu
- Cải thiện tỷ lệ giữ chân khách hàng thêm 15% trong 6 tháng tới.
R-A-C-E
- RVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- AHành động: Nêu rõ hành động bạn muốn AI thực hiện.
- CNgữ cảnh: Nêu rõ ngữ cảnh bạn muốn AI hiểu.
- EKỳ vọng: Nêu rõ kỳ vọng bạn muốn AI đáp ứng.
Ví dụ
- Vai trò
- Bạn là chuyên gia tư vấn chiến lược thị trường B2B.
- Hành động
- Xây dựng khung tiếp cận khách hàng qua email, cấu trúc tin nhắn và CTA.
- Ngữ cảnh
- Quy trình bán hàng hiện tại của khách hàng là quy trình mua tự phục vụ.
- Kỳ vọng
- Cung cấp mẫu email, vai trò trong quy trình, và quy trình mua sắm (PO, RFP, SOW, v.v.).
D-R-E-A-M
- DVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- RMục tiêu: Nêu rõ mục tiêu bạn muốn AI hướng tới.
- EThực hiện: Nêu rõ cách thực hiện bạn muốn AI áp dụng.
- APhân tích: Nêu rõ nội dung cần phân tích bạn muốn AI xem xét.
- MĐo lường: Nêu rõ thước đo bạn muốn AI sử dụng.
Ví dụ
- Xác định
- Giảm tỷ lệ rời bỏ trong B2B SaaS.
- Nghiên cứu
- Điều tra nguyên nhân rời bỏ qua phỏng vấn và CRM.
- Thực thi
- Triển khai chương trình giữ chân 3 tháng với onboarding cải tiến.
- Phân tích
- So sánh hành vi giữa nhóm giữ chân và nhóm rời bỏ.
- Đo lường
- Theo dõi tỷ lệ rời bỏ, tần suất sử dụng sản phẩm, và NPS.
P-A-C-T
- PVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- ACách tiếp cận: Nêu rõ cách tiếp cận bạn muốn AI thực hiện.
- CƯu tiên: Nêu rõ những điều cần ưu tiên bạn muốn AI tập trung.
- TKiểm tra: Nêu rõ cách kiểm tra bạn muốn AI áp dụng.
Ví dụ
- Vấn đề
- Tỷ lệ chuyển đổi thấp từ bản dùng thử sang gói trả phí.
- Cách tiếp cận
- Thiết kế lại onboarding để làm nổi bật giá trị cốt lõi trong 3 ngày đầu.
- Ưu tiên
- Ưu tiên thay đổi mang lại tác động nhanh và dễ triển khai.
- Kiểm tra
- Đo lường hiệu quả qua thử nghiệm A/B trước và sau khi cập nhật.
C-A-R-E
- CVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- AHành động: Nêu rõ hành động bạn muốn AI thực hiện.
- RKết quả: Nêu rõ kết quả mong muốn bạn muốn AI đạt được.
- EVí dụ: Nêu rõ ví dụ minh hoạ bạn muốn AI cung cấp.
Ví dụ
- Ngữ cảnh
- Một công ty SaaS có tỷ lệ tương tác thấp trong luồng onboarding.
- Hành động
- Thiết kế lại hành trình onboarding tập trung vào tính năng cốt lõi.
- Kết quả
- Tăng tỷ lệ áp dụng sản phẩm trong 7 ngày đầu.
- Ví dụ
- Hiển thị cách làm lại từng bước onboarding giúp tăng kích hoạt từ 25% lên 42%.
R-I-S-E
- RVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận.
- IĐầu vào: Nêu rõ thông tin đầu vào bạn muốn AI xem xét.
- SCác bước: Nêu rõ các bước bạn muốn AI thực hiện.
- EKỳ vọng: Nêu rõ kỳ vọng bạn muốn AI đáp ứng.
Ví dụ
- Vai trò
- Giám đốc thương mại.
- Đầu vào
- Dữ liệu hiệu suất quý, phản hồi khách hàng và dự báo pipeline.
- Các bước
- Xác định điểm yếu, ưu tiên khách hàng tiềm năng, và tối ưu nguồn lực.
- Kỳ vọng
- Đề xuất kế hoạch để tăng mục tiêu doanh thu trong quý tới.
R-C-T-F-C
- RVai trò: Nêu rõ vai trò bạn muốn AI đảm nhận (vd: chuyên viên 10 năm kinh nghiệm).
- CBối cảnh: Nêu rõ tình huống, đối tượng nhận và ràng buộc.
- TNhiệm vụ: Nêu rõ nhiệm vụ cụ thể bạn muốn AI thực hiện.
- FĐịnh dạng: Nêu rõ định dạng đầu ra (bảng / email / gạch đầu dòng / giới hạn từ).
- CTiêu chí: Nêu rõ giọng văn, điều cấm, số phương án cần đưa.
Ví dụ
- Vai trò
- Bạn là chuyên viên chăm sóc khách hàng 10 năm kinh nghiệm.
- Bối cảnh
- Khách bị giao hàng trễ lần 2, đang khó chịu; cần xoa dịu và giữ khách.
- Nhiệm vụ
- Viết email xin lỗi khách giao hàng trễ lần 2.
- Định dạng
- Email ngắn dưới 150 từ, gồm 5 gạch đầu dòng.
- Tiêu chí
- Giọng chân thành, không đổ lỗi; đưa 2 phương án bù đắp.
Claude mạnh tới đâu? So với chính nó, với ChatGPT và Gemini
Điểm benchmark của Claude (Opus 5, Sonnet 5, Fable/Mythos 5 và các đời Opus trước), ChatGPT (GPT-5.6 Sol · Terra · Luna) và Gemini (3.1 Pro, 3.1 Deep Think, 3.6 Flash) gom trong một bảng. Mọi con số lấy trực tiếp từ system card và trang chính thức của từng hãng, hoặc từ đơn vị giữ benchmark — không lấy qua blog tổng hợp.
| Model | Lập trình & agent | Suy luận & khoa học | Dùng máy tính & việc thật | Giáin / out · 1M tok | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SWE Verified | SWE Pro | Terminal 2.1 | GPQA Diamond | ARC-AGI-2 | ARC-AGI-3 | MMMU-Pro | OSWorld 2.0 | OSWorld-Verified | GDPval-AA v2 | LMArena Elo | AA Intelligence Index | ||
| Anthropic · Claude | |||||||||||||
| Claude Opus 5mới nhất24/07/2026 · 1M ctx | 96.0%, cao nhất cột●max · TB 5 lần | 79.2%●max effort | 89%, cao nhất cột○AA đo · max | chưa công bố | 90.4%●max effort | 30.2%, cao nhất cột●high effort | chưa công bố | 70.6%, cao nhất cột●TB 5 lần chạy | chưa công bố | 1861Elo, cao nhất cột●max · xhigh 1827 | 1495Elo○opus-5-high ±8 | 61/100, cao nhất cột○max effort | $5 / $25 |
| Claude Sonnet 530/06/2026 · 1M ctx | 85.2%●TB 5 lần | 63.2%● | 80.4%, thấp nhất cột●mini-SWE · xhigh | chưa công bố | chưa công bố | chưa công bố | chưa công bố | chưa công bố | 81.2%●max effort | 1618Elo●chốt 17/06/2026 | chưa công bố | 53/100○max effort | $2 / $10 |
| Claude Mythos 509/06/2026 · 1M ctx | 95.5%●TB 5 lần | 80.3%, cao nhất cột● | 88.0%●mini-SWE · high · 445 trial | 94.1%●TB 5 lần | chưa công bố | chưa công bố | chưa công bố | chưa công bố | 85.0%, cao nhất cột● | chưa công bố | chưa công bố | chưa công bố | $10 / $50 |
| Claude Fable 509/06/2026 · 1M ctx | 95.0%●TB 5 lần | 80.0%● | 84.3%●mini-SWE · 20.9% fallback* không xếp hạng | chưa công bố | chưa công bố | chưa công bố | chưa công bố | 66.1%●theo card Opus 5 | 85.0%, cao nhất cột● | 1747Elo●OpenAI đo được 1759.8 | 1508Elo, cao nhất cột○hạng 1 ±6 | 60/100○có fallback | $10 / $50 |
| Claude Opus 4.828/05/2026 · 1M ctx | 88.6%●bản near-final | 69.2%● | 82.7%●mini-SWE · Terminus-2: 74.6 | 93.6%●TB 25 lần | 72.1%●theo card Opus 5 | 1.5%●high effort | chưa công bố | 55.7%●theo card Opus 5 | 83.4%● | 1593Elo●OpenAI đo được 1600.1 | 1484Elo○bản thinking | 56/100○max effort | $5 / $25 |
| Claude Opus 4.716/04/2026 · 1M ctx | 87.6%●TB 5 lần | 64.3%● | chưa công bố | 94.2%●TB 10 lần | 75.8%●max thinking | chưa công bố | chưa công bố | chưa công bố | 82.8%●đã sửa lỗi zoom tool | chưa công bố | 1502Elo○bản thinking | chưa công bố | $5 / $25 |
| Claude Opus 4.605/02/2026 · 1M beta ctx | 80.8%● | 53.4%, thấp nhất cột●theo card Opus 4.7 | chưa công bố | 91.3%●TB 5 lần | 69.2%●high · 120k thinking | chưa công bố | 73.9%, thấp nhất cột●không tool | chưa công bố | 72.7%, thấp nhất cột● | chưa công bố | 1505Elo○bản thinking | chưa công bố | $5 / $25 |
| Claude Opus 4.524/11/2025 · 200K ctx | 80.9%●không extended thinking | chưa công bố | chưa công bố | 87.0%, thấp nhất cột●TB 5 lần | 37.6%●64k thinking | chưa công bố | chưa công bố | chưa công bố | 66.3%●ghi là “OSWorld”* không xếp hạng | chưa công bố | chưa công bố | chưa công bố | $5 / $25 |
| OpenAI · ChatGPT | |||||||||||||
| GPT-5.6 Solmới nhất09/07/2026 · 1.05M ctx | chưa công bố | 64.6%● | 88.8%●Ultra 4-agent: 91.9 | 94.6%, cao nhất cột● | 92.5%, cao nhất cột○max · high: 85.4 | 7.78%○max effort | 83.0%, cao nhất cột●có tool: 84.6 | 62.6%● | chưa công bố | 1748Elo●chính xác 1747.8 | 1485Elo○sol-xhigh | 59/100○max effort | $5 / $30 |
| GPT-5.6 Terra09/07/2026 · 1.05M ctx | chưa công bố | 63.4%● | 87.4%● | 92.9%● | 83.9%○max effort | 0.80%○max effort | 80.7%●có tool: 82.0 | 50.2%● | chưa công bố | 1593Elo● | chưa công bố | 55/100○max effort | $2.50 / $15 |
| GPT-5.6 Luna09/07/2026 · 1.05M ctx | chưa công bố | 62.7%● | 84.7%● | 92.3%● | 59.5%○max effort | 0.18%, thấp nhất cột○max effort | 78.4%●có tool: 79.5 | 45.6%, thấp nhất cột● | chưa công bố | 1592Elo●chính xác 1591.8 | chưa công bố | 51/100○max effort | $1 / $6 |
| Google · Gemini | |||||||||||||
| Gemini 3.1 Promới nhất19/02/2026 · 1M ctx | 80.6%●một lần chạy | 54.2%●tập public — khác tập* không xếp hạng | chưa công bố | 94.3%●không tool | 77.1%●ARC Prize xác nhận | chưa công bố | 80.5%●không tool | chưa công bố | chưa công bố | chưa công bố | 1486Elo○preview ±3 | 46/100, thấp nhất cột○bản preview | $2 / $12 |
| Gemini 3.1 Deep Think12/02/2026 | chưa công bố | chưa công bố | chưa công bố | 93.8%●bản Deep Think 11/2025 | 84.6%●chưa được ARC xác nhận | chưa công bố | 81.5%● | chưa công bố | chưa công bố | chưa công bố | chưa công bố | chưa công bố | — |
| Gemini 3.6 Flash21/07/2026 · 1M ctx | chưa công bố | chưa công bố | chưa công bố | chưa công bố | chưa công bố | chưa công bố | chưa công bố | chưa công bố | 83.0%● | 1421Elo, thấp nhất cột● | 1482Elo, thấp nhất cột○±8 | 50/100○ | $1.50 / $7.50 |
| Gemini 3 Pro18/11/2025 · 1M ctx | 76.2%, thấp nhất cột●một lần chạy | 43.3%●tập public — khác tập* không xếp hạng | chưa công bố | 91.9%● | 31.1%, thấp nhất cột● | chưa công bố | 81.0%● | chưa công bố | chưa công bố | chưa công bố | 1486Elo○Google từng nói 1501 | chưa công bố | — |
↔ Cuộn ngang (hoặc Tab vào bảng rồi dùng phím mũi tên) để xem hết các cột.
- Lập trình & agent — Quan trọng nhất nếu bạn dùng AI để code hoặc chạy agent. Lưu ý mỗi hãng chạy trên harness của riêng mình nên số cross-vendor chỉ mang tính tham khảo.
- Suy luận & khoa học — GPQA đã bão hoà tới mức Anthropic ngừng báo cáo. ARC-AGI mới là chỗ phân hoá thật — nhưng nhớ đọc kèm mức effort.
- Dùng máy tính & việc thật — Hai cột OSWorld là hai benchmark khác nhau, đừng so chéo. Opus 5 chỉ công bố bản 2.0, các đời trước chỉ công bố bản Verified.
- Lưu ý về màu — Chỉ hai đầu của mỗi cột được tô: xanh là điểm cao nhất, đỏ là điểm thấp nhất. Mọi điểm ở giữa để trần. Màu chỉ nói thứ hạng chứ không nói khoảng cách — ô xanh có khi chỉ hơn ô kế tiếp 0.5 điểm. Riêng ô ghi “không xếp hạng” thì đo trên phiên bản hoặc tập dữ liệu khác nên không tham gia so sánh.
Ghi chú từng model
- Claude Opus 5 — System card tự ghi nhận một điểm yếu đáng chú ý: “hallucinate các khẳng định mang tính sự kiện nhiều hơn Opus 4.8 một chút, dù tổng thể chính xác hơn”. Không công bố Terminal-Bench (thay bằng FrontierBench v0.1: 43.3%) và không công bố GPQA.
- Claude Sonnet 5 — Bản giá rẻ để chạy agent số lượng lớn. Giá ưu đãi $2/$10 đến 31/08/2026, từ 01/09 về $3/$15.
- Claude Mythos 5 — Tier trên Opus, chỉ mở cho đối tác được mời — số liệu là nội bộ Anthropic, bên ngoài không tự kiểm chứng lại được. Đây cũng là model duy nhất còn có số GPQA.
- Claude Fable 5 — Cùng model nền với Mythos 5 nhưng mở công khai. CẢNH BÁO của chính system card: trong lần chạy Terminal-Bench, 20.9% số trial bị safety classifier chặn và phải fallback sang Opus 4.8 chạy nốt — con số 84.3 không hoàn toàn là của riêng Fable 5. Đang giữ hạng 1 LMArena.
- Claude Opus 4.8 — Ví dụ điển hình cho việc “đổi harness là đổi điểm”: cùng Terminal-Bench 2.1, chạy Terminus-2 được 74.6% nhưng chạy mini-SWE-agent được 82.7%.
- Claude Opus 4.6 — Trên 200K token giá nhảy lên $10/$37.50. Đây là model Claude cuối cùng còn công bố MMMU-Pro.
- Claude Opus 4.5 — Mốc so sánh: 8 tháng trước Opus 5. Cột OSWorld của bản này ghi tên trần “OSWorld”, có trước khi Anthropic đặt lại tên thành OSWorld-Verified.
- GPT-5.6 Sol — Bản mạnh nhất bộ ba. OpenAI KHÔNG công bố SWE-bench Verified cho GPT-5.6 — chỉ công bố bản Pro, đúng nơi Sol (64.6%) kém Mythos 5 (80.3%) tới 16 điểm. Cấu hình “Sol Ultra” đạt 91.9% Terminal-Bench nhưng đó là 4 agent chạy song song, không phải một model.
- GPT-5.6 Luna — Bản rẻ nhất. Khoảng cách với Sol lộ rõ nhất ở ARC-AGI-2 (59.5 so với 92.5) — tức là càng cần suy luận mới lạ thì càng phải trả tiền.
- Gemini 3.1 Pro — Rẻ nhất trong nhóm đầu bảng; trên 200K token giá lên $4/$18. Google chỉ công bố Terminal-Bench 2.0 (68.5%), chưa có số bản 2.1 nên ô đó để trống.
- Gemini 3.1 Deep Think — Chế độ suy luận sâu, chỉ mở cho gói Google AI Ultra. Số ARC-AGI-2 84.6% là Google tự công bố — khác với bản 3.1 Pro, Google KHÔNG gắn nhãn “ARC Prize xác nhận” cho con số này.
- Gemini 3.6 Flash — Không phải tier flagship — Google định vị đây là bản tiết kiệm token. Đưa vào bảng để thấy tầng giá rẻ hiện đã mạnh tới đâu.
- Gemini 3 Pro — ĐÃ NGỪNG phục vụ trên Gemini API (Google gỡ khỏi cả trang giá). Giữ trong bảng làm mốc so sánh. Terminal-Bench 2.0 công bố lúc ra mắt là 54.2%, hiện Google ghi lại thành 56.9%.
Đọc nhanh
- Claude dẫn rõ mảng code: Opus 5 đạt 96.0% SWE-bench Verified, Mythos 5 95.5%, Fable 5 95.0% — so với 80.6% của Gemini 3.1 Pro. OpenAI không công bố chỉ số này cho GPT-5.6, chỉ công bố SWE-bench Pro, và ở đó Sol (64.6%) kém Mythos 5 (80.3%) tới gần 16 điểm.
- Ngược lại GPT-5.6 Sol thắng Terminal-Bench 2.1 (88.8% so với 88.0% của Mythos 5) và là hãng duy nhất công bố đủ bộ MMMU-Pro. Opus 5 không có số Terminal-Bench chính thức — Anthropic đã chuyển sang FrontierBench v0.1, còn 89% trong bảng là do Artificial Analysis đo.
- GPQA Diamond coi như xong: Anthropic tuyên bố thẳng trong system card rằng đây là benchmark “đã bão hoà” và sẽ ngừng báo cáo — nên Opus 5, Sonnet 5 và Fable 5 không có ô GPQA. Đó là chủ ý, không phải thiếu dữ liệu.
- ARC-AGI-3 vẫn là bức tường: Opus 5 đạt 30.2% (mức high), GPT-5.6 Sol 7.78% (mức max), Terra và Luna dưới 1%. Nhưng Opus 5 chạy ở high còn Sol ở max nên hai con số không hoàn toàn ngang nhau.
- Effort quan trọng ngang model: cùng GPT-5.6 Sol, ARC-AGI-2 là 42.5% ở mức low nhưng 92.5% ở mức max, chi phí mỗi task tăng từ $0.32 lên $1.44. Mọi con số benchmark không ghi kèm effort đều gần như vô nghĩa.
- Đừng đọc benchmark tách khỏi cảnh báo trong system card: Anthropic tự ghi Opus 5 “hallucinate nhiều hơn Opus 4.8 dù tổng thể chính xác hơn”, và lần chạy Terminal-Bench của Fable 5 có 20.9% số trial bị chặn rồi fallback sang Opus 4.8 chạy nốt.
- Về giá, Anthropic giữ nguyên $5/$25 cho tier Opus suốt từ 4.5 (11/2025) tới Opus 5 (07/2026) dù SWE-bench Verified đi từ 80.9% lên 96.0%. Gemini 3.1 Pro rẻ nhất nhóm đầu bảng ($2/$12), GPT-5.6 chia ba mức từ $1/$6 tới $5/$30.
Mỗi benchmark đo cái gì?
- SWE-bench Verified ↗
- Sửa bug thật trong repo GitHub (500 task đã được người thật kiểm định). OpenAI không công bố chỉ số này cho GPT-5.6.
- SWE-bench Pro ↗
- Bản khó hơn: repo lớn, task phải sửa nhiều file. Điểm thấp hơn Verified là bình thường.
- Terminal-Bench 2.1 ↗
- Model tự thao tác trên terminal để hoàn thành việc. Google chưa công bố bản 2.1 cho bất kỳ model Gemini nào (chỉ có 2.0).
- GPQA Diamond ↗
- Câu hỏi khoa học mức tiến sĩ. Anthropic đã tuyên bố benchmark này “bão hoà” và NGỪNG báo cáo từ Fable 5 trở đi — nên Opus 5, Sonnet 5, Fable 5 không có số.
- ARC-AGI-2 ↗
- Bài toán suy luận hoàn toàn mới, thiết kế để không học vẹt được. Điểm phụ thuộc rất mạnh vào mức effort.
- ARC-AGI-3 ↗
- Bậc khó nhất, gần như chưa model nào giải được — phần lớn còn dưới 10%.
- MMMU-Pro ↗
- Hiểu hỗn hợp ảnh + biểu đồ + văn bản trình độ đại học. Anthropic ngừng báo cáo từ Opus 4.7 trở đi.
- OSWorld 2.0 ↗
- Điều khiển máy tính, bản 2026: 1080p, tối đa 500 bước. KHÁC HẲN OSWorld-Verified — cùng Opus 4.8 được 83.4 trên Verified nhưng chỉ 55.7 ở đây.
- OSWorld-Verified ↗
- Bản computer-use cũ hơn: 361 task, tối đa 100 bước. Dùng để theo dõi Claude tiến bộ qua các đời.
- GDPval-AA v2 ↗
- Công việc tri thức thực tế do người chấm, quy ra Elo. Bản v2 đã đặt lại mốc chuyên gia người = 1000 nên KHÔNG so được với số v1 (thường ở mức 19xx).
- LMArena Elo ↗
- Người dùng bình chọn mù giữa 2 câu trả lời. Đo “thấy thích” chứ không đo năng lực kỹ thuật. Bản thinking và không-thinking chấm riêng.
- AA Intelligence Index ↗
- Chỉ số tổng hợp v4.1 của Artificial Analysis, gộp nhiều benchmark thành một điểm (thang 0–100).
Nguồn số liệu
- Anthropic — Claude Opus 5 System Card ↗
- Anthropic — Claude Fable 5 & Mythos 5 System Card ↗
- Anthropic — Claude Sonnet 5 System Card ↗
- Anthropic — Claude Opus 4.8 System Card ↗
- Anthropic — Claude Opus 4.7 System Card ↗
- Anthropic — Claude Opus 4.6 System Card ↗
- Anthropic — Claude Opus 4.5 System Card ↗
- Anthropic — bảng giá API ↗
- OpenAI — GPT-5.6 ↗
- OpenAI — bảng giá API ↗
- Google DeepMind — Gemini 3.1 Pro model card ↗
- Google DeepMind — Gemini 3.1 Deep Think ↗
- Google — Gemini 3 ↗
- Google — bảng giá Gemini API ↗
- ARC Prize — bảng xếp hạng ↗
- Artificial Analysis — bảng xếp hạng model ↗
- Artificial Analysis — phân tích Claude Opus 5 ↗
- Artificial Analysis — phương pháp đo ↗
- LMArena (arena.ai) — bảng xếp hạng text ↗
Bảng giá API các AI
Giá API (USD / 1 triệu token) của Gemini · Claude · ChatGPT · Grok · DeepSeek · Perplexity · NotebookLM để ước tính chi phí khi tích hợp.
Gemini (Google)
Hỗ trợ cả model miễn phí qua Google AI Studio và model sinh ảnh Imagen.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| Gemini 3.5 FlashPaidModel Flash thế hệ mới nhất | $1.50 | $9.00 |
| Gemini 3.1 ProPaidModel Pro hiệu năng cao | $2.00 | $12.00 |
| Gemini 3.1 Flash-LitePaidModel tối ưu chi phí cực tốt | $0.25 | $1.50 |
| Gemini 2.5 FlashFreeMiễn phí có giới hạn RPM trên Google AI Studio | Free | Free |
| Imagen 3🖼 ảnhPaidGiá khoảng $0.03 / ảnh | — | — |
Claude (Anthropic)
Không có model miễn phí và không hỗ trợ sinh ảnh qua API.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| Claude Fable 5PaidModel siêu trí tuệ thế hệ mới nhất | $10.00 | $50.00 |
| Claude Opus 4.8PaidModel Opus cao cấp cho tác vụ phức tạp | $5.00 | $25.00 |
| Claude Sonnet 4.6PaidCân bằng tốt nhất giữa tốc độ và hiệu năng | $3.00 | $15.00 |
| Claude Haiku 4.5PaidModel nhanh và rẻ nhất của Anthropic | $1.00 | $5.00 |
| Claude 3.5 SonnetPaidModel Sonnet thế hệ trước | $3.00 | $15.00 |
ChatGPT (OpenAI)
Không có model API miễn phí hoàn toàn; hỗ trợ sinh ảnh qua DALL-E.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| GPT-5.5PaidFlagship thế hệ mới nhất | $5.00 | $30.00 |
| GPT-5.4PaidModel cân bằng hiệu năng cao | $2.50 | $15.00 |
| GPT-5.4 miniPaidModel mini nhanh và rẻ | $0.75 | $4.50 |
| GPT-5.4 nanoPaidModel siêu rẻ cho tác vụ đơn giản | $0.20 | $1.25 |
| DALL-E 3🖼 ảnhPaidGiá từ $0.04 / ảnh tùy độ phân giải | — | — |
Grok (xAI)
Hỗ trợ sinh ảnh qua Grok Imagine; không có model API miễn phí hoàn toàn.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| Grok 4.3PaidFlagship thế hệ mới nhất của xAI | $1.25 | $2.50 |
| Grok 4.20PaidModel hỗ trợ suy luận và đa tác vụ | $1.25 | $2.50 |
| Grok 4.1 FastPaidModel tốc độ cao, giá cực rẻ | $0.20 | $0.50 |
| Grok Build 0.1PaidModel tối ưu cho lập trình và xây dựng ứng dụng | $1.00 | $2.00 |
| Grok Imagine🖼 ảnhPaidGiá từ $0.02 đến $0.07 / ảnh | — | — |
DeepSeek
Giá official DeepSeek API. Input/output chính dùng regular price; peak-hour đắt gấp 2.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| deepseek-v4-proPaidRegular input = cache miss; cache hit $0.003625. Peak-hour: input $0.87, output $1.74. | $0.43 | $0.87 |
| deepseek-v4-flashPaidRegular input = cache miss; cache hit $0.0028. Peak-hour: input $0.28, output $0.56. | $0.14 | $0.28 |
| DeepSeek Chat FreeFreeMiễn phí trên giao diện web chat, không phải API token billing. | Free | Free |
Perplexity
Chuyên về tìm kiếm thời gian thực; không hỗ trợ sinh ảnh.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| Sonar Reasoning ProPaidModel suy luận tìm kiếm cao cấp nhất | $2.00 | $8.00 |
| Sonar ProPaidModel tìm kiếm flagship kèm trích dẫn chi tiết | $3.00 | $15.00 |
| Sonar Large OnlinePaidModel tìm kiếm cân bằng hiệu năng | $1.00 | $1.00 |
| Sonar Small OnlineFreeMiễn phí giới hạn hàng ngày cho thử nghiệm | Free | Free |
| Sonar Huge OnlinePaidModel tìm kiếm quy mô lớn | $5.00 | $5.00 |
NotebookLM (Google)
Không bán API theo token truyền thống; giá tính theo giấy phép người dùng.
| Model | InputUSD / 1M token | OutputUSD / 1M token |
|---|---|---|
| NotebookLM Enterprise APIPaidAPI quản lý notebook, yêu cầu giấy phép Enterprise | — | — |
| NotebookLM StandardFreeMiễn phí hoàn toàn cho người dùng cá nhân | Free | Free |
| NotebookLM PlusPaid$7.99/tháng qua gói Google AI Plus | — | — |
| NotebookLM ProPaid$19.99/tháng qua gói Google AI Pro | — | — |
| NotebookLM UltraPaidTừ $99.99/tháng cho nhu cầu lưu trữ cực lớn | — | — |
Giá tham khảo do AI tổng hợp theo hiểu biết mô hình; có thể đã thay đổi — vui lòng đối chiếu trang giá chính thức của từng nhà cung cấp.