Giá của các LLM cấp đầu (frontier) đã ổn định trong năm 2026, nhưng khoảng chênh vẫn đủ lớn để việc chọn model có thể quyết định thành bại của ngân sách API. Các đội doanh nghiệp chúng tôi làm việc cùng tại Retech Solutions thường xuyên ghi nhận chi phí LLM hàng tháng từ 15.000 đến 75.000 USD tùy khối lượng, lựa chọn model và cơ cấu workload. Hướng dẫn này phân tích bức tranh giá hiện tại và đưa ra khuyến nghị thực tế về model nào phù hợp với use case nào.
Bức tranh Giá năm 2026
Ba frontier model mà phần lớn doanh nghiệp lựa chọn giữa là GPT-5.5 của OpenAI, Claude Sonnet 5 của Anthropic và Gemini 3.1 Pro của Google. Mỗi model có một tư thế giá khác nhau. GPT-5.5 nằm ở phân khúc cao cấp với 5,00 USD mỗi triệu token input và 30,00 USD mỗi triệu token output, cùng context window 400K token. Claude Sonnet 5 hiện áp dụng giá ưu đãi giới thiệu ở mức 2,00 USD mỗi triệu token input và 10,00 USD mỗi triệu token output, với context window vượt 1 triệu token. Gemini 3.1 Pro nằm ở giữa với khoảng 4,00 USD mỗi triệu token input, cũng sở hữu context window trên 1M token.
Context Window: Đòn bẩy Chi phí Ẩn
Kích thước context window là đòn bẩy chi phí ẩn. Một model có window 1M token xử lý được nhiều dữ liệu hơn nhiều trong mỗi lần gọi, nhưng việc lấp đầy window đó tốn kém. Một request 1M token duy nhất trên GPT-5.5 tốn 5,00 USD chỉ riêng phần input. Bài so sánh context window của Morph phân tích chi phí theo window trên hơn 20 model và cho thấy một context window lớn có thể nhanh chóng chiếm phần chủ đạo trong hóa đơn của bạn.

Phương trình Chi phí Thực tế
Phương trình chi phí thực tế phụ thuộc vào ba yếu tố: khối lượng token (bao nhiêu text được xử lý mỗi lần gọi), tỷ lệ output (model tạo ra bao nhiêu so với đọc vào), và mức lấp context (bạn thực sự dùng bao nhiêu window). Một pipeline RAG gửi 50K token context và nhận về 500 token output có hồ sơ chi phí rất khác với một công cụ sinh code gửi 2K token và nhận về 10K token. So sánh giá 2026 của ThinkML có máy tính theo từng model giúp các đội mô phỏng những kịch bản này.
Claude Sonnet 5: Lựa chọn Mặc định Về Giá/Hiệu năng
Với các đội tối ưu tỷ lệ giá/hiệu năng, Claude Sonnet 5 với giá ưu đãi giới thiệu hiện là lựa chọn mặc định mạnh nhất. Ở mức 2/10 USD mỗi triệu token, nó rẻ hơn khoảng 60% so với GPT-5.5 cho khối lượng công việc tương đương, với chất lượng suy luận tương đương và context window lớn hơn. Điểm cần lưu ý: giá giới thiệu có thể không kéo dài, và các đội nên mô phỏng chi phí ở mức giá thường trước khi cam kết Claude làm nhà cung cấp duy nhất.

GPT-5.5: Chiều sâu Suy luận và Multimodal
Với các đội tối ưu chiều sâu suy luận và năng lực multimodal, GPT-5.5 vẫn là chuẩn tham chiếu. So sánh doanh nghiệp của Ideas2IT ghi nhận GPT-5.5 tốn khoảng hơn 20% trên token output so với các model Claude tương đương, con số cộng dồn rất nhanh với các workload nặng phần tạo nội dung (code, nội dung dài, trích xuất dữ liệu có cấu trúc). Đổi lại là các năng lực multimodal của GPT-5.5 (hình ảnh, âm thanh, structured output) trưởng thành hơn cả hai đối thủ.
Gemini 3.1 Pro: Nước đi Google Cloud
Lợi thế của Gemini 3.1 Pro là độ sâu tích hợp với Google Cloud. Các đội đã dùng GCP (BigQuery, Vertex AI, Cloud Functions) có được độ trễ thấp hơn, thanh toán đơn giản hơn và tích hợp IAM chặt chẽ hơn. Với những workload mà sự gắn kết hạ tầng quan trọng hơn giá từng token, việc bundle cả hệ sinh thái của Gemini có thể bù đắp cho mức giá tầm trung của nó.
Chiến lược Multi-model
Chiến lược multi-model là điểm hội tụ của phần lớn các đội chú trọng chi phí. Định tuyến các tác vụ đơn giản (phân loại, tóm tắt, hỏi đáp ngắn) sang model khả thi rẻ nhất. Định tuyến suy luận phức tạp (phân tích nhiều bước, sinh code, sáng tạo nội dung) sang frontier model. Định tuyến tác vụ ngữ cảnh dài (xử lý tài liệu, phân tích codebase lớn) sang model có giá mỗi triệu token tốt nhất cho input lớn. Cách định tuyến này thường cắt 30-50% tổng chi tiêu LLM so với việc gửi mọi thứ tới một frontier model duy nhất.


