🌐 VI

🧮 Công cụ tính chi phí token AI

Tính chi phí token cho GPT, Claude, Gemini và các API LLM lớn khác. Nhập trực tiếp số token hoặc dán văn bản để ước tính, rồi kiểm tra chi phí hàng tháng dự kiến.

Mô phỏng sử dụng hàng tháng

Ở chế độ dán văn bản, hoặc ở chế độ nhập trực tiếp khi bỏ trống đầu vào/đầu ra, mô phỏng sẽ giả định tỷ lệ 70% đầu vào / 30% đầu ra cho mỗi yêu cầu. Nếu ở chế độ nhập trực tiếp bạn điền cả đầu vào và đầu ra, các con số chính xác theo từng yêu cầu đó sẽ được dùng thay thế.

Chi phí ước tính (mỗi yêu cầu)
Chi phí đầu vào Chi phí đầu ra Tổng chi phí
Chi phí đầu vào nếu được lưu cache (tham chiếu)

Trong thực tế, caching áp dụng cho các system prompt hoặc ngữ cảnh lặp lại, không phải cho toàn bộ văn bản mới ở mỗi lần gọi.

Nguồn:
Mô phỏng sử dụng hàng tháng
Chi phí mỗi ngày Chi phí mỗi tháng (×30) Chi phí mỗi năm (×365)
HƯỚNG DẪN

Tìm hiểu thêm

01

1. Vì sao nên ước tính chi phí API LLM trước khi mở rộng

Tính trước chi phí dự kiến trước khi tích hợp API LLM vào một tính năng hoặc sản phẩm mới sẽ giúp bạn tránh biến tệp người dùng đang tăng trưởng thành một hóa đơn không thể kiểm soát. Điều này càng quan trọng với các dịch vụ có prompt dài hoặc hội thoại nhiều lượt - một yêu cầu riêng lẻ có thể trông rẻ, nhưng con số thay đổi rất nhanh khi nhân lên theo quy mô sử dụng hằng ngày hoặc hằng tháng. Công cụ này hiển thị cả chi phí trên mỗi yêu cầu lẫn mô phỏng theo tháng để bạn có cái nhìn về ngân sách trước khi mở rộng.

02

2. Token khác từ và ký tự như thế nào

Token là đơn vị nhỏ nhất mà mô hình dùng để xử lý văn bản, và nó không tương ứng 1:1 với từ hoặc ký tự. Quy tắc ước lượng phổ biến cho tiếng Anh là khoảng 4 ký tự cho mỗi token, nhưng đó chỉ là xấp xỉ - số lượng thực tế phụ thuộc vào bộ tokenizer của từng mô hình (ví dụ kiểu BPE). Đặc biệt, các ngôn ngữ CJK (Hàn, Nhật, Trung) thường dùng nhiều token hơn trên mỗi ký tự so với tiếng Anh, vì một ký tự đơn lẻ thường bị tách thành nhiều subword token - nên cùng một số ký tự có thể tốn chi phí cao hơn đáng kể so với văn bản tiếng Anh tương đương.

03

3. Vì sao giá đầu vào và đầu ra khác nhau

Hầu hết nhà cung cấp định giá token đầu ra (được sinh ra) cao hơn nhiều lần so với token đầu vào (prompt), và mọi mô hình trong bộ dữ liệu này đều theo mô hình đó. Đầu vào có thể được xử lý (encode) một lần cùng lúc, trong khi đầu ra phải được tạo (decode) từng token một - cần nhiều tính toán và độ trễ hơn cho mỗi token. Vì vậy, giữ câu trả lời ngắn gọn là một cách rất hiệu quả để giảm chi phí.

04

4. Prompt caching là gì

Prompt caching (context caching) cho phép nhà cung cấp lưu cache system prompt, ngữ cảnh dài hoặc tài liệu ở phía máy chủ, rồi tính mức giá thấp hơn nhiều khi cùng nội dung đó xuất hiện lại trong một yêu cầu sau. Cách này hiệu quả nhất trong các thiết lập hội thoại, nơi system prompt hoặc lịch sử chat được gửi lại ở mỗi lượt. Nó không áp dụng khi mỗi yêu cầu đều gửi văn bản hoàn toàn mới, nên con số "nếu được cache" trong công cụ này chỉ là kịch bản tham chiếu, không phải cam kết.

05

5. Cách giảm chi phí token trong môi trường sản xuất

(1) Giữ prompt ngắn nhất có thể so với yêu cầu thực tế của tác vụ - chỉ đưa vào ngữ cảnh cần thiết. (2) Tận dụng prompt caching cho system prompt hoặc ngữ cảnh lặp lại giữa các yêu cầu. (3) Chuyển các tác vụ đơn giản như phân loại hoặc tóm tắt sang mô hình nhỏ hơn, rẻ hơn thay vì mô hình chủ lực. (4) Gom nhiều yêu cầu lại để tận dụng chiết khấu theo lô hoặc tối ưu thông lượng. Chỉ bốn đòn bẩy này đã có thể giảm đáng kể chi phí vận hành thực tế.

06

6. Hạn chế của công cụ này

Công cụ này ước tính chi phí dựa trên đơn giá API công khai của từng nhà cung cấp. Nó không tính đến chiết khấu theo khối lượng, thỏa thuận doanh nghiệp, thông lượng được cấp trước, tín dụng miễn phí, khác biệt giá theo khu vực, hay độ chậm hiệu dụng do giới hạn tốc độ. Số tiền thực tế được tính có thể khác tùy theo điều khoản hợp đồng của bạn - hãy dùng đây như điểm khởi đầu để lập ngân sách, và xác nhận con số cuối cùng trực tiếp với nhà cung cấp.

Câu hỏi thường gặp

Ước tính từ văn bản sang token chính xác đến mức nào?
~4 ký tự cho mỗi token là quy tắc ước lượng gần đúng dựa trên văn bản tiếng Anh. Bộ tokenizer thực tế khác nhau theo từng mô hình, và văn bản không phải tiếng Anh (Hàn, Nhật, Trung, v.v.) có thể lệch nhiều hơn so với xấp xỉ này. Để có số chính xác, hãy chạy văn bản qua tokenizer chính thức của nhà cung cấp mô hình.
Vì sao đầu ra đắt hơn đầu vào?
Sinh token từng cái một (giải mã) tốn nhiều tính toán hơn so với xử lý đầu vào cùng lúc (mã hóa), vì vậy hầu hết nhà cung cấp định giá token đầu ra cao hơn token đầu vào nhiều lần.
Công cụ này có tính token hình ảnh hoặc âm thanh không?
Không - công cụ này chỉ xử lý token văn bản. Đầu vào hình ảnh, âm thanh và video thường được tính theo cơ chế giá riêng, nằm ngoài phạm vi ở đây.
Giá này được cập nhật bao lâu một lần?
Cập nhật thủ công, tính đến ngày hiển thị trong trường as_of của tệp dữ liệu. Giá của nhà cung cấp có thể thay đổi mà không báo trước, vì vậy hãy luôn xác nhận con số mới nhất trên trang bảng giá chính thức của họ trước khi chốt ngân sách.