Chuỗi ngành công nghiệp AI đang hợp tác để giảm chi phí và tăng hiệu quả
Khi AI tạo sinh được ứng dụng ngày càng rộng rãi, chi phí xử lý token đơn vị dữ liệu cơ bản mà AI xử lý trở thành bài toán lớn đối với doanh nghiệp.

Giảm chi phí token trở thành xu hướng của ngành AI. Ảnh: Xinhua
Tại Hội nghị Trí tuệ nhân tạo Thế giới 2026 (WAIC 2026), nhiều doanh nghiệp cho biết giảm chi phí xử lý token (đơn vị dữ liệu cơ bản mà AI xử lý) đang trở thành mục tiêu chung của toàn bộ chuỗi ngành AI. Từ chip, hạ tầng điện toán đến mô hình AI và định tuyến thông minh (hệ thống tự động lựa chọn mô hình AI phù hợp với từng tác vụ) đều được tối ưu nhằm nâng cao hiệu quả và thúc đẩy thương mại hóa.
Theo Xinhua, tại WAIC 2026 và Cuộc họp cấp cao về Quản trị AI toàn cầu, nhiều doanh nghiệp cho biết việc giảm chi phí xử lý token đang trở thành trọng tâm khi các tác nhân AI (AI Agent) làm gia tăng đáng kể chi phí vận hành.
Trong lĩnh vực chip AI, bộ xử lý tensor (TPU) được đánh giá có hiệu quả năng lượng và chi phí trên mỗi token tốt hơn nhiều so với bộ xử lý đồ họa (GPU) trong các tác vụ huấn luyện và suy luận AI quy mô lớn.
Yang Gongyifan - nhà sáng lập công ty chip TPU Zhonghao Xinying - cho biết mục tiêu của doanh nghiệp là giảm một nửa chi phí trên mỗi token ở thế hệ chip tiếp theo và tiếp tục giảm ở các thế hệ sau để thúc đẩy thương mại hóa AI.
Ở hạ tầng điện toán, Liu Haifeng - Chủ tịch Hội đồng quản trị Viện Hàn lâm Khoa học Trung Quốc (CAS) - cho biết chi phí điện chiếm hơn 20% tổng chi phí vòng đời của trung tâm điện toán. Theo ông, việc kết hợp điện gió, điện mặt trời và lưu trữ năng lượng có thể giúp giảm đáng kể chi phí vận hành.
Các doanh nghiệp phát triển mô hình AI cũng tập trung giảm chi phí vận hành. Công ty Tencent cho biết mô hình AI Hunyuan HY3 có hiệu năng tương đương nhiều mô hình lớn hơn nhưng chi phí sử dụng thấp hơn đáng kể. Trong khi đó, công ty Meituan cho biết LongCat-2.0 là mô hình đầu tiên trong ngành áp dụng cơ chế miễn phí đối với token được lưu trong bộ nhớ đệm (cache). Đây là những dữ liệu đã được AI xử lý trước và lưu lại để tái sử dụng khi gặp yêu cầu tương tự, giúp người dùng không phải trả chi phí xử lý nhiều lần.
Theo tổ chức đánh giá mô hình AI SuperCLUE, mô hình Kimi K3 đạt điểm đánh giá cao hơn 18% so với mô hình xếp thứ hai, trong khi chi phí trung bình để hoàn thành mỗi tác vụ thấp hơn khoảng 16%. Kết quả này cho thấy các mô hình AI mới không chỉ cải thiện về năng lực xử lý mà còn ngày càng tiết kiệm chi phí sử dụng.
Bên cạnh đó, công nghệ "định tuyến mô hình thông minh" cũng đang trở thành chủ đề được quan tâm tại WAIC 2026. Theo công ty PPIO, công nghệ này có thể lựa chọn mô hình AI phù hợp với từng tác vụ, qua đó nâng cao khoảng 20% hiệu quả xử lý và giảm từ 50-60% chi phí token.




In bài viết
