Việc áp dụng AI hiện đang bị cản trở bởi chi phí token cao và thiếu sự rõ ràng về giá trước cho các yêu cầu AI, dẫn đến chi tiêu token không kiểm soát được.Nguy cơ này được tăng cường mạnh mẽ bởi các nhân viên AI, hiện đang hoạt động mà không có hạn chế chi phí token tích hợp và có thể gây ra sự bùng nổ chi phí cực kỳ.
Bài viết này giải thích các token AI là gì, giá token hoạt động như thế nào và các chiến lược có thể thực hiện để ngăn chặn chi tiêu token thảm khốc.Một trường hợp doanh nghiệp được ghi chép kỹ lưỡng thấy một tổ chức tích lũy một $ 500,000Một phần khác, nhóm kỹ sư của Uber được cho là đã sử dụng hết toàn bộ ngân sách AI năm 2026 trước lịch trình.Token là các đơn vị cơ bản mà các mô hình ngôn ngữ lớn (LLM) và chatbots sử dụng để phá vỡ các lời nhắc ngôn ngữ của con người và tạo ra các đầu ra AI phù hợp.
Ví dụ, thông báo nhập "Hãy cho tôi biết về trầm tích" được chia thành các thành phần token riêng biệt:
- Nói đi.
- Tôi.
- Khoảng
-khuyên lấp
-công nghệ
Sự phân chia năm mã thông báo này cho một từ đơn sedimentation giúp LLM giải thích chính xác cấu trúc và ý nghĩa của từ.Phân chia gốc sediment và hậu tố ation cho phép mô hình nhận ra sự sử dụng nhất quán của hậu tố trên nhiều danh từCách tiếp cận này thu hẹp phạm vi tìm kiếm của mô hình trong cơ sở dữ liệu của nó,cắt giảm thời gian xử lý thay vì quét từng từ chứa hậu tố một cách riêng lẻ.
Là các đơn vị dữ liệu cốt lõi, các token được chuyển đổi thành các phần đính kèm vectơ (vector embeddings) - các chuỗi số toán học mã hóa ý nghĩa ngữ nghĩa và được lưu trữ trong các chỉ mục mô hình.mô hình tạo ra nhiều vector để đại diện cho các thuộc tính đa chiều của nó, chẳng hạn như sinh vật sống, vật nuôi, đặc điểm mèo, kích thước vật lý và hơn thế nữa.và đồ chơi cho mèo tổng hợp.
Một bao gồm vectơ năm chiều giả thuyết cho thuật ngữ ?? cat?? có thể được thể hiện như [1.5-0.4, 7.219.6, 20.2].
Tất cả dữ liệu vector tồn tại trong không gian vector thống nhất, cho phép các mô hình xác định nội dung tương tự theo ngữ nghĩa bằng cách đo độ gần không gian giữa các điểm vector.
Một khi được chuyển đổi thành vector, token được xử lý trên các máy chủ GPU chi phí cao được trang bị bộ nhớ băng thông cao.Một NVIDIA DGX SuperPOD có 32 nút và 256 tổng số GPU có giá từ 12 triệu đến 20 triệu đô laMột kiến trúc tham chiếu tiên tiến hơn với 140 nút DGX H100, Quantum-2 InfiniBand mạng, lưu trữ đầy đủ và cơ sở hạ tầng mạng, và các hệ thống hỗ trợ có thể vượt quá 100 triệu đô la.Chi phí cơ sở hạ tầng đáng kể này được phản ánh trực tiếp trong các chương trình định giá token của các mô hình nền tảng chính thống.
Các nhà cung cấp LLM và chatbot hàng đầu bao gồm OpenAI và Anthropic áp dụng các mô hình thanh toán dựa trên token, với các quy tắc chuyển đổi token có thể dự đoán cho nội dung văn bản.một token tiếng Anh tương đương với khoảng bốn ký tự hoặc 0.75 từ, có nghĩa là 750 từ tương ứng với khoảng 1.000 token.,Tạo ra AI từ 000 tiêu thụ khoảng 3.667 token tổng cộng.
Tiêu thụ token cao hơn trực tiếp kéo dài độ trễ phản hồi AI. Tất cả các token từ một phiên phản hồi ngay lập tức duy nhất được chứa trong một cửa sổ ngữ cảnh dung lượng hữu hạn. Theo dữ liệu của Decagon,Cửa sổ ngữ cảnh token 000 có thể chứa khoảng 7510.000 từ tiếng Anh, tương đương với một cuốn sách 300 trang.
Khả năng cửa sổ ngữ cảnh không đủ khiến LLM mất thông tin ngữ cảnh, dẫn đến đầu ra AI không đầy đủ hoặc không chính xác.GPT-4o hỗ trợ lên đến 128,000 token, Claude 3.5 Sonnet đạt 200.000 token, và chọn Gemini 1.5 Pro người dùng doanh nghiệp có thể truy cập vào một cửa sổ ngữ cảnh 2 triệu token.
Giá mã thông báo khác nhau giữa các nhà cung cấp mô hình.
Theo Intuition Labs, OpenAI's ChatGPT API hoạt động trên một cấu trúc thanh toán dựa trên token thuần túy.với token đầu ra thường tốn kém hơn. Giá cả cũng dao động dựa trên trạng thái phản hồi được lưu trữ. Mỗi cuộc gọi API phải chịu hai khoản phí riêng biệt: một cho các token đầu vào nhanh chóng và một cho các token đầu ra được tạo ra bởi AI.sử dụng mô hình có giá 10 đô la cho mỗi triệu token đầu ra cho 100 token đầu vào và 400 token đầu ra dẫn đến chi phí đầu vào là 10 × 100 / 1.,000, 000) và chi phí sản xuất là 10 × 400/1,000, 000), với tổng chi phí bằng tổng của hai con số.
Các doanh nghiệp có thể triển khai các kiểm soát quản trị nhắm mục tiêu để giới hạn chi tiêu token, bao gồm hạn ngạch cho mỗi người dùng hoặc mỗi chỗ ngồi, hạn chế lưu lượng dựa trên việc sử dụng, giới hạn chi tiêu cho mỗi dự án,và giới hạn cấp mô hìnhLĩnh vực quản trị này đang phát triển nhanh chóng, khi các nhà cung cấp AI cạnh tranh để tối ưu hóa chất lượng dịch vụ, cân bằng dòng thu nhập và cạnh tranh với các mô hình AI nguồn mở.
Các đại lý AI giới thiệu một lớp rủi ro chi phí token hoàn toàn mới.Các chuyên gia trong ngành khuyến cáo đối xử với các nhân viên AI như những nhân viên kỹ thuật số, với các nhóm FinOps thực hiện giám sát chi tiêu nghiêm ngặt suốt ngày đêm để tránh thảm họa chi phí.
Công ty công nghệ Bắc Kinh Qianxing Jietong Co., Ltd.
Sandy Yang - Giám đốc chiến lược toàn cầu
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Trang web: www.qianxingdata.com/www.storagesserver.com
Tập trung kinh doanh:
Phân phối sản phẩm ICT / tích hợp hệ thống & dịch vụ / giải pháp cơ sở hạ tầng
Với hơn 20 năm kinh nghiệm phân phối CNTT, chúng tôi hợp tác với các thương hiệu hàng đầu toàn cầu để cung cấp các sản phẩm đáng tin cậy và dịch vụ chuyên nghiệp.
Sử dụng công nghệ để xây dựng một thế giới thông minh Nhà cung cấp dịch vụ sản phẩm ICT đáng tin cậy của bạn!