Tại Hội nghị thượng đỉnh RAISE ở Paris, DDN đã giới thiệu sự hợp tác đang diễn ra của mình với Nebul, nhà cung cấp đám mây lai có chủ quyền của Châu Âu, tập trung vào việc nâng cao hiệu quả cho việc triển khai suy luận AI quy mô lớn. Được công bố vào tuần trước, sáng kiến chung này kết hợp nền tảng suy luận của Nebul, kiến trúc dữ liệu thông minh Infinia của DDN và điện toán tăng tốc của NVIDIA để giải quyết nút thắt cổ chai AI sản xuất quan trọng: chi phí di chuyển dữ liệu và hạn chế hiệu suất trong khối lượng công việc suy luận.
DDN định hình sự cộng tác xung quanh các số liệu sản xuất quan trọng: mức sử dụng GPU, thông lượng mã thông báo, chi phí mỗi mã thông báo và độ trễ. Trong khi đào tạo mô hình xây dựng giá trị tài sản AI, thì suy luận sẽ xác định lợi nhuận thương mại và hoạt động của nó. Việc áp dụng AI tác nhân ngày càng tăng, thế hệ tăng cường truy xuất (RAG) và suy luận đồng thời cao có nghĩa là cơ sở hạ tầng lưu trữ và dữ liệu tác động trực tiếp đến hiệu suất của bộ tăng tốc và tốc độ phản hồi của AI.
Dự án chứng minh khái niệm tích cực này đã mang lại kết quả ban đầu đầy hứa hẹn. Các đối tác đã ghi lại những cải tiến có thể đo lường được về thời gian xuất hiện mã thông báo đầu tiên khi bật bộ nhớ đệm KV và hoàn tất quá trình xác thực cho cơ sở hạ tầng dựa trên RoCE. Việc đo điểm chuẩn liên tục bao gồm độ dài chuỗi suy luận dài hơn, mở ra tiềm năng tối ưu hóa hơn nữa cho nền tảng Infinia. Sự hợp tác này cũng mở rộng sang những nỗ lực chung của NVIDIA về các khuôn khổ đo điểm chuẩn, xác minh khả năng mở rộng và các ấn phẩm kỹ thuật sắp ra mắt.
Nền tảng tích hợp tận dụng các dịch vụ bộ đệm KV phân tán, chuyển động dữ liệu gốc GPU, điều phối dữ liệu thông minh và kiến trúc lưu trữ hiệu suất cao. Khả năng tăng tốc bộ nhớ đệm KV mang lại lợi ích suy luận đáng chú ý bằng cách duy trì và truy xuất nhanh chóng các trạng thái chú ý được tính toán trước, cắt giảm các phép tính dư thừa và loại bỏ độ trễ phân phối dữ liệu khiến GPU không hoạt động.
Các nhà lãnh đạo từ DDN, Nebul và NVIDIA đã nhấn mạnh sự thay đổi lớn trong ngành: Các ưu tiên của cơ sở hạ tầng AI đang chuyển từ triển khai GPU thô sang hiệu quả hoạt động, tối đa hóa lợi nhuận từ phần cứng tăng tốc hiện có. Giám đốc điều hành DDN Alex Bouzari và Giám đốc điều hành Nebul Arnold Juffer lưu ý rằng việc tập trung trước đây vào quy mô mô hình lớn hơn đã nhường chỗ cho việc tối ưu hóa kinh tế suy luận để giúp sản xuất AI khả thi về mặt thương mại thông qua chi phí mỗi mã thông báo thấp hơn. Phó chủ tịch cơ sở hạ tầng đám mây NVIDIA Rod Evans nói thêm rằng khối lượng công việc tác nhân quy mô lớn hiện đo lường mức độ thành công của cơ sở hạ tầng bằng cách sử dụng GPU và độ trễ, thay vì sức mạnh tính toán tuyệt đối.
DDN nhấn mạnh rằng cơ sở hạ tầng AI phải phát triển vượt ra ngoài các chức năng lưu trữ cơ bản để hỗ trợ tích cực quy trình thực thi AI. Nền tảng cơ sở hạ tầng của công ty hiện cung cấp năng lượng cho hơn một triệu GPU trên toàn thế giới, phục vụ các nhà cung cấp dịch vụ siêu quy mô, nhà cung cấp đám mây, doanh nghiệp, chính phủ và tổ chức nghiên cứu.
Các nhóm cơ sở hạ tầng AI hiện đại hiện ưu tiên các số liệu sản xuất cốt lõi này:
Sử dụng GPU: Đo lường hoạt động tăng tốc hiệu quả trong quá trình suy luận, tối đa hóa giá trị của phần cứng GPU cao cấp.
Giá mỗi mã thông báo: Liên kết trực tiếp hiệu suất cơ sở hạ tầng với chi phí vận hành đầu ra của mô hình AI.
Mã thông báo trên mỗi watt: Đánh giá hiệu quả năng lượng của đầu ra suy luận AI.
Thời gian nhận được mã thông báo đầu tiên: Xác định khả năng phản hồi của ứng dụng AI tương tác và trải nghiệm người dùng.
Thời gian sản xuất: Định lượng nỗ lực vận hành để chuyển các dịch vụ AI từ thử nghiệm sang triển khai thương mại có thể mở rộng.
Khi suy luận trở thành khối lượng công việc AI chiếm ưu thế, việc cung cấp ngữ cảnh và dữ liệu doanh nghiệp được lưu trong bộ nhớ đệm cho GPU với độ trễ thấp, ổn định sẽ rất quan trọng để duy trì mức sử dụng GPU cao và kiểm soát chi phí vận hành lâu dài.
Công ty TNHH Công nghệ Qianxing Jietong Bắc Kinh
Sandy Yang/Giám đốc chiến lược toàn cầu
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Trang web: www.qianxingdata.com/www.storagesserver.com
Trọng tâm kinh doanh:
Phân phối sản phẩm CNTT/Tích hợp hệ thống & Dịch vụ/Giải pháp cơ sở hạ tầng
Với hơn 20 năm kinh nghiệm phân phối CNTT, chúng tôi hợp tác với các thương hiệu hàng đầu thế giới để cung cấp các sản phẩm đáng tin cậy và dịch vụ chuyên nghiệp.
“Sử dụng công nghệ để xây dựng một thế giới thông minh”Nhà cung cấp dịch vụ sản phẩm CNTT đáng tin cậy của bạn!
Sandy Yang/Giám đốc chiến lược toàn cầu
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Trang web: www.qianxingdata.com/www.storagesserver.com
Trọng tâm kinh doanh:
Phân phối sản phẩm CNTT/Tích hợp hệ thống & Dịch vụ/Giải pháp cơ sở hạ tầng
Với hơn 20 năm kinh nghiệm phân phối CNTT, chúng tôi hợp tác với các thương hiệu hàng đầu thế giới để cung cấp các sản phẩm đáng tin cậy và dịch vụ chuyên nghiệp.
“Sử dụng công nghệ để xây dựng một thế giới thông minh”Nhà cung cấp dịch vụ sản phẩm CNTT đáng tin cậy của bạn!



