Zilliz đã tung ra Milvus v3.0, cơ sở dữ liệu vector mã nguồn mở của nó, thêm truy cập dữ liệu gốc hồ và một công cụ tìm kiếm nâng cấp cho các nhà phát triển AI sản xuất.
Kiến trúc gốc hồ giữ dữ liệu thô trong các định dạng mở trên lưu trữ đối tượng đám mây thay vì sao chép nó vào các cơ sở dữ liệu độc lập.Zilliz đã công bố khái niệm Vector Lakebase của mình vào tháng 6; Giám đốc điều hành Charles Xie mô tả nó là một cơ sở dữ liệu thống nhất cho phép truy vấn thời gian thực, thăm dò dữ liệu và đường ống đào tạo AI nhiều petabyte mà không cần sao chép dữ liệu,đống di chuyển hoặc lưu trữ song songLớp lưu trữ đối tượng thống nhất hỗ trợ cả tìm kiếm vector trực tuyến chậm và phân tích quy mô lớn trên các tệp nguồn giống hệt nhau.
Đồng sáng lập và CTO của Zilliz James Luan đã bình luận: Milvus 3.0 chạy truy xuất sản xuất trực tiếp trên các kho dữ liệu hiện có và cung cấp một công cụ mạnh mẽ hơn cho khối lượng công việc AI hiện đại.Cùng một lõi này cung cấp năng lượng cho Zilliz Vector Lakebase., được tăng cường với quy mô đàn hồi, hoạt động đơn giản và công cụ cấp doanh nghiệp để quản lý dữ liệu AI quy mô lớn.
Các cơ sở dữ liệu vector lưu trữ các bản nhúng vector số cho văn bản, hình ảnh và nội dung khác để tìm kiếm sự tương đồng.được thông qua bởi hơn 10, 000 công ty cho RAG, công cụ khuyến nghị và các đại lý AI, với hơn 100 triệu lần kéo Docker được ghi nhận.
Các đường ống AI truyền thống duy trì các bản sao dữ liệu riêng biệt để truy xuất thời gian thực và phân tích ngoại tuyến, mang lại chi phí lưu trữ bổ sung, xuất dữ liệu lâu,đường ống đồng bộ hóa và chi phí vận hành nặng.
Core Milvus 3.0 khả năng
1. Các bộ sưu tập bên ngoài: Tạo bộ sưu tập Milvus trên các tệp hồ trong Lance, Iceberg, Parquet hoặc Vortex.phơi bày chúng thông qua các API gốc tiêu chuẩn. Tích hợp gia tăng tự động cập nhật chỉ mục khi dữ liệu hồ thay đổi.
2. Loon Storage Engine: Một công cụ cắt đọc dựa trên biểu hiện mới để tăng cường tìm kiếm lưu trữ đối tượng chậm trễ, sử dụng Open Arrow-compatible Vortex như định dạng cột mặc định.
3. Những bức ảnh thời gian: Những bức ảnh chụp nhanh thu thập chỉ đọc nhẹ cho phép các công việc loại bỏ trùng lặp, đánh giá và xác thực ngoại tuyến chạy trên các bộ dữ liệu ổn định mà không làm gián đoạn việc viết sản xuất.
4.Điều kết nối tia lửa và các nhà điều hành lô: Một đầu nối Spark DataSource V2 tích hợp Milvus với Spark, Databricks và EMR batch workflows, cùng với các chức năng batch vector gốc cho deduplication và clustering.

Tìm kiếm vectơ Top-K tiêu chuẩn chỉ lấy các vectơ tương tự nhất bằng tính toán khoảng cách, bị quy mô kém với số lượng vectơ và kích thước cao.0 mở rộng tìm kiếm xa hơn tìm kiếm hàng xóm gần nhất cơ bản:
1Trình phân loại, tổng hợp và tìm kiếm mặt máy chủ kết hợp sự tương đồng ngữ nghĩa với các bộ lọc siêu dữ liệu (giấy đánh dấu thời gian, giá cả, danh mục, người thuê, v.v.), loại bỏ việc xử lý sau phía khách hàng.
2.StructList truy xuất đa vector hỗ trợ các thực thể có nhiều nhúng (bộ tài liệu, bản vá hình ảnh, dữ liệu sản phẩm đa phương thức) và hoạt động với các mô hình tương tác muộn như ColBERT và ColPali.
3Chỉ số thưa thớt tối ưu giảm dấu chân lưu trữ ~ 70% trong khi phù hợp với hiệu suất thu hồi ban đầu, kết hợp với các vector thưa thớt được học bởi SINDI, tích hợp MinHash, các trường vector null,từ điển văn bản đầy đủ tùy chỉnh và khả năng tương thích chỉ mục Faiss rộng hơn.
Luan nói thêm rằng khối lượng công việc AI sản xuất đòi hỏi xếp hạng, nhóm và tìm kiếm đa vector tự nhiên trong cơ sở dữ liệu và v3.0 lưu trữ tái chế để cung cấp truy cập nhanh vào lưu trữ đối tượng cùng với xử lý trong động cơ phong phú hơn.
Zilliz Cloud mở rộng công cụ cơ sở thành một Vector Lakebase hoàn chỉnh với tính toán đàn hồi, công cụ khám phá,phân tích hàng loạt, lập chỉ mục thống nhất, quản trị doanh nghiệp và tự động hóa trên một nguồn dữ liệu AI duy nhất.
Ngành công nghiệp
Bản cập nhật làm tăng áp lực đối với các đối thủ Pinecone, Qdrant và Weaviate, tất cả đều chạy đua để giảm độ trễ tìm kiếm: Qdrant đã tung ra lập chỉ mục nhanh hơn, các cụm có sẵn cao và nhật ký kiểm toán tuân thủ vào tháng Tư;Pinecone đã tung ra các bộ vector được tính toán trước và bộ thu thập composable vào tháng 5 để tăng tốc quy trình làm việc của đại lý.
Các nhà cung cấp cơ sở dữ liệu vector thuần túy cạnh tranh với các nền tảng đa mô hình bao gồm Regatta, SingleStore và SurrealDB.Quan hệ đối tác cơ sở dữ liệu liên kết sâu hơn đối mặt với các rào cản kiến trúc và động cơ lưu trữThị trường có thể thấy các nhà chơi vector thêm hỗ trợ cấu trúc, biểu đồ, tài liệu hoặc chuỗi thời gian theo thời gian.
Có sẵn
Milvus 3.0 vẫn là một dự án tốt nghiệp AI & Dữ liệu LF theo giấy phép Apache 2.0, có thể triển khai thông qua Docker hoặc Kubernetes bao gồm môi trường không khí, tương thích với S3,GCS và Azure Blob lưu trữ đối tượng. Khối SDK ban đầu bao gồm Python, Go và Node.js, với hỗ trợ Java sắp tới. Mã nguồn, ghi chú phát hành và hướng dẫn khởi động nhanh được lưu trữ trên GitHub,cùng với giờ làm việc của cộng đồng để hỗ trợ các nhà phát triển.
Managed Zilliz Cloud nhúng Milvus 3.0 làm lớp lập chỉ mục cốt lõi của nó, thêm độ đàn hồi, bảo mật và hoạt động thống nhất của doanh nghiệp trên một bản sao dữ liệu chia sẻ duy nhất.
Phụ lục
Các bộ sưu tập bên ngoài thực hiện lập chỉ mục hồ sao chép không có di chuyển dữ liệu; Loon giải quyết nút thắt khuếch đại đọc trước đây hạn chế lưu trữ đối tượng cho các truy vấn vector độ trễ thấp.
Công ty công nghệ Bắc Kinh Qianxing Jietong Co., Ltd.
Sandy Yang - Giám đốc chiến lược toàn cầu
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Trang web: www.qianxingdata.com/www.storagesserver.com
Tập trung kinh doanh:
Phân phối sản phẩm ICT / tích hợp hệ thống & dịch vụ / giải pháp cơ sở hạ tầng
Với hơn 20 năm kinh nghiệm phân phối CNTT, chúng tôi hợp tác với các thương hiệu hàng đầu toàn cầu để cung cấp các sản phẩm đáng tin cậy và dịch vụ chuyên nghiệp.
Sử dụng công nghệ để xây dựng một thế giới thông minh Nhà cung cấp dịch vụ sản phẩm ICT đáng tin cậy của bạn!