Cơ sở dữ liệu vector là gì
Cơ sở dữ liệu để lưu trữ và tìm kiếm vector embeddings
Cơ sở dữ liệu vector — hệ thống lưu trữ dữ liệu chuyên biệt được tối ưu hóa để làm việc với các vector đa chiều (embeddings).
Khả năng chính
- Tìm kiếm tương đồng — tìm láng giềng gần nhất theo khoảng cách cosine
- Lập chỉ mục vector — HNSW, IVF, PQ để tìm kiếm nhanh
- Lọc metadata — kết hợp tìm kiếm vector và thuộc tính
- Khả năng mở rộng — hàng tỷ vector với phản hồi dưới mili giây
- Tìm kiếm hybrid — kết hợp tìm kiếm ngữ nghĩa và từ khóa
Giải pháp phổ biến
- Pinecone — dịch vụ cloud được quản lý
- Weaviate — mã nguồn mở với GraphQL API
- Milvus — DB mã nguồn mở hiệu suất cao
- Qdrant — dựa trên Rust với lọc phong phú
- Chroma — nhẹ cho prototype
- pgvector — mở rộng PostgreSQL
Ứng dụng kinh doanh
- Hệ thống RAG — cơ sở tri thức cho trợ lý AI
- Tìm kiếm ngữ nghĩa — tìm kiếm tài liệu dựa trên ý nghĩa
- Gợi ý — sản phẩm, nội dung, người dùng tương tự
- Loại bỏ trùng lặp — tìm hình ảnh và tài liệu tương tự
- Bất thường — phát hiện mẫu không điển hình