向量嵌入選型:如何為生產RAG選擇合適的嵌入模型
維度、成本、多語言能力與部署架構四個選型維度——繁體中文混合語境有其特別考量
在生產RAG(檢索增強生成)系統中,嵌入模型的選擇決定了語義搜尋質量的上限。嵌入模型將文本轉換為高維向量,系統依靠向量空間中的餘弦相似度判斷哪些內容與查詢最相關。選型涉及維度、成本、多語言能力與部署架構四個主要維度。
主流嵌入模型比較
OpenAI text-embedding-3系列
text-embedding-3-small(1536維)與text-embedding-3-large(3072維)是目前最廣泛使用的商業嵌入模型。英文語義理解表現穩定,整合成本低。中文及多語言場景效果較不穩定,且每次查詢均需API調用,無法本地運行。定價為$0.02/M tokens(small)與$0.13/M tokens(large)。
Google Gemini text-embedding系列
text-embedding-004(768維)是目前多語言RAG的主流選擇之一。在中文、繁體中文的語義理解上優於OpenAI small模型,且768維向量體積小,存儲與計算成本較低。適合同時處理英文與中文內容的混合語境系統,定價亦相對優惠。
開源本地模型
multilingual-e5-large、BGE(BAAI/General Embedding)等可部署於本地或私有雲,無需將文本發送至外部API。完全控制數據,適合對數據主權有嚴格要求的場景。代價是需自行管理推理基礎設施,GPU或高規格CPU的運行成本需單獨計算。
繁體中文及粵語場景的特別考量
繁體中文及粵語書面語混合內容的嵌入質量是香港應用的關鍵考量。測試發現,對於同時包含繁體中文、英文及粵語書面語的文本,Gemini text-embedding-004在語義相關性排序上表現較OpenAI small模型更為穩定。在最終選型前,建議以實際業務數據集進行小規模召回率測試,而非單純依賴公開排行榜。
香港企業雙語RAG系統的完整架構分析,可參閱你份文件一半中文一半英文——大多數AI系統就係喺呢度跌倒。
維度與存儲成本的取捨
高維向量的語義表達能力更強,但存儲與計算成本線性增加。以1M條文本記錄計算:768維(float32)約需3GB存儲空間,3072維則需12GB。在pgvector等向量資料庫中,索引構建時間與查詢速度亦隨維度增加受影響。Neon pgvector的生產配置細節可參閱Neon Postgres與pgvector:生產RAG資料庫設計要點。
一個被忽略的設計原則
小結
嵌入模型的選型不是一次性決策,隨業務語料庫語言分佈的變化,合適的模型可能不同。中文內容為主的系統優先測試Gemini系列;對數據主權有要求的場景考慮開源本地部署;建立索引前先以小規模數據集驗證召回率,再大規模建庫。
Levi係駐香港嘅獨立AI工程師,協助企業為生產RAG系統選型嵌入模型並優化多語言檢索質量。如需評估嵌入選型或RAG架構,歡迎洽詢。
WhatsApp 免費初步評估 → 查看更多企業案例 →或以電郵聯絡:support@hksoka.com