OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌

2026年9月23日 10:16
OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌
站內 AI 整理稿

AI資訊AI新聞資訊正文OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌發佈於AI新聞資訊發佈時間 :2026年9月23號 10:09閱讀 :1分鐘嵌入向量模型決定了你的檢索系統到底能撈回什麼——它把每段輸入壓成一個向量,讓相關的東西彼此靠近,應用於是能按語義而非字面去檢索。正因如此,選哪個模型永遠是RAG、多語言檔案庫、代碼倉庫和圖文集合各自不同的考題。OpenRouter在9月11日核實了自家嵌入模型目錄,共37個條目,並通過embeddings API向19個模型發了批量請求、跑了28項檢查,用一份實測指南把選型邏輯攤開。

最實用的結論是分場景給候選人。英文RAG默認從openai/text-embedding-3-small起步,它價格低、上下文8192token、維度還可調;當輸入超過8192token,或想在Voyage4各檔間切換而不重建索引時,就測voyage-4-large,它給到32000token上下文和四檔可選維度,且與其他Voyage4層級向量兼容;想要開放權重替代,qwen3-embedding-8b有更長上下文窗和更低提示詞價。

多語言檢索交給qwen3-embedding-8b(公開權重、支持100多種語言),代碼搜索用voyage-code-4,文本加圖像檢索則選google/gemini-embedding-2或voyage-multimodal-3.5。付費文本里最便宜的是perplexity/pplx-embed-v1-0.6b,每百萬輸入token僅0.004美元;免費文本路由nvidia/nemotron-3-embed-1b:free則帶32768token上下文。把入圍選手擺在一張表裡,差異一目瞭然。text-embedding-3-small是文本、8192上下文、1536維、每百萬token0.

02美元、閉源;3-large同為8192上下文但3072維、0.13美元。Voyage4家族整齊劃一:lite、標準版、large、code-4、multimodal-3.5都是32000上下文、1024維,價格從0.02到0.12美元不等,全部閉源。Qwen3Embedding8B是文本、32768上下文、4096維、每百萬token僅0.01美元且開放權重;4B版2560維、0.02美元。Perplexity的0.6B與4B分別是1024維0.004美元、2560維0.03美元,均開放。Gemini Embedding2覆蓋文本與圖像、8192上下文、3072維,文本每百萬token0.

20美元、圖像token0.45美元,閉源;NVIDIA那條免費路由則是32768上下文、2048維、覆蓋34種語言。目錄裡還有bge-m3、mistral-embed、codestral-embed等備選,不過指南重點測的是前面這批。實測方法值得一說。OpenRouter向19個模型發了雙字符串批量請求,覆蓋批量輸入、可配置維度、圖像輸入、文本加圖像和錯誤處理共28項檢查,16個付費模型每個輸入都穩穩返回一個向量。

dimensions參數在OpenAI3Small、Gemini2和Voyage4Large上均生效,比如把值設成256或512就真返回對應長度的向量;向不存在的模型發請求會收到400錯誤並提示模型不存在。不過要劃清邊界:這些檢查確認的是請求與響應行為,不是檢索質量,響應時間也被排除,因為每個模型的服務條件不同。三條免費路由在測試賬戶裡返回了404,原因是該賬戶隱私設置關掉了允許用免費模型提示詞訓練的提供商——這恰恰提醒開發者,免費開關、工作區護欄或provider.data_collection設為deny,都會讓這類請求直接404。

落到具體場景,英文RAG默認1536維的Small是Large的一半,首次評估保留默認,只有存儲或搜索成本成為瓶頸才考慮縮減;用dimensions=256能進一步壓小向量,但可能傷檢索質量,改現有索引前務必先試。Voyage4系列支持256、512、1024、2048四檔維度,且官方聲明4系列向量彼此兼容,換檔位不必重建索引。多語言這邊Qwen3Embedding8B默認返回4096維、MTEB多語言得分廠商報出70.58,4B版只要2560維、更省資源;bge-m3作為第二開放多語言選項,8192上下文、1024維。

代碼搜索首選voyage-code-4,codestral-embed-2505可作對比,CoIR基準能幫著橫向比。圖文檢索裡Gemini Embedding2把兩種輸入放進同一向量空間,一張64乘64的PNG算258個token、費用0.000128美元;voyage-multimodal-3.5同樣驗證過,64乘64PNG僅89個token、費用0.00003美元,但兩者向量空間不同,建索引前得先定一個。評測上OpenRouter的建議很剋制:同一套語料庫、查詢、相關性標籤、分塊和指標,只換模型,其餘全部固定,結果才可比。

英文RAG從512到1024token的塊加重疊起步,用nDCG衡量多塊相關時的排序;多語言要逐語言上報別讓平均數掩蓋短板;代碼搜索把issue描述映射到解決它的文件和分塊。存儲成本也要算進賬:100萬個4096維float32向量約佔16.4GB,100萬個1024維約4.1GB,公式是向量數乘維度乘每值字節數,選滿足目標的最小維度最划算。最後是一道鐵律:不同模型族的向量不共享座標空間,用3-small建的索引就必須用它生成查詢向量,混用只會得到不可靠結果;Gemini2和001也不同空間,切換要重建。唯一有文檔記錄的例外是Voyage4族內兼容,換檔位前先在樣本上驗證檢索質量。

部署時記得把模型slug、輸出維度、提示詞格式和創建日期隨索引元數據一起存好,方便後續核對配置。至於那些常見疑問——換模型通常要重嵌整個語料、最快模型沒跑延遲基準、ada-002已不再作為新索引默認、免費路由404先查隱私設置——指南都給了直白答覆。對正要搭檢索系統的開發者來說,這份把19個模型按用例、價格、維度排好隊的清單,省下的試錯成本相當可觀。相關推薦中國大模型調用量連續 19 周領跑全球,騰訊 Hy4 preview 單週暴漲 379%據OpenRouter數據,8月31日至9月6日全球AI大模型調用量115萬億Token,環比增1.77%。中國模型周調用量56.

72萬億Token,環比增2.83%,連續19周超美國居首;美國16.54萬億,環比降3.1%。全球前五中四款中國模型,混元Hy4 preview登頂。2026年9月7號 15:10285.6k英偉達 129 億美元收購 Hugging Face,開源 AI 底座歸入算力帝國英偉達擬以129億美元收購開源AI平臺Hugging Face,其年營收約1.5億美元、接近盈利,出價約為年收入80倍。閉源實驗室正降低對英偉達硬件依賴,OpenAI聯手博通自研芯片。英偉達已承諾五年投260億美元發展開源模型,意在搶佔生態。2026年8月27號 16:42373.

7k智譜確認開發Ox Alpha,開源模型權重即將發佈並加入GLM系列智譜確認引發開發者關注的匿名模型Ox Alpha為其GLM系列最新版本。該模型此前以“Stealth”身份上線OpenRouter,在多項基準測試中表現突出。智譜稱其定位編碼、持續智能工作與生產環境推理,將於週三開放權重,供開發者二次開發。2026年8月27號 9:17231.4k一站式搞定多模型:OpenRouter 推出異步視頻生成 API 接入指南應用集成視頻生成並不難,但切換不同視頻大模型時,各服務商端點、參數、任務狀態、輪詢邏輯和輸出格式不一,導致適配繁瑣。

OpenRouter為此推出統一異步視頻生成API,通過標準化工作流簡化開發體驗,降低更換模型的集成成本。2026年8月26號 15:14226.6k匿名模型Ox Alpha登頂OpenRouter,累計調用量超4萬億Token匿名模型Ox Alpha(中文社區稱“牛來”)上線OpenRouter後調用量迅速攀升,登頂模型榜單並刷新單日用量紀錄。前五大應用累計調用已超4萬億Token,熱度從社區嚐鮮擴散至全球開發者及Agent工作流。其開發商仍未公開,OpenRouter將其定位為面向編碼、持續性任務。2026年8月24號 9:18390.

8k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

鈦媒體生成式AI

豆包做手機、阿里造平板:AI開始爭奪硬件控制權

識礁Farsight2026.09.23 11:43 · 來自北京全文3182字00:00 / 09:20大廠為何突然集體“變硬”?文 | 識礁Farsight繼豆包推出“第二代豆包手機”後,阿里也開始“變硬”。2026年9月22日,阿里召開2026雲棲大會,展示了仍在研發中的“千問平板”QwenBook。據《晚點LatePost》報道,QwenBook由阿里雲旗下無影團隊打造,定位原生智能體電腦,產品定義和硬件部分由團隊自研。無影過去做雲電腦積累的系統和端雲能力,將融入其中。

剛剛

​韶音首款 AI 耳機 OpenFit 2 AI 亮相雲棲大會,重磅首發“AI 實驗室”四大新功能

作為開放式耳機領域的領頭羊,Shokz 韶音首次重磅參展,不僅攜旗下首款 AI 耳機 OpenFit2AI 核心亮相,更在現場聯合光帆科技首發了“AI 實驗室”全新功能,全面展現了 Qwen 大模型在音頻可穿戴設備中的深度產業落地。作為韶音佈局智能音頻賽道的開山之作,OpenFit2AI 深度融合了通義千問(Qwen)大模型的強大能力,集長時錄音、AI 會議紀要生成與多語種實時翻譯於一體。

剛剛
鈦媒體生成式AI

GPT-6 Sol和Luna上線,打折比梁文鋒還狠

字母AI2026.09.23 11:08 · 來自北京全文5453字00:00 / 14:27Opus 5.5發佈90分鐘,OpenAI來打價格戰了。文 | 字母AI今夜註定無眠。Opus 5.5剛剛發佈90分鐘,OpenAI就把GPT-6 Sol和Luna一起端了上來。前腳Anthropic剛把Opus的價格砍了一刀,後腳OpenAI直接把刀砍得更深。GPT-6 Sol每百萬Token輸入只要2美元、輸出10美元,價格正好只有Opus 5.5的一半,Astra的五分之一。Luna更誇張,只要0.1美元和0.

剛剛

Claude Code v2.1. 280 落地:Opus 5. 5 正式接棒默認王座,百萬上下文配 4 美元骨折價把賬單壓進地心

最新推送的Claude Code v2.1.280版本里,Claude Opus5.5(claude-opus-5-5)正式被任命為默認Opus模型,這也讓前陣子開發者圈裡流傳的"跳級突襲"傳聞徹底塵埃落定。這枚新旗艦一口氣吞下100萬Token的上下文窗口,定價牌掛得異常兇悍:每百萬Token輸入4美元、輸出20美元,緩存讀取更是壓到每百萬Token0.

剛剛
鈦媒體生成式AI

Meta Muse 爆紅,為什麼騰訊股價大漲?

深流研究所2026.09.23 10:39 · 來自北京全文3733字00:00 / 10:34扎克伯格等來爆款,騰訊跟著被重估。文 | 深流研究所,作者 | 吳絳楓Meta 在 AI 上砸下的重金,什麼時候才能拿到大結果?Muse 給出了第一個答案。

剛剛