Cohere Releases North Small Translate: A 218B MoE Translation Model That Scores 83.6 on WMT26 Across 50 Languages

2026年9月11日 06:57
站內 AI 整理稿

Cohere 與 Cohere Labs 近日推出一款全新的機器翻譯模型 North Small Translate,並以開放權重形式對外釋出,明確鎖定多語系翻譯任務。這款模型最大的特色,在於採用稀疏混合專家(Sparse Mixture of Experts, MoE)架構,總參數量達 218B,但在每一次推理時僅啟動其中 25B 的活躍參數,藉由這種「大模型、小啟動」的設計,在大型模型的表現力與實際運算效率之間取得平衡。從架構角度來看,混合專家架構的核心概念,是把模型內部的運算能力切分為多個專家模組,並透過路由機制,在處理每一個輸入時只挑選其中一部分專家參與計算。

North Small Translate 將這樣的機制推向 218B 的總參數規模,卻把單次推理的活躍參數控制在 25B,意味著模型雖然擁有龐大的整體知識容量,實際執行時所需的運算量卻遠低於同等總參數的密集模型。對需要部署翻譯服務的團隊而言,這直接關係到推論成本與硬體配置的可行性,也讓如此規模的模型不再只是實驗室裡的展示品。根據官方公布的評測數據,North Small Translate 在 WMT26 翻譯基準測試中拿下 83.6 分,支援語言範圍涵蓋 50 種。這項成績與其稀疏 MoE 的設計相互對照,顯示模型並沒有因為每次只啟動部分參數而犧牲翻譯品質。

換句話說,專家分工的方式讓運算資源得以集中在處理當下所需的語言與語意路線上,而不是讓所有參數對每一個字詞都平均出力。稀疏啟用之所以能在翻譯任務上奏效,與翻譯工作的特性有關。不同語言之間的詞序、語法結構與語意對應關係差異極大,模型在處理某一組語言方向時,真正需要動用的知識往往只是整體參數中的一小部分。若能把運算導向與當下語言組合最相關的專家,就有機會在維持品質的同時壓低每次推論的負擔。North Small Translate 在 WMT26 上的表現,正是這種設計思路的一次具體驗證。這款模型的推出,也進一步補足 Cohere 在開放語言模型生態中的多語翻譯能力。

過去 Cohere 在開放權重模型領域已有佈局,而 North Small Translate 的加入,讓翻譯這項對跨語言應用至關重要的能力,有了更完整的對應方案。對於需要建制多語服務的產品團隊來說,一個涵蓋 50 種語言、且以開放權重釋出的翻譯模型,意味著可以在自己的環境中進行部署與調整,而不必完全依賴封閉的雲端 API。官方特別指出,North Small Translate 在低資源語言的處理上展現顯著進展。低資源語言長期是機器翻譯系統的弱項,原因在於這類語言可取得的訓練資料相對有限,模型難以從中學到足夠的語言規律與對應關係,導致翻譯品質明顯落後於英語、中文等資料充沛的語言。

Cohere 此次把低資源語言的表現列為重點,顯示其試圖處理多語翻譯中最難被解決的一塊。當一個模型能夠覆蓋 50 種語言,其中必然包含資料量落差極大的語言組合。對開發者與研究社群而言,開放權重的意義不只是取得一個可用的翻譯工具,更在於能夠檢視、微調與延伸這套模型的行為。研究人員可以針對特定語言對進行測試與改良,開發者則能依照自身產品需求調整推論流程,這些都是封閉模型難以提供的空間。Cohere 以開放權重釋出涵蓋 50 種語言的翻譯模型,也為需要多語能力的開發者與研究社群提供了新的選擇。

在跨語言應用持續增加的環境下,無論是內容在地化、跨境服務、文件翻譯或使用者生成內容的處理,都需要穩定且可負擔的翻譯能力。一個總參數達 218B、單次僅啟動 25B 參數的模型,正好回應了「品質要夠好、成本要能負擔」這兩項往往互相拉扯的需求。整體而言,North Small Translate 的意義可以從三個層面理解。在架構層面,它展示了稀疏混合專家如何把龐大的參數規模轉化為可控的推論成本;在評測層面,WMT26 的 83.

6 分成績與 50 種語言的覆蓋範圍,說明稀疏設計並未成為品質的絆腳石;在生態層面,開放權重的釋出則讓 Cohere 的多語翻譯能力得以進入更多開發者與研究者的工作流程之中。隨著多語系應用成為常態,翻譯模型的競爭焦點也從單純追求分數,逐漸轉向能否在真實環境中穩定運行。North Small Translate 以稀疏 MoE 架構與開放權重形式登場,連同其在低資源語言上的進展,為這場競爭提供了一個值得關注的方向。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

5 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

9 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

11 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

12 小時前