何夕2077模型更新

Kimi K3發佈並開源全部權重

2026年7月29日 00:00

重點摘要

Kimi K3發佈並開源全部權重。 月之暗面推出 2.8T 規模的 MoE 巨模。原生視覺 ���️ 完美支撐 百萬上下文 運行。新提出的 KDA ��� 極大優化了長序列信息流。歡迎前往 查看原始論文詳情 獲取權重。

站內 AI 整理稿

**月之暗面发布Kimi K3:2.8T参数MoE全部开源,原生视觉与百万上下文加持**

近日,国内人工智能独角兽月之暗面(Moonshot AI)正式推出新一代大型语言模型Kimi K3,并宣布将模型全部权重对外开源。这一消息迅速引起国内外AI社区高度关注,因为Kimi K3不仅在参数规模上达到惊人的2.8万亿(2.8T),更采用前沿的混合专家(MoE)架构,原生内置视觉能力,并完美支持百万token级别的超长上下文。作为业界极为稀有的超大規模开源模型,K3的诞生让人们再度审视开源大模型的能力天花板。月之暗面自成立以来,一直专注于通用人工智能的底层探索。此前旗下Kimi K2已凭借优秀的文本理解能力积累口碑,而全新的K3则在架构与能力上实现了质的飞跃。2.

8T的总参数体量,使其轻松跻身目前全球最大的开源语言模型之列。但更值得注意的是,K3并非一味堆叠参数,而是通过MoE设计将效率与容量进行了巧妙平衡——这在算力仍然紧张的当下,极具现实意义。MoE架构是近年大模型领域的关键技术方向。Kimi K3内部集成了大量“专家”子网络,每次推理时仅激活其中与输入相关的一部分专家,从而在保留超高模型容量的同时,显著降低计算成本。这一机制让K3在运行百亿级参数时仍能保持较快速度,为企业级部署提供了可能性。相比传统密集模型,MoE架构在大规模扩展方面优势明显,而K3无疑将这一技术路径推到新的高度。

在多模态融合方面,Kimi K3实现了原生视觉理解能力的嵌入,而不是通过外部插件或后期拼接。这意味着模型能够直接接收并处理图像与文本混合的复杂数据,包括扫描文档、截图、图表以及带说明的图片等。这种原生的图文融合能力极大地拓宽了应用场景:从智能办公中的文档解析,到教育领域的多模态学习辅导,再到内容创作中的图文自动生成,K3都能提供更完整、更自然的理解与输出。超长上下文是Kimi系列一直以来的技术标签,在K3上这一优势被推向极致。百万token级别的输入窗口,让模型可以一次性处理长篇书籍、完整法律卷宗、大型代码库等海量信息。

传统大模型在处理长文本时容易出现注意力稀释、性能退化等问题,而K3通过架构层面的原生设计,确保在如此庞大的上下文范围内仍能保持稳定连贯的语义捕捉能力。这使得全面分析、跨章节推理、复杂文档问答等任务变得前所未有的顺畅。为了攻克超长序列带来的技术难点,研发团队在K3中引入了一套全新设计的信息流动优化机制——KDA。这一机制通过对关键注意力节点的动态聚合,重塑了模型在处理海量token时对重要信息的捕捉路径,显著提升了长文本场景下的信息传递效率。得益于KDA的支撑,K3在百万级输入窗口下依然能够维持高水准输出,精准定位并关联关键内容,有效解决了长距离依赖中的性能瓶颈。

在开源策略上,月之暗面此次表现得相当彻底。Kimi K3的完整模型权重已在官方平台开放下载,同时一并发布了详细的技术论文。开发者不仅可以直接拿到这套超大模型的全部参数,还能根据论文理解其技术原理,并在此基础上进行二次开发,包括微调、蒸馏、垂直场景定制等。在当前部分主流模型逐步走向闭源的背景下,K3的开源无疑是一场强心剂,给全球开发者贡献了一枚重磅基座资源。业界分析认为,Kimi K3的发布标志着开源大模型进入“万亿参数时代”。过去,万亿级以上模型多集中在极少数科技巨头手中,且鲜少对外开放完整权重。K3的出现打破了这个格局,不仅降低了超大模型的使用门槛,也让学术界和中小型团队有机会触碰前沿技术。

尤其是,K3同时具备视觉理解、长上下文、MoE架构三大前沿属性,这种组合使它在应用层面拥有极强的催化潜能,催生新形态的智能应用。从技术路线来看,K3所验证的MoE路径与开放共享的生态思路,可能会影响未来大模型发展方向。一边是效能兼顾的稀疏架构,一边是知识共享的开源精神,两者结合将进一步拉低大模型落地应用的准入门槛。月之暗面方面表示,K3的开源只是第一步,团队将根据社区反馈持续优化模型,并在后续版本中延续开放式路线。如此格局,不仅提升了国内AI在国际开源社区中的话语权,也为千行百业的智能化转型提供了更实在的基座选择。总体而言,Kimi K3以2.

8T的超大参数规模、原生的视觉能力以及百万token上下文的极限支撑,重新定义了大语言模型的能力边界。更为难得的是,其全面开源策略让这一先进模型不再为少数企业所垄断,成为全球开发者共享的技术成果。在大模型竞赛日益白热化的今天,K3的亮相无疑为行业注入了一股强劲且开放的崭新动力。未来,它将在知识管理、智能内容生产、辅助决策等多个维度释放巨大价值,值得持续关注。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前