AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線

2026年7月31日 08:01

重點摘要

AI資訊最新AI日報正文AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線發布於最新AI日報時間 :Jul 31, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。

站內 AI 整理稿

今日AI領域迎來多項重磅進展,從基礎模型到應用落地,各大廠商密集發布新產品與技術突破,展現出人工智能產業持續加速的態勢。MiniMax正式發布通用全模態模型H3,字節跳動推出Seedance 2.5視頻生成模型,DeepSeek-V4-Flash正式版也同步上線,引發業界廣泛關注。 MiniMax此次推出的H3模型實現了文本、圖像、視頻、音頻四大模態的統一理解與生成,標誌著多模態生成模型從專用工具向通用助手轉型的重要一步。據了解,H3在指令遵循、品牌信息呈現以及V2V動作遷移等場景中已展現出商用級別的穩定性,能夠直接應用於廣告、電商、遊戲、UI設計等多個商業領域。在技術層面,H3支持原生雙聲道音視頻輸出,最高可生成15秒2K分辨率的內容,同時引入Contextual Omni Representation技術,讓自然語言成為連接各類模態的通用橋樑。此外,H3在設計初期便考慮了多款國產芯片的兼容性,MiniMax更宣布將在符合相關法律法規的前提下開源H3模型權重,此舉可望進一步降低國內企業在多模態AI應用上的技術門檻,推動開源生態建設。 與此同時,字節跳動發布的Seedance 2.5視頻生成模型也備受矚目。該模型將單次視頻生成時長提升至30秒,並具備長敘事能力、多模態參考和編輯能力,讓AI視頻創作從單純的片段生成走向完整的敘事表達。Seedance 2.5支持多鏡頭敘事和邏輯關聯的鏡頭組織,同時具備多輪延長能力,能夠在續寫過程中保持人物主體、場景、畫面風格及音效的高度一致性。更值得關注的是,該模型支持輸入最多30張圖片、10段視頻和音頻,可精準還原多人形象與聲音,為創作者提供更為豐富的素材控制空間,這也意味著AI視頻生成開始具備「講故事」的能力。 在語言模型領域,DeepSeek-V4-Flash正式版API公測上線,標誌著該公司在Agent賽道上的重要進展。這款模型在多項基準測試中表現優異,性能逼近旗艦模型V4-Pro,但激活參數僅為130億,具有顯著的成本優勢,特別適合Agent場景的應用部署。值得一提的是,DeepSeek自研的Agent框架DeepSeek Harness也在此次發布中首次亮相,同時模型支持OpenAI的Responses API格式,讓開發者能夠便捷地進行應用遷移,降低切換成本。 機器人領域同樣迎來技術突破。DeepMind發布的Gemini Robotics ER2模型在多機器人協同、實時決策和任務監控方面取得重大進展。新一代具身推理模型實現了多機器人協同作業的突破,透過實時決策與持續任務監控機制,大幅提升任務執行效率。此項技術引入多機器人協作機制,被視為具身智能向規模化商用邁出的關鍵一步,未來在工業自動化、物流調度等場景具有廣闊的應用前景。 地圖與空間計算領域也迎來AI能力的深度融合。谷歌宣布將最新Nano Banana2 AI圖像生成模型集成至Google Earth,面向全球用戶開放AI圖像生成功能。用戶可透過輸入場景描述,生成高精度的自定義圖像,這項功能適用於教育、專業應用及個人創作等多個場景。生成式AI進一步融入數字地圖和空間計算平臺,可望為教育、城市規劃、建築設計等行業帶來更豐富的可視化應用空間。 開源生態方面,華為正式開源盤古AI模型品牌openPangu旗下的openPangu-2.0-Pro大模型。這款基於昇騰NPU訓練的大規模混合專家(MoE)語言模型,總參數規模約5050億,支持512K上下文長度,訓練數據規模約34兆Tokens,並透過後訓練階段進一步提升綜合性能。華為同步開放模型權重、基礎推理代碼及技術報告,為開發者和企業提供基於昇騰原生訓練與推理技術的最佳實踐,持續推進昇騰AI生態建設。 語音識別領域也有新產品問世。阿里千問發布Qwen-Audio-3.0-ASR-Flash模型,在五大維度實現升級,包括長音頻上下文記憶、內置多行業詞庫、分級熱詞定製、集成語音潤色以及多語言支持。在長音頻處理方面,模型可在轉寫時參考前文語義,確保長達數小時會議中的人名、技術概念全程保持一致。在專業場景表現上,醫療場景專業詞召回率達95.36%,IT編程場景達91.87%。此外,該模型一套系統覆蓋30餘種語言,七語種平均語義錯誤率為17.09%,表現優於Azure、Gemini等同業模型,已在會議紀要、實時字幕、教育錄播和智能客服等場景廣泛應用。 智能汽車領域同樣迎來AI能力的落地。特斯拉中國正式推送2026.14.13版本的車機軟件更新,此次更新最引人注目的亮點是引入豆包大模型,提升車機系統的智能交互體驗。不過該功能需要用戶開通高級車載娛樂服務才能使用,這也反映出汽車廠商與AI大模型廠商之間的合作模式正在加速成型。 從今日發布的多項產品與技術進展來看,AI領域正呈現出多元化的發展態勢。多模態模型從單一能力向通用方向演進,視頻生成從短片段走向長敘事,語言模型在成本與性能之間尋找最佳平衡點,機器人技術則向規模化商用持續邁進。各廠商在底層模型、應用場景與開源生態上的全面布局,正在共同推動人工智能產業走向更為成熟和多元的發展階段。

Related

相關文章

DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題

AI資訊AI新閒資訊正文DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘DeepSeek V4 正式版自 7 月中旬開啟灰度測試後一度跳票,官方至今未公佈確切發佈時間。但多個新證據指向 8 月 3 日可能成為重要節點——硅基流動率先露出馬腳。

17 分鐘前8400

韓國最大 AI 模型問世:LG 發佈 7500 億參數 K-EXAONE 2.0,Apache 開源直面中國模型

LG AI研究院發布韓國最大AI基礎模型K-EXAONE 2.0,總參數達7500億,採用混合注意力MoE架構,並以Apache 2.0許可證完全開源。該模型在多項基準測試中表現優於初代,同時在長上下文理解與智能體工具使用等能力上直接對標智譜GLM-5.1、Qwen3.5等中國開源模型,顯示東亞開源AI競爭加劇。

47 分鐘前5500

顛覆影視創作!字節跳動王牌模型Seedance 2. 5 正式發佈, 30 秒一鏡成片時代來了

字節跳動Seed團隊正式推出新一代音視頻聯合生成模型Seedance2.5,主打「一鏡成片」,單次生成時長由15秒提升至30秒,並支援多輪無縫延長。模型強化長敘事、多模態參考與後期編輯能力,並優化材質、光影與膚質,呈現更接近實拍的影視級質感。目前Seedance2.5正陸續登陸即夢AI、豆包專業版,API則將於近期上線火山方舟。

47 分鐘前6700

特斯拉中國車機正式接入豆包大模型

特斯拉中國自7月31日起分批次推送2026.14.13版車機軟體更新,涵蓋Model 3、Model Y、Model S與Model X等車型,核心升級是正式導入豆包大模型。該模型可提供即時資訊查詢與自然流暢的語音對話,提升車內智慧互動體驗,但需開通高級車載娛樂服務才能使用。

47 分鐘前6600

DeepSeek-V4-Flash API公測上線 Agent能力全面爆發

AI資訊AI新閒資訊正文DeepSeek-V4-Flash API公測上線 Agent能力全面爆發發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘科技圈迎來新一輪效率革命。字節跳動旗下 Seed 團隊正式推出了Seedance2.5音視頻聯合生成模型,主打“一鏡成片”能力,全面賦能多個產業場景。在敘事表現上,Seedance2.

47 分鐘前8100