MiniMax升級全模態
重點摘要
MiniMax 近期浮出全模態升級的消息,相關資訊已重新整理並移除先前混入的模型思考或安全判斷文字。此次升級將產品方向推向全模態整合,讓文字、語音、影像等多種輸入輸出形式能在同一模型中協同運作。目前具體的技術架構與應用場景仍待揭露,後續落地情況值得持續追蹤。
MiniMax近期浮出全模態升級的訊息,相關資訊經過重新梳理,過去混在模型輸出或文件中的思考歷程、安全判斷文字也一併被移除。這項調整不只是單一功能的強化,而是產品方向轉向全模態整合的訊號,顯示團隊在模型能力布局上進入新的階段。 全模態整合的核心,是讓文字、語音、影像等輸入與輸出形式,能在同一個模型中協同運作,不再各走各的路徑。使用者可以透過不同媒介與模型互動,模型也能在單一架構內處理並回應跨形式的需求。這種設計若進一步落地,將改變多模態產品的使用體驗方式。 目前關於MiniMax全模態升級的具體技術架構與應用場景,官方仍未對外揭露。實際落地後的產品樣貌、開放時程,以及會先應用在哪些領域,後續都還有待觀察。這波升級能否把多模態整合推向更成熟的階段,仍有待時間驗證。
Related
相關文章

Edge AI Daily 早報(8月2日)
DeepSeek-V4-Flash上線,馬斯克關注,AI算力競爭轉向能源;OpenAI Astra攻克10道數學難題,AI獨立研究能力突破;亞馬遜500億美元投資OpenAI,鎖定雲合同;慕尼黑法院裁定Suno侵權,AI版權規則確立。
MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
這篇消息聚焦「MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
真實會計場景評測基準發佈
人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。
DeepSeek 推出 DeepSeek-V4-Flash-0731 重大更新,強化代理與編碼能力
DeepSeek 於 Hugging Face 發布 DeepSeek-V4-Flash-0731,並於 2026 年 7 月 31 日將官方 V4-Flash API 轉為公開測試版。模型卡明確指出此為正式版本,取代先前的預覽版,且架構與參數量不變。效能提升來自重新訓練,而非全新設計。該檢查點附帶 DSpark 推測解碼模組,與 DeepSeek-V4-Flash-DSpark 結構一致。Hugging Face 顯示該儲存庫有 304B 參數,包含在 284B 基礎模型之上的草稿模組。API 方面,deepseek-v4-flash 現原生支援 Responses API 格式,並針對 Codex 進行調整。V4-Pro API 及應用程式與網頁模型則未更新。是否可部署?可以,有兩種截然不同的方式:透過 API 即可部署。
LingBot-Map 教學:GPU 感知推理與點雲匯出
本教學實作基於 LingBot-Map 的端到端串流 3D 重建流程。首先設定輸入來源、重建參數、檢查點選擇與輸出控制,接著偵測可用 GPU,並根據偵測到的 VRAM 自動調整幀數限制、相機迭代次數、尺度幀與 KV-cache 參數。安裝儲存庫及其相依套件,下載預訓練檢查點,預處理影像或影片幀,並建構具備串流注意力與長程軌跡記憶體的 GCTStream 模型。接著執行混合精度推理,解碼預測的相機姿態與內參數,將深度圖轉換為世界座標點雲,驗證恢復的幾何結構,並視覺化重建場景。