何夕2077模型更新

MiniMax升級全模態

2026年8月2日 00:00

重點摘要

MiniMax 近期浮出全模態升級的消息,相關資訊已重新整理並移除先前混入的模型思考或安全判斷文字。此次升級將產品方向推向全模態整合,讓文字、語音、影像等多種輸入輸出形式能在同一模型中協同運作。目前具體的技術架構與應用場景仍待揭露,後續落地情況值得持續追蹤。

站內 AI 整理稿

MiniMax近期浮出全模態升級的訊息,相關資訊經過重新梳理,過去混在模型輸出或文件中的思考歷程、安全判斷文字也一併被移除。這項調整不只是單一功能的強化,而是產品方向轉向全模態整合的訊號,顯示團隊在模型能力布局上進入新的階段。 全模態整合的核心,是讓文字、語音、影像等輸入與輸出形式,能在同一個模型中協同運作,不再各走各的路徑。使用者可以透過不同媒介與模型互動,模型也能在單一架構內處理並回應跨形式的需求。這種設計若進一步落地,將改變多模態產品的使用體驗方式。 目前關於MiniMax全模態升級的具體技術架構與應用場景,官方仍未對外揭露。實際落地後的產品樣貌、開放時程,以及會先應用在哪些領域,後續都還有待觀察。這波升級能否把多模態整合推向更成熟的階段,仍有待時間驗證。

Related

相關文章

鈦媒體模型更新

Edge AI Daily 早報(8月2日)

DeepSeek-V4-Flash上線,馬斯克關注,AI算力競爭轉向能源;OpenAI Astra攻克10道數學難題,AI獨立研究能力突破;亞馬遜500億美元投資OpenAI,鎖定雲合同;慕尼黑法院裁定Suno侵權,AI版權規則確立。

剛剛
何夕2077模型更新

千問智能體操控真機

阿里巴巴通義實驗室近日發布一項名為 Qwen-UI-Agent 的技術報告,展示新一代圖形介面智慧代理的完整面貌。這款以真實世界為核心的基礎模型,不再只是停留在螢幕理解與按鍵模擬,而是能直接在真實手機、電腦與瀏覽器上執行跨平台任務,甚至可以結合指令列操作,完成更複雜的工作流程。研究團隊形容,這類 GUI 代理有潛力成為數位裝置上的通用執行者,而 Qwen-UI-Agent 正是朝向這個願景邁出的具體一步。

4 小時前
何夕2077模型更新

真實會計場景評測基準發佈

人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。

1 天前
MarkTechPost AI模型更新

DeepSeek 推出 DeepSeek-V4-Flash-0731 重大更新,強化代理與編碼能力

DeepSeek 於 Hugging Face 發布 DeepSeek-V4-Flash-0731,並於 2026 年 7 月 31 日將官方 V4-Flash API 轉為公開測試版。模型卡明確指出此為正式版本,取代先前的預覽版,且架構與參數量不變。效能提升來自重新訓練,而非全新設計。該檢查點附帶 DSpark 推測解碼模組,與 DeepSeek-V4-Flash-DSpark 結構一致。Hugging Face 顯示該儲存庫有 304B 參數,包含在 284B 基礎模型之上的草稿模組。API 方面,deepseek-v4-flash 現原生支援 Responses API 格式,並針對 Codex 進行調整。V4-Pro API 及應用程式與網頁模型則未更新。是否可部署?可以,有兩種截然不同的方式:透過 API 即可部署。

1 天前
MarkTechPost AI模型更新

LingBot-Map 教學:GPU 感知推理與點雲匯出

本教學實作基於 LingBot-Map 的端到端串流 3D 重建流程。首先設定輸入來源、重建參數、檢查點選擇與輸出控制,接著偵測可用 GPU,並根據偵測到的 VRAM 自動調整幀數限制、相機迭代次數、尺度幀與 KV-cache 參數。安裝儲存庫及其相依套件,下載預訓練檢查點,預處理影像或影片幀,並建構具備串流注意力與長程軌跡記憶體的 GCTStream 模型。接著執行混合精度推理,解碼預測的相機姿態與內參數,將深度圖轉換為世界座標點雲,驗證恢復的幾何結構,並視覺化重建場景。

1 天前