商湯大裝置助力智象未來實現視頻生成業務向國產算力無感遷移

2026年8月28日 12:13
商湯大裝置助力智象未來實現視頻生成業務向國產算力無感遷移
站內 AI 整理稿

國產算力跑通視頻生成規模化應用 國產算力走向規模商用,如何跨過從“適配驗證”到“真實生產”的關鍵一步,正成為行業面臨的新課題。近期,商湯大裝置與智象未來以視頻生成業務為切入,跑通了從國產算力適配到規模應用的完整鏈路。對於以圖像、視頻生成模型為核心的AI企業而言,國產化並非簡單地將模型從一種GPU遷移到另一種GPU。尤其是視頻生成模型,參數規模大、推理鏈路長、計算密集度高,從底層算力、推理框架到模型性能、生成效果和工具鏈,每一個環節都可能成為國產化落地的“卡點”。作為全球領先的多模態生成式人工智能創新企業,智象未來(HiDream.ai)致力於打造下一代原生全模態世界模型。

依託自研HiDream系列大模型,智象未來持續佈局商業營銷、影視創作、內容創作等場景,目前,其產品已覆蓋全球100多個國家和地區,服務超過5000萬名專業用戶及4萬餘家企業客戶。作為智象未來重要的AI基礎設施合作伙伴,商湯大裝置持續通過穩定、高效的AI基礎設施,支撐其模型快速研發和迭代。此次,雙方進一步將合作延伸至國產算力適配驗證。圍繞智象未來重點業務,商湯大裝置從底層算力替代出發,深入模型推理、性能優化、生成效果等關鍵環節,通過全棧技術適配與FDE專家服務,幫助智象未來實現在國產算力環境下的平穩運行,為多模態大模型的國產化部署形成可複用樣板。

01依託LightX2V多卡並行,實現視頻生成加速比達93% 對於視覺生成應用而言,性能不足不僅會增加用戶使用成本,也會影響產品體驗和業務規模化應用。因此,此次合作中,智象未來提出了明確的業務指標:在國產算力環境下,實現高清視頻的高效生成,並將端到端生成時長優化至業內領先水平。基於此具體目標,商湯大裝置團隊基於LightX2V進行了多卡並行優化,並進一步探索多機多卡場景下的擴展能力。首先從模型的優化入手,基於訓練-推理聯合優化的思路,通過LightX2V步數蒸餾、CFG蒸餾等訓練方案,在保持視頻質量的同時顯著提升推理速度。

推理過程中,通過引入CFG雙分支並行、Ulysses序列並行、TP並行等多層次並行策略,對視頻生成過程中的計算任務進行拆解與協同調度,在滿足業務效果的基礎上提升多卡資源利用效率和並行加速能力。最終,在國產芯片運行DiT模型的場景下,多卡並行視頻生成加速比達到93%,充分釋放國產算力性能。02效果優化,提升多卡生成效果一致性 如果模型遷移到新的算力環境後生成速度提升了,但人物表情、動作、細節等出現明顯變化,那麼這樣的國產化遷移依然難以真正進入生產環境。在多卡推理過程中,雙方團隊發現,同一模型在單卡和多卡環境下可能存在細微的生成效果差異,例如人物表情等特徵表現不同。

針對這一問題,商湯大裝置團隊進一步優化多卡通信過程,通過重新注入Face特徵等方式,加強多卡推理過程中的特徵一致性,使多卡生成效果進一步向單卡效果對齊。在另一個實際問題中,團隊發現部分視頻在尾幀位置出現手指等細節不清晰的情況。經過排查發現,問題與模型訓練階段和實際推理階段的視頻幀數存在差異有關。針對這一問題,團隊對推理過程進行相應補齊和優化,使長視頻生成過程中的細節表現得到改善。商湯大裝置團隊通過這些細節的調整,逐一解決了國產模型適配國產算力,在走向真實生產環境過程中遇到的工程挑戰。

03支持異構芯片零成本遷移 對於智象未來而言,國產化適配不僅要解決單一芯片的適配問題,還需要應對不同國產芯片之間的異構適配挑戰。針對這一問題,商湯大裝置構建了統一的硬件抽象體系,通過異構硬件初始化、統一設備抽象層、Registry調度工廠、硬件算子插件等,屏蔽了不同底層硬件之間的差異。基於統一抽象體系,實現“一次開發,多平臺適配”,目前已支持10餘種異構芯片上的模型零成本遷移。與此同時,商湯大裝置完成了ComfyUI等主流AI開發工具生態適配,無需改變原有工作流和開發習慣,即可在國產算力平臺完成應用開發與部署,大幅降低遷移和開發成本。

04 FDE專家服務:深入業務,保障全流程閉環 對於智象未來這樣的AI科創企業而言,模型研發和產品迭代本身就需要投入大量資源。如果再投入大量人力完成國產化環境下的適配和遷移,無疑會增加額外的人力成本和時間成本。為此,商湯大裝置通過FDE(Forward Deployed Engineer)專家服務模式,將專業工程能力深入到智象未來業務場景。此次合作中,商湯大裝置並非僅提供底層國產算力和平臺能力,而是組織專業工程團隊圍繞智象未來實際業務需求,深入參與國產化適配全過程:從模型遷移、算子優化、多卡並行,到生成效果調優、工具鏈適配,再到最終的業務效果保障,圍繞實際業務指標逐項排查和解決問題。

這種“算力平臺+工程專家”的協同方式,可以幫助AI企業減少國產化遷移過程中大量的工程投入,將更多研發資源聚焦於模型創新與產品迭代。05 業務落地:國產算力支撐規模化短視頻創作 在商湯大裝置AI 基礎設施能力和FDE專家團隊的支持下,智象未來圖像模型已完成國產算力適配驗證,並進一步支撐規模化線上流量及短視頻創作。此次商湯大裝置與智象未來的合作實踐,驗證了國產算力支撐視頻生成業務的一條可複用路徑:以底層異構算力為基礎,以統一硬件抽象體系和開發工具適配為連接,以模型性能與生成效果優化為核心,再通過FDE專家服務深入業務現場,最終實現國產算力從全棧適配、技術驗證到規模生產的完整閉環。

未來,雙方還將圍繞更多AI應用場景深化合作,共同探索國產AI基礎設施與生成式AI應用融合發展的更多可能,推動國產算力從“能用”加速邁向“好用”,助力AI創新企業更加高效地實現技術創新與業務規模化落地。

Related

相關文章

鈦媒體生成式AI

小龍們繞過辦公agent

小龍們繞過辦公agent字母榜2026.08.28 12:33 · 來自北京全文4617字00:00 / 12:40DeepSeek除外,做了“半個”agent。文 | 字母榜辦公Agent成了巨頭們的新角鬥場。但在這場熱鬧裡,智譜、月之暗面、MiniMax等小龍們卻相當冷靜,沒有搞出多大動靜。其實小龍們也做了——Kimi在6月發佈了Kimi Work,智譜在3月發佈了AutoClaw,DeepSeek則在8月開源了 DeepSeek Harness。但很顯然,這並不是什麼“辦公Agent”,只是個人桌面而已。不是小龍們不想跟,辦公Agent走的是企業採購,收入又高又穩定,尤其是準備IPO的階段,有幾單這樣的合同,能讓財報漂亮很多。是小龍們跟不了,他們的基因和體量天然決定了小龍們不適合這條賽道,一旦強行踏入,不僅僅是虧本的問題,還可能耽誤公司AGI主線。01巨頭敢all in辦公Agent,倒不是因為模型多強,相反,在這方面其實是小龍們領先的。以Agent的基準測試為例,Kimi K3在SWE Marathon這項長程工程測試裡拿了42分,比Claude Opus 4.8和GPT-5.6 Sol都高;BrowseComp長週期信息檢索91.2%,全球第一;Terminal-Bench 88.3 分,OSWorld-Verified 84.8 分。智譜8月14日發佈的GLM-5.3更猛,Terminal-Bench 3.0從5.2的4.6分飆到28.3,DeepSWE v1.1從46.2漲到 66.9,接近Claude Fable 5的69.7;Agents' Last Exam從23.8提到28.5,超過Kimi K3的27.6和Opus 4.8的25.7—,並且三項Agent相關基準全部拿了開源第一。所以巨頭其實才是“弱勢的一方”。那麼巨頭贏在哪?贏在對客戶組織架構的理解

剛剛
量子位生成式AI

智譜 GLM-5.3-Flash上線,商湯大裝置提供國產算力支持

國產異構助力前沿智能進入普惠時代 8月26日晚,智譜正式上線並開源GLM-5.3-Flash(320B-A18B),這是GLM-5系列的首個原生多模態模型。其總參數320B,能力超過GLM-5.2,在全球權威的Artificial Analysis Intelligence Index(AA綜合智能指數)中取得57分,進入全球前沿模型能力區間,與Anthropic最受歡迎的模型Claude Opus 4.8得分持平。GLM-5.

剛剛
IT之家生成式AI

谷歌推出《Pokémon Sleep》聯名款 Fitbit Air 活動追蹤器

首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>智能穿戴 谷歌推出《Pokémon Sleep》聯名款 Fitbit Air 活動追蹤器 2026/8/28 10:21:20 作者:溯波(實習) 責編:溯波 評論: 8 月 28 日消息,Google(谷歌)當地時間 27 日宣佈推出《Pokémon Sleep》聯名款 Fitbit Air 無屏活動追蹤器。

剛剛
鈦媒體生成式AI

OpenAI的“親兒子”,想要用中國開源模型拿回自主權

Alter2026.08.28 08:17 · 來自浙江全文4602字00:00 / 11:42Harvey走出OpenAI圍城。文 | Alter一個禮拜前,美國法律科技公司Harvey在X上官宣了一則消息:隆重推出基於Kimi K3訓練的首個自有模型Harvey Tenet。消息一齣,迅速在AI圈掀起了一場波瀾。基於開源模型後訓練的事已經屢見不鮮。早在3月份,Cursor的自研編程模型Composer 2,就被扒出是基於Kimi K2.

剛剛
MarkTechPost AI生成式AI

Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages

Google has released Gemini 3.5 Transcribe, a speech-to-text model for real-time voice interfaces and recorded audio. It ships as two endpoints, not one. gemini-3.5-transcribe handles pre-recorded files through the Interactions API. gemini-3.5-transcribe-live handles bidirectional streaming through the Live API. Google reports average word error rates of 4.0% streaming and 2.6% non-streaming, as measured by Artificial Analysis. Time to final transcription improves 70% over Chirp 3, the previous model. Automatic detection covers more than 85 languages, including mid-sentence code-switching. The split between the two endpoints is the part worth planning around. They do not share the same feature set, limits, or price. Is it deployable? Yes, but API-only. There are no open weights and no self-

24 分鐘前