大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分

2026年7月20日 15:50
大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分

重點摘要

西北工業大學與香港科技大學團隊提出IQA-T1框架,讓多模態大模型在評估圖像質量時,不再僅憑直覺,而是透過生成噪聲殘差圖、頻譜圖等視覺證據來進行判斷。此方法在七個圖像質量評估基準上取得綜合最優成績,平均PLCC/SRCC達到0.784,並使評估過程更具可解釋性。

站內 AI 整理稿

多模態大模型在評估圖像品質時,經常出現「看走眼」的情況。一張乾淨的照片與一張經過雜訊添加、壓縮處理或輕微模糊的「退化版本」,對人類而言品質差異顯而易見,但在多模態大模型的「視覺系統」中,這兩張圖幾乎難以區分。因此,模型給出的分數往往流於主觀臆測,而非基於客觀證據的判斷。為了解決這個問題,來自西北工業大學與香港科技大學的研究團隊提出了一項名為「IQA-T1」的新框架。這項技術首次讓多模態大模型在進行圖像品質評估時,能夠像專業檢測員一樣,不再僅依賴「瞥一眼」的直覺,而是主動調用一套專業分析工具,生成雜訊殘差圖、梯度分佈、傅立葉頻譜等結構化的「視覺證據」,並逐步根據這些證據做出判斷。

這項突破的核心在於將評估過程從「憑感覺打分」轉變為「拿證據說話」。研究團隊在七個圖像品質評估基準上進行測試,結果顯示IQA-T1取得了綜合最優的成績,平均皮爾森相關係數(PLCC)與斯皮爾曼等級相關係數(SRCC)達到0.784,同時其評估過程具備可解釋性與可追溯性,讓模型的決策邏輯更加透明。圖像品質評估的目標,是讓機器給出的分數盡可能貼近人類的主觀感受。這項技術是圖像修復、增強、壓縮等一系列視覺任務的關鍵裁判,直接影響視覺系統在真實開放環境中的穩定性與實用性。

然而,現有的多模態大模型在處理這項任務時,往往面臨兩大困境:一是純文字推理容易受到語義偏見的誤導,二是區域裁剪推理只能產出一堆缺乏解釋的圖像區塊,無法提供有說服力的分析依據。IQA-T1的設計思路,正是針對這些痛點進行革新。研究團隊讓模型在評估過程中,先透過工具生成多種專業的視覺證據圖,例如雜訊殘差圖可以凸顯影像中的異常雜訊分佈,梯度分佈圖則能反映邊緣與紋理的清晰度,傅立葉頻譜圖則能揭示影像的頻率特性。這些證據圖就像「物證」一樣,為模型的評分提供了具體且可量化的依據。

舉例來說,當模型面對一張可能經過壓縮的圖片時,它不再只是憑藉過往訓練資料的記憶來猜測分數,而是會先產生一張頻譜圖,觀察高頻成分是否被削減,再結合梯度圖檢查邊緣是否模糊,最後綜合這些證據給出一個合理的品質分數。這種方法不僅提升了評分的準確性,也讓使用者能夠清楚理解模型為何給出某個分數。研究團隊在論文中指出,IQA-T1的表現不僅在標準基準測試中領先,更在跨資料集的泛化測試中展現出優異的穩定性。這意味著該框架能夠適應不同類型的圖像退化情況,而不會因為訓練資料的侷限而產生偏差。這對於實際應用場景,例如社交媒體上的圖片壓縮、監控影像的品質監控,或是醫學影像的清晰度評估,都具有重要的意義。

此外,IQA-T1的評估過程具備高度的可解釋性,這在人工智慧倫理與可信度日益受到重視的今天,顯得尤為關鍵。傳統的黑箱模型往往難以讓人信任其判斷,而IQA-T1透過生成視覺證據,讓模型的決策路徑變得清晰可見,有助於開發者與使用者共同驗證其正確性。目前,這項研究已引起學術界與工業界的廣泛關注。許多專家認為,IQA-T1不僅為圖像品質評估領域開闢了新的研究方向,也為其他需要細緻視覺分析的任務提供了可借鏡的範例。未來,研究團隊計畫進一步最佳化該框架的運算效率,並探索將其應用於影片品質評估、三維模型品質分析等更複雜的場景。總體而言,IQA-T1的出現標誌著多模態大模型在圖像品質評估領域的一次重要躍進。

它讓模型從「憑感覺」的直覺判斷,進化到「看證據」的理性分析,不僅提升了評分的準確性,也為人工智慧系統的可信度與透明度樹立了新的標竿。隨著這項技術的持續發展,未來我們或許能夠期待一個更加可靠、更具解釋力的視覺評估時代的到來。

Related

相關文章

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景

開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

2 天前
量子位電腦視覺

與AI共生:2026微信小程序開發大賽WAIC官宣啟動

2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

1 週前
IT之家電腦視覺

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏

首頁 > 智能時代>人工智能 谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏 2026/7/21 15:00:10 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。

2 週前

Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破

AI資訊AI新閒資訊正文Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。

2 週前4200
智東西電腦視覺

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結

國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。

3 週前