分類頻道
電腦視覺
共 18 篇文章,依最新發布時間排序。

試圖擺脫“變態眼鏡”之名,Meta AI 眼鏡升級後擋住指示燈就立即停止拍攝
作者:清源 責編:清源 評論: 8 月 28 日消息,據外媒 The Verge 今天(28 日)報道,Meta 為旗下 AI 智能眼鏡推出了一項更新,旨在修補一個與拍攝指示燈有關的隱私漏洞。此前,佩戴者在開始錄像後再遮住正面的 LED 指示燈,攝像頭仍能繼續工作。

高德發佈首個無長程依賴的萬幀級流式3D重建模型ABot-Recon,以12幀重建萬幀3D場景
阿里巴巴集團旗下高德發布首個無長程依賴的萬幀級流式3D重建模型ABot-Recon。該模型能以12幀輸入重建萬幀3D場景,為業界首見。此技術突破長程依賴限制,有助於提升3D重建的效能與即時性。

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景
開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏
作者:故淵 責編:故淵 評論: 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。

大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分
西北工業大學與香港科技大學團隊提出IQA-T1框架,讓多模態大模型在評估圖像質量時,不再僅憑直覺,而是透過生成噪聲殘差圖、頻譜圖等視覺證據來進行判斷。此方法在七個圖像質量評估基準上取得綜合最優成績,平均PLCC/SRCC達到0.784,並使評估過程更具可解釋性。
Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破
Google DeepMind 近日發表了一款名為 GenCeption 的全新模型,這項研究最大的特點在於利用預先訓練好的影片生成模型,來解決深度估計、影像分割、3D 姿態估計等經典電腦視覺任務。根據 DeepMind 公布的測試結果,GenCeption 在多項主流基準中表現接近甚至超越當前領域的頂尖水準,更值得關注的是,它所需要使用到的訓練資料規模遠低於傳統的專用視覺模型,為電腦視覺的發展帶來截然不同的路徑。

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結
國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。
Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉
Meta 旗下正在研發的全天候 AI 眼鏡原型機,近日經《金融時報》披露更多細節。這款設備被定位為具備「超級感知」(Super Sensing)能力的多模態智能穿戴裝置,能夠以每隔數秒的頻率自動錄製環境音訊並拍攝靜態照片,使用者可透過 Meta AI 即時對捕捉到的內容進行提問、辨識或分析。這項技術一旦量產,將使 AI 眼鏡從被動的資訊顯示器,轉變為主動且持續運作的感知終端。 根據知情人士透露,Meta 這款眼鏡的核心在於全天候運作的多模態感知架構。
具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”
近年來,具身智能領域持續升溫,如何讓機器人像人類一樣精準地感知與理解物理空間,一直是學術界與產業界共同面對的核心挑戰。傳統的視覺模型大多擅長「辨識物體」,能夠回答畫面中有什麼,但對於機器人執行抓取、移動、避障等物理交互任務時至關重要的物體邊界、輪廓以及深度資訊,卻往往力有未逮。這種「空間感的缺失」成為限制機器人從實驗室走向真實場景的關鍵瓶頸。 就在近日,螞蟻集團旗下的具身智慧公司 Robbyant 正式對外開源了一款名為 LingBot-Vision 的模型家族,為這項難題帶來了全新的解方。
機器人“空間感”迎來新解法:螞蟻靈波全新視覺模型,11億參數挑戰70億級能力
機器人前瞻(公眾號:robot_pro) 作者 | 李水青 編輯 | 漠影 機器人前瞻7月7日報道,今日,螞蟻靈波同時丟出兩顆“炸彈”:正式發佈空間感知模型LingBot-Depth 2.0,並同步開源其自研的視覺基座模型LingBot-Vision。一套從機器人視覺表徵底層到深度感知能力的完整技術方案的首次集中亮相。 ▲螞蟻靈波發文(圖源:社交媒體X) LingBot-Depth 2.

CVPR 2026最熱方向,被一家杭州團隊率先跑進了端側!
response: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。</think>: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。 response: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。
PP-OCRv6 登上 Hugging Face:支援 50 種語言的 OCR,參數量從 150 萬到 3450 萬
PP-OCRv6 是 PaddleOCR 最新一代通用 OCR 模型系列,專為真實世界的文字檢測與識別而設計,適用於文件、螢幕截圖、多語言影像、數位顯示等場景。您可先在線評估 PP-OCRv6,再透過 PaddlePaddle、Transformers 或 ONNX Runtime 後端整合輕量且生產就緒的 OCR 功能。
亞馬遜深耕視覺搜索:AI 重塑網購導航與拼貼式購物體驗
亞馬遜近期升級其購物應用,強化視覺搜索和智能交互能力,幫助消費者在海量商品中高效鎖定目標。這得益於對視覺識別技術的持續投入,2024年推出的Amazon Lens功能允許用戶通過圖片搜索,並結合文本進一步精準篩選商品。
Grok Build 0.2.7 重磅更新:/usage、/login 上線,多子代理共享終端 + 圖像理解大提升
xAI旗下AI編碼工具Grok Build發佈0.2.7版本,重點優化用戶管理與多代理協作體驗,提升圖像處理能力和跨平臺易用性。新增/usage命令支持終端內查看用量和配額,/login功能簡化登錄認證與賬號切換,為開發者提供更流暢的本地編碼工作流。

零代碼自主發現科學圖像處理算法,美阿貢國家實驗室提出CVEvolve,具備寫代碼/結果自查/策略優化等全棧能力
美國阿貢國家實驗室近期發表一款名為 CVEvolve 的系統,主打「零代碼」自主發現科學圖像處理算法。這項工具具備從撰寫程式碼、驗證結果到優化策略的全棧能力,目標是讓研究者無需手動編程即可解決複雜影像問題。 科學圖像處理向來依賴專業知識與反覆調參,尤其在顯微影像、天體觀測等領域,手動找出最佳演算法相當耗時。CVEvolve 自動探索演算法的設計模式,有望大幅降低這類工作的技術門檻。