影石 GO Ultra 上線 AI 語音助手:分區域接入千問與 Gemini,拇指相機變身個人 AI 入口
AI資訊AI新閒資訊正文影石 GO Ultra 上線 AI 語音助手:分區域接入千問與 Gemini,拇指相機變身個人 AI 入口發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘影石 Insta360 為 GO Ultra 拇指相機上線 AI 語音助手,按區域採用不同大模型方案:中國大陸地區接入阿里千問大模型,中國港澳臺及海外地區使用 Google Gemini。該功能以影石自研為核心,融合千問的多模態能力及拍照問答能力,端側完成聲紋識別和意圖判斷,雲端承擔問答、模式切換和翻譯等複雜任務,翻譯結果可通過機身揚聲器直接播報。
影石創始人劉靖康稱這將"重新定義拇指相機",並表示其可能成為除 Meta 外存量和出貨量最大的個人 AI 助手。AI 語音助手集成了面對面互譯、拍圖問答和語音問答三項核心能力,用戶可通過語音指令"Hey Kira"或關機狀態下長按拍攝鍵喚醒。面對面互譯支持雙向實時翻譯,覆蓋問路、點餐和購物等場景;拍圖問答在獲得授權後採集鏡頭畫面,對路牌、建築和菜品等內容進行識別並語音反饋;語音問答則不調用攝像頭,直接響應天氣和路線等通用信息查詢。三項功能的組合使拇指相機從單純的拍攝工具升級為可感知、可對話的智能終端。
可穿戴 AI 賽道再添新玩家GO Ultra 於去年 8 月發佈,售價 2598 元,採用 53 克小方塊機身設計,搭載 1/1.28 英寸大底傳感器和 5nm AI 芯片,支持 4K60fps 高幀視頻拍攝。影石將 AI 語音助手引入這一形態,實質上是在可穿戴 AI 硬件賽道中開闢了不同於智能眼鏡和智能音箱的新路徑。
Related
相關文章

一文看懂昇騰超節點:AI Infra已進入系統工程階段
(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 漠影 AI大模型競賽,正在進入新的量級。海外,十萬億參數的大模型已經逐步變成現實;國內,數萬億參數的大模型也在加速追趕。為了訓出真正的SOTA模型,算力集群從萬卡走向10萬卡已成為標配。 然而,一個尷尬的現實是:卡越堆越多,真正被利用起來的算力,卻沒有同步增長。華為的仿真數據顯示,在10萬卡集群中,卡間通信可能消耗了40%以上的訓練時間,算力利用率(MFU)往往不到30%。也就是說,大量昂貴的算力,並沒有真正用於計算。

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。
Alibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editing
Alibaba’s Qwen team has released Qwen-Image-2.1, a unified text-to-image generation and image editing model. Its visual generation component has 7B parameters across 32 single-stream DiT layers.