Artificial Analysis 公佈蘋果 iPhone 17 Pro 跑 8GB 以內本地 AI 性能排名

作者:故淵 責編:故淵 評論: 8 月 26 日消息,Artificial Analysis 於 8 月 24 日發佈博文,宣佈攜手 Liquid AI,發佈面向手機端的 AI 跑分基準,重點關注 AI 模型在蘋果 iPhone 17 Pro 上的表現。其中 Artificial Analysis 負責智能水平測試系統,Liquid AI 負責推理性能測試系統,雙方選用 5 項基準測試:BFCL(Berkeley 函數調用排行榜)IFBench(指令遵循測試)AA-Omniscience(知識與認知相關測試)GPQA Diamond(高難度問答測試)MATH-500(數學問題測試)。
測試模型對象為 4 bit 量化後體積不超過 8GB 的模型,示例包括 Gemma 4 E2B 和 LFM2-2.6B-Exp。當上下文長度限制為 16K tokens 後,平均基準測試得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。當響應時間限制為最長 1 分鐘時,LFM2.5-8B-A1B 排名第 1,隨後是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。Nanbeige4.
2-3B 是 BOSS 直聘旗下的南北閣實驗室推出,僅含 30 億非嵌入參數(總參數約 40 億),採用 Looped Transformer 架構,通過在不增加參數量的前提下複用 Transformer 層(循環兩遍),提高模型的有效計算深度和容量。橫軸表示“輸出 256 個 token 所需的時間(秒)”,縱軸表示“上下文長度限制為 16K 個 token 時的平均基準測試得分”。“Nanbeige4.2-3B”的基準測試得分與“LFM2.5-2.6B”相當。在上下文長度限制為 16K 個 Token 時,平均基準測試得分中得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.
6B。當響應時間限制為最長 1 分鐘時,LFM2.5-8B-A1B 排名第 1,隨後是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。附上相關截圖如下: 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:iPhone 17 Pro,AI手機 AI 的 DeepSeek 時刻:Bonsai 27B 模型登場,蘋果 iPhone 17 Pro 可運行已在 iPhone 17 Pro 上完整運行 Qwen 3.
6,消息稱 PrismML 模型 AI 壓縮技術被蘋果看中蘋果更新 Final Cut Camera 至 2.3 版:iPhone 17 Pro / Max 新增“純淨 HDMI 輸出”全系降價後銷量回升,消息稱蘋果 iPhone 17 系列手機中國區累積激活超 3 千萬臺7999 元起:蘋果 iPhone 17 Pro 系列京東、天貓降價 1000 元iPhone 17 系列是蘋果有史以來最受歡迎的產品線,庫克稱市場需求遠超預期
Related
相關文章

抽成 30%,消息稱月之暗面正就 Kimi K3 AI 模型與微軟、亞馬遜、谷歌開展收入分成談判
作者:沁滄(實習) 責編:沁滄 評論: 8 月 26 日消息,據路透社報道,三位知情人士透露,人工智能初創公司月之暗面正與微軟、亞馬遜以及 Alphabet 旗下的谷歌洽談營收分成協議。該協議將允許這幾家美國雲計算巨頭託管其旗艦模型 Kimi K3。

阿里千問辦公 QwenWork 國際版開啟公測,接入 Slack、Notion 等平臺
作者:沁滄(實習) 責編:沁滄 評論: 8 月 26 日消息,阿里千問辦公官方宣佈,千問辦公國際版(QwenWork)開啟公測。官方表示,國際版產品目前已經接入 Slack、Notion 等海外協作與生產力平臺,未來還將全面連接企業真實的數據庫和工作流;產品還將持續引入更多適配海外場景的 Skills 和協作工具。

Cloudflare 稱 AI 智能體已佔 60% 互聯網流量,同比激增 1700%
作者:故淵 責編:故淵 評論: 8 月 26 日消息,韓媒 chosun 昨日(8 月 25 日)發佈博文,報道稱 Cloudflare 亞太區執行副總裁兼董事總經理 Goran Risticsevich 表示,由 AI 智能體產生的流量在過去 1 年中激增逾 1,700%,目前約佔總流量的 60%。

宇樹智元共用一個大腦!神秘模型Demo炸場,10分鐘一鏡到底
一段長達10分鐘、一鏡到底的機器人實測影片曝光,畫面中宇樹與智元兩款硬體架構迥異的機器人,竟能共用同一個「大腦」並互相協作,完成擦窗、搬箱墊高、中斷後恢復等長程任務。影片全程無剪輯、無遙控、無人工指令,被視為全球罕見的跨本體通用大腦樣本,可能顛覆具身智慧產業的技術判斷與Scaling Law認知。

實測豆包工作:WorkBuddy迎來最強對手?
實測豆包工作:WorkBuddy迎來最強對手?AIX財經2026.08.26 10:00 · 來自福建全文4573字00:00 / 14:08一週補全能力,豆包工作好用嗎?文 | AIX財經,作者 | 雷晶,編輯 | 金璵璠8月25日,字節跳動正式發佈AI辦公Agent產品豆包工作。豆包工作的模型提供自動、豆包2.1 Pro和豆包2.1 Turbo三種選擇,用戶可以根據任務複雜度選擇不同能力。使用入口也比較多,既可以下載獨立App,也可以直接在豆包APP的工作任務區使用,還能從飛書內調用。相比市面上的同類Agent應用,豆包工作最大的特點在於與飛書深度打通,可以在權限範圍內調用企業協作場景中的文檔、聊天記錄、會議紀要等信息,讓Agent參與到日常辦公任務中。在正式發佈之前,豆包用一週時間連續更新了多項辦公Agent能力。8月17日,手機遠程控制電腦上線,用戶可以通過手機訪問電腦文件,直接調取和處理分散在不同設備中的資料。8月18日,Windows虛擬桌面上線,AI可以在獨立環境中執行任務,避免影響用戶自己的電腦環境。8月20日,側邊工作臺上線,將本地文件、飛書文檔、網頁和代碼等內容集中到同一個工作空間。8月21日,技能商店、連接器和工作夥伴功能推出,讓用戶可以將常用流程沉澱下來,後續重複調用。這一系列更新補充了Agent進入辦公場景所需要的幾個環節,既能操作電腦和調用資料,也能在獨立環境中執行任務,還開始嘗試把一次性的操作沉澱為可複用流程。此外,字節也在調整AI辦公業務佈局。8月24日,有媒體爆出TRAE、釦子(Coze)團隊併入豆包體系,其中TRAE Work、釦子將與豆包在工作場景的產品能力進行整合,TRAE IDE及CLI則作為豆包品牌下的編程產品線繼續發展。在這一背景下,作為字節面向AI辦公場景推出的Agent產品,豆包工作實際效果體驗如何呢?我們來一起看看。01.
Artificial Analysis 聯手 Liquid AI 發手機端 AI 跑分:iPhone 17 Pro 跑 8GB 內模型座次出爐
雙方分工明確:Artificial Analysis 負責智能水平測試,Liquid AI 負責推理性能測試,共選用函數調用、指令遵循、知識認知、高難問答與數學五類基準。小模型也能跑出高智能測試對象為 4 bit 量化後體積不超過 8GB、可在端側跑起來的模型,示例包括 Gemma 4 E2B 與 LFM2-2.