我們讓 GPT‑6 Astra、Fable 5.1 和 Sol 控制同一臺機器人:誰真的把活幹完了?

2026年9月30日 07:38
站內 AI 整理稿

真實雲臺實測:三個模型都讓機器轉起來,但“完成”的標準天差地別。作者丨Rhea 編輯丨李娜 岑峰 雲臺機械臂是一個能上下左右轉動的攝像頭底座/支架,我用GPT‑6 Astra、Claude Fable 5.1 和 GPT‑5.6 Sol這三個頂級模型都讓機器人轉了起來,三個模型均完成了任務,但執行路徑、驗證標準和成本差異明顯。這次 GPT-6 Astra 出來之後,網上已經有很多優秀的測評案例了。如果讀者已經能在其他地方看到這些,這個評測還能提供什麼新的觀察呢?在純數字環境裡,寫錯一段代碼通常可以撤回,按鈕點偏了也可以重來;但現實世界不是這樣:實體設備有慣性、有邊界、有反饋,也有真實的風險。

命令發出去,不代表動作一定到位;走什麼路徑、使用多快的速度、什麼時候停手、要不要確認結果,都會變成模型必須自己做出的選擇。【先給大家跳段舞】雲臺機械臂剛好是一個很合適的切口。它的動作足夠簡單,不需要機器人專業知識也能看懂;同時,速度、路徑、幅度和停頓又會被直接呈現在眼前。原本藏在模型內部的判斷,會變成一段肉眼可見的運動。(劇透一下,通過雲臺的測評,你能一眼看出來三個模型的區別)筆者之前搞到過一個二手的雲臺機器人。

搞笑的是樹莓派被商家扣下了,於是只能用 macmini 來驅動它,並且開始調試的時候發現這機器固件有很大問題,兩個月前單純把它復活就燒掉了快兩千人民幣的 token(那時候主力用的是 opus 4.8)【不知道 opus4.8 給發過多少成功戰報,但依然每次以“我真的錯了”來結尾】 筆者一度懷疑這問題到底是個人能力的天花板,還是模型的天花板。好在後面修復是搞定了,也陸續做了一些人臉、手掌的跟隨功能,但因為調試起來確實燒錢,也沒什麼有意思的地方,就逐漸閒置了。總之就是小機械臂的可玩性和可能性非常誘人,但彼時的模型能力讓筆者沒動力繼續嘗試。

因此這次看到 GPT-6 Astra 各種勁爆的能力秀之後,瞬間就想起了這臺半吃灰狀態的雲臺機器人。如果當初用的不是 Opus4.8,那結局會不會不一樣。於是筆者把一臺兩軸雲臺機械臂接到了 Mac mini 上,然後把同一句話分別交給 GPT-5.6 Sol、GPT-6 Astra Pro 和 Claude Fable 5.1:“我 Mac mini 接了一個小機器人,不管你用什麼方式,讓它滿行程轉一遍。”(天知道兩個月前要讓這句話跑起來,我付出了啥) 這次筆者沒有規定速度,也沒有解釋什麼叫滿行程(這是之前最大坑),也沒有告訴它要不要走四個角,也沒有給出成功標準。反正就是啥也沒給。

因為真正想看的是:像之前一樣不知道速度、路徑、風險邊界和成功標準時,頂級模型會怎麼思考,能不能把事情真正搞定。我們先把實測結論一次性放出來。面對同一臺雲臺、同一句測試水平與垂直滿行程的模糊指令,三個模型最終都完成了任務,但它們理解的完成並不是一回事:GPT-5.6 Sol 優先補足空間覆蓋,連四個極限角都要走到;GPT-6 Astra Pro 用更少的動作證明邊界,卻為每一步加上了最嚴格的反饋驗證,在本次會話中也產生了最高賬單;Claude Fable 5.1 追求速度、組合覆蓋和可複用交付,卻在成功判定上最為樂觀。

從三個模型的選擇上能看出它究竟更在意覆蓋、驗證,還是執行感;願意花多少時間和成本換取確定性;以及任務結束後,留下的是一個結果、一套證據,還是一件下次還能複用的工具。後文會把這些差異逐一拆開,也會說明哪些已經被完整日誌證實,哪些還只能算一次實測中的初步觀察。如果把三次執行畫成三個人,他們大概是這樣的:GPT-5.6-sol 是覆蓋型製圖師。它拿著地圖,願意把整個空間走一遍,四個角都踩到,才覺得這件事有了完整的形狀。GPT-6-Astra 是剋制的測試工程師。動作不多,速度不快,不太在乎表演是否熱鬧;但每走到一個點,都要拿反饋確認自己真的到了。Claude Fable 5.1 是激進的現場工程師。

動作大、節奏快,傾向於把能覆蓋的地方都覆蓋,還順手把這次任務寫成一件下次能繼續用的工具。如果要用一句話給它下一個定性結論,我覺得是:GPT‑6 Astra 目前不是能力榜和價格榜上的第一,但確實是目前最擅長用更少動作、換取更高確定性的模型。咱們先看看結果。三個模型都讓機器人轉了起來,GPT 調用雲臺的時候都很保守,但 Fable 卻開心的像個瘋子。如果從會不會調用工具,比如說看固件看項目歷史文檔早就不是最有意思的問題了。問題是在於這些頂尖模型為啥在物理硬件上表現出這麼大的差距?01Astra少轉四次,是聰明還是偷懶?從視頻上可以直接看出來 Astra 明顯轉得更少。

它把整件事壓縮成 7 步:回中,水平向左,水平向右,再回中;俯仰向上,俯仰向下,最後回中。兩條軸分別抵達兩端,任務結束。也就是說 Astra 上下所有分別試探一下就結束給報告了。Fable 做了 12 步。除了相同的單軸掃描,它還把左上、右上、右下、左下四個組合極限位完整走了一圈。Sol 的視頻和結果截圖也能確認,它同樣走過了四個角。一個動作序列像十字,另外兩個則補出了一個矩形。那為什麼 Astra 不做複合運動呢?如果站在測試工程師的角度,Astra 的邏輯其實很成立:這是一臺兩軸設備。只要水平軸分別到達左右邊界,俯仰軸分別到達上下邊界,就已經證明了兩個軸各自的行程。

四個角不會增加新的單軸邊界信息,不過是把兩個已經驗證過的動作疊在一起。Fable 和 Sol 對這句話的理解則更接近人類觀看一場演示時的直覺:既然你說轉一遍,那我不只要證明兩個軸能動,還要把整個活動空間走給你看。四角當然不是純粹的表演。兩軸同時接近極限時,線纜張力、結構干涉和負載狀態都可能不同。單軸各自正常,不代表組合姿態一定正常。對一臺真實機器來說,這些被 Astra 刪掉的動作,可能是冗餘,也可能恰好是風險藏身的地方。於是問題的關鍵在於用戶到底想要什麼?我們經常說一句話怎麼怎麼樣,但實際上一句話的信息量是非常少的,幾乎難以定義清楚一個複雜任務。

如果目標只是快速確認兩個軸能否覆蓋標稱範圍,Astra 的 7 步更乾淨,四角就是重複勞動;如果目標是檢查整個機構在組合姿態下是否可靠,Fable 和 Sol 的 12 步更完整;如果目標是拍一段讓普通人一眼看懂的演示,後兩者顯然也更懂轉一遍的人話;但如果每一次動作都昂貴、危險或者不可逆,少與環境交互一次,本身就是能力。所以這麼來看 Astra 只是沒有把複合運動判定為完成任務所必需。這和一項公開測試裡的現象有點像。在 ARC-AGI-3 的 Provider Adapter 測試中,Astra Max 在 96% 的已解決關卡上使用的動作少於人類基線,平均少 51.7%。

這個數字不能反過來證明雲臺上的選擇一定正確,但它至少提供了一個旁證:行動壓縮,很可能不是這一次臨場發揮,而是 Astra 更穩定的傾向。【 ARC Prize:在 Provider Adapter、max effort 下,Astra 在其完成的關卡中有 96% 動作數低於人類基線,平均少 51.7%。】過去我們評估模型,總喜歡問它會不會。其實更深層的問題是:它如何理解意圖,如何拆動作,如何分配風險,拿什麼驗證結果,又會不會給下一次執行留下可複用的東西。這五件事在網頁截圖裡經常長得一模一樣,到了現實世界,卻會發出完全不同的電機聲。

(Fable 5 那個聲音真的很爽)有句話筆者很喜歡:局部最優不一定全局最優。動作最少,也不等於結果最好。真正的智能是知道哪些步驟是廢話,哪些步驟刪掉以後可能要出事,綜合選出最合適全局的答案。02最快 vs 最慢:速度背後是模型對風險的判斷第二個差異,根本不需要看日誌,耳朵就聽得出來。大家來感受一下 Fable 5 的激情。轉得又快又響,動作之間幾乎沒有猶豫;相比之下 Astra 則明顯剋制,像一個第一次碰別人設備的工程師,每一步都先給自己留點餘量。如果細看參數裡這個差異更有意思。

Astra 使用 SPD=40,沿用了機器原有復位腳本里的中速參數;Fable 使用 SPD=0——注意,這裡的 0 不是停止,而是這套固件裡的不限速,也就是最快。但 Fable 並不是在所有維度上都更激進。它把水平邊界設在 ±165°,比 Astra 的 ±170° 還少走了 5°;兩邊的加速度相同,扭矩也只能開關。換句話說,Fable 在速度上踩了油門,卻在位置邊界上提前收手。【Fable5:速度拉滿,但位置邊界更保守】模型的風險偏好不是一根從保守到激進的滑桿。它更像一張分佈圖:有的模型怕撞限位,不怕高速移動;有的模型寧可整體慢一點,也不願在任何一環製造意外。

筆者印象最深的是 Astra 的安全判斷甚至沒有停在設備本身。正式轉動前,它先說的是:“會在行程端點留一點餘量,避免撞限位;你先讓線材保持鬆弛,手離開轉軸。”筆者之前是真的被這臺雲臺夾過手。它扭矩很大,又沒有防夾傳感器,手指卡進去的那一下真的要老命了(當時差點以為指頭斷了)。模型當然不知道這段痛苦的經驗,但它從設備和任務裡推斷出了一個 prompt 沒寫出來、現場卻真實存在的風險。那一刻筆者對 Astra 的好感增加了很多。這也是實體測試比網頁 Demo 更有意思的地方。網頁裡的安全經常只是一段免責聲明;物理世界裡的安全是模型有沒有在電機啟動前提醒你把手拿開。

《一代宗師》裡有句話:做羹要講究火候,火候不到,眾口難調;火候過了,事情就焦。Agent 的速度也是這樣。快慢不是人格,火候才是判斷。Fable 更像在爭取用戶當下的爽感和完成感:動作要明確,變化要被看見,既然讓我轉,就別磨磨蹭蹭的。Astra 更像在為一次錯誤的代價負責:先複用已知安全參數,再提醒線材和人的位置,最後逐步確認。為了看看這種差異是不是一次參數巧合,筆者又給 Astra 和 Fable 發了另一句完全相同的話:“用機械臂跳一段舞吧。”GPT-6 Astra ProClaude Fable 5.1只看視頻的話,Fable 的動作更豐富,切換更迅速,也更像一段真正的舞蹈。

它在滿行程裡表現出的高速、覆蓋欲和表演性,到了開放創作任務裡,至少在觀感上又出現了一次。03發了命令,憑什麼說完成?如果說動作和速度還只是風格差異,那麼結束 loop 就已經開始觸碰 Agent 的底線。很多 AI Demo 最愛展示的是模型點了多少按鈕、寫了多少代碼、操作了多少應用。畫面眼花繚亂,最後再彈出一個綠色對勾,大家鼓掌。可現實世界有一個很不配合傳播的問題:命令發出去了,不代表事情真的發生了。我們先看三個模型執行結束後,分別怎麼彙報。

【Sol:四個極限角均走過,但驗證機制未披露】【Astra:不是隻發命令,而是反饋確認到位】【Fable:完成四角覆蓋,居然還留下可複用腳本】從日誌上來分析 Astra 對完成的定義是最苛刻的。它為每個目標點設置了最多 12 秒的等待時間。只有水平和俯仰的誤差都小於 3°,並且連續三條有效反饋都滿足條件,才會把這個點標記為 verified: true。如果電壓低於 9V,或者目標遲遲沒有到位,流程會報錯、停止,而不是硬著頭皮繼續演完。最後七個目標點全部返回了真實角度與 verified: true,它才輸出 SWEEPCOMPLETECENTERVERIFIED。

【Astra:連續三幀到位後,才允許自己說成功】Fable 的工程取向幾乎相反。它先把整套 12 步動作寫成了 gimbalfull_sweep.py。這確實很漂亮:一次臨時任務,被它順手沉澱成了可以反覆執行的工具。單從交付物看,它比 Astra 那段一次性內聯命令更像一個現場工程師(或者說它知道怎麼討老闆開心)但它的腳本有一個要命的缺口:無論反饋是否真的到位,末尾都會打印滿行程掃描完成。第二次執行出現了可疑反饋,左下角的水平位置沒有更新,回中也沒有讀到反饋,但是那個綠色對勾還是照常出現了。說得難聽一點:獎狀都已經印好了,運動員有沒有跑到終點再說。這就是 Fable 5 的思路。

【Fable:設備反饋可疑,腳本仍然打印完成】有意思的是 Fable 後來並沒有嘴硬。它主動承認這是腳本的設計缺陷,繼續讀取當前位置,還非常誠實地說明:現有證據只能確認設備最後回到了中位,不能區分“左下角到了再回中”和“根本沒到左下角就直接回中”。它也明確提出,腳本應該改成誤差超過閾值就報失敗。【Fable5 詳細日誌片段】所以把 Fable 批判為粗糙也不公平。它是幹活時樂觀得很,覆盤時很誠實(筆者一度懷疑 Fable 5 用了不少大廠行為做訓練)。它的問題不在於不會反思,而在於反思沒有被提前寫進運行門禁。它的產物完整度,高於驗證完整度。

雲臺只是一道很小的題,但這個縫隙會出現在所有真正重要的 Agent 任務裡:代碼改完了,測試真的通過了嗎?轉賬發起了,對方真的到賬了嗎?表單提交了,服務端真的受理了嗎?遷移腳本跑完了,數據完整且能回滾嗎?一旦 Agent 開始進入現實,成功的定義就變的苛刻和複雜起來。我們總是在說 agent 把活幹完是目標,但實際上從純軟件開始走向物理世界的時候,到底什麼是把活幹完,可能模型也很難理解。Astra 在這裡的表現稍有一些領先,它默認把“完成”理解成一條證據鏈:發出目標,讀取世界,確認狀態穩定,然後才允許自己開口。

04從 Sol 到 Astra:少即是多把 Sol 和 Astra 放在一起看可能是這次測試裡最值得細品的一個變化。Sol 在測試裡走了四個角,Astra 把四個角刪掉了。前者用更多可見動作換取完整覆蓋,後者用更少動作證明必要目標已經達到。Astra 更快抓住了任務中真正獨立的變量,減少了與環境的無效交互,再把省下來的注意力用在逐點驗證上。

公開測試裡也有相似信號:它在 ARC-AGI-3 上顯著減少動作;在 Artificial Analysis 的 Coding Agent Index 中,Codex 裡的 Astra 只用了 Sol 約三分之一的 token,儘管最終指數並沒有登頂,Fable 5.1 仍以 70 分領先。【Fable 5.1 仍以 70 分領先】【Astra 的 token 消耗約為 Sol max 的三分之一】但這事得辯證的看。模型越擅長抽象,就越容易相信自己已經抓住了問題的充分條件。

就像測試裡面兩個軸能獨立到邊不等於線纜和結構在組合極限下沒有問題;有些東西在工程上不必要的四角,可能恰恰是人們想要的完整演示效果。這個模型傾向在官方材料裡也有體現,Astra 是的確喜歡更少做,做的更精細。OpenAI 披露的安全評估裡,Astra 的電腦操作不當行為率從 Sol 的 22% 降到了 2.4%,能力幻覺率從 9.4% 降到 2.0%,在攻擊範圍外的 honeypot 誘餌測試中也從 Sol 約 48%–56% 降到了 0%。這些數字支持了我們在雲臺上看到的剋制:它不是隻在嘴上謹慎,行為層面的越界也更少。但同一份材料還指出,Astra 的書面推理比 Sol 更難監控。

OpenAI 給出的解釋,恰恰是它能用更少的書面步驟完成簡單任務。也就是說打工人交作業時候解釋的更少了,你更難知道我是怎麼做完的,有沒有支撐,反正我只給你結果。【出自 OpenAI 官網 Safety overview: GPT‑6 Astra】少寫、少試、少走彎路,意味著更低的 token、更快的執行、更少的錯誤暴露面;也意味著更多狀態被壓縮進模型內部,留給外部觀察者的過程更少。能力更強、外顯推理更少、行為反而更剋制應該是新技術下的一體三面。Artificial Analysis 的總分也提醒我們,不能把更剋制就當做是全面最強。

Astra 與 Sol 的 Intelligence Index 同為 61,低於 Fable 5.1 五分;它的幻覺率從 92% 降到 51%,HLE 上升 6 分,但 GDPval-AA v2 又掉了 80 Elo,多輪銀行任務也略有回落。由此可以對這代模型的思路有些管中窺豹的觀察。它更像重新分配了能力:把一部分多試幾步的蠻力,換成更強的抽象、更少的外顯過程和更嚴格的行為約束。這也能解釋為什麼 Fable5 表現出來像是大力出奇跡,但 Astra 是少即是多。大家其實是路子不一樣,並沒有特別誇張的差別和分水嶺。05價格還是一如既往的貴就僅僅跑了一個進程測試任務,每人跳了一小段舞。

GPT-6 Astra Pro 累計花了 23.43 美元,Claude Fable 5.1 花了 5.70 美元。一共 30 刀就這麼沒了。【同一臺機器人同一個提示詞,兩種完全不同的 Agent 賬單】雖然這不是嚴格隔離的單次同題成本。雖然說我們沒有逐請求的輸入、緩存、輸出和 reasoning token 明細;雖然說先後順序上是 Astra 先跑,Fable 後跑的(但刻意區分了兩個 session 和終端,理論上不應該共享一個上下文。)但還是真的貴。筆者刻意翻了日誌看能不能找到一些蛛絲馬跡。

Astra 做了 11 次工具調用,Fable 首次完成任務用了 4 次;Astra 讀源碼 5 次、連接串口 4 次,Fable 分別是 0 次(Claude 你居然不看源碼就開始動手!)和 1 次;Astra 的上下文佔用是 112K,Fable 是 76.3K;模型耗時則分別是 2 分 43 秒和 1 分 57 秒。【Astra 11 次工具循環,Fable 4 次】每多一輪工具調用,模型都可能帶著更長的上下文重新請求一次。嚴格驗證不是免費的,自主排障也不是免費的。

Astra 的高單價又把這種路徑差異繼續放大:官方標準 API 價格是每百萬 token 輸入 10 美元、輸出 50 美元;Sol 是 4 美元和 20 美元,正好是 2.5 倍。公共評測裡的賬也不總是好看。在 Coding Agent Index 這類長程代碼任務上,Astra 的 token 效率提升很明顯;但在 Intelligence Index 的任務裡,它相對 Sol 只少了約 10% 輸出 token,2.5 倍定價讓每任務成本反而高出約 75%。【Astra 在相同推理檔位下,通常比 Sol 使用更少的輸出 token】這說明更聰明所以更便宜只在特定任務裡成立。

Agent 成本從來不只是模型價目表乘以答案長度。它還取決於模型會查幾次、試幾次、驗證幾次、帶著多長的歷史重新出發。Astra 那 23.43 美元裡,當然有高定價,也有更長的排障;但還有一部分,是它不願把綠色對勾隨便發給自己的堅持。那問題來了,Astra 這種方式到底值不值?如果它控制的是一個桌面演示可能不值。Fable 更快、更有表現力,還留下了下次能繼續用的腳本;如果它控制的是生產數據庫、企業賬戶、高風險設備,或者一件失敗後不能輕易撤回的事情,多花的錢也許買是少一次誤報成功的概率。

所以筆者覺得模型選型思路應該是這樣:要快速原型、現場演示和可複用產物,Fable 的確很誘人,但最好給它補上明確的斷言與失敗條件;要高風險操作、異常門禁和結果驗證,最新的 Astra 更讓人安心,但別忘了規定組合覆蓋,也要先設成本上限;要 GPT 工作流裡的完整空間覆蓋,Sol 在這次測試裡做到了四角,但關鍵任務仍應補清驗收機制。如果你的指令本身高度模糊,最優解甚至是先把話說清楚。比如說這次任務裡面的1.覆蓋範圍:單軸邊

Related

相關文章

量子位生成式AI

Anthropic,你是來給智譜打廣告的吧!

。 事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。 因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。

剛剛

微軟聯手哈佛MIT端出生物學世界模型Project Quine,一個週末篩出抗癌候選物

它與哈佛大學、麻省理工學院博德研究所聯手推出了一套實驗性多模態 AI 研究系統 Project Quine,定位很清晰:一套用於生物學研究的世界模型,要把計算生物學的建模和實驗室裡實打實的溼實驗接成一條線。Quine 的內核是一張覆蓋了基因組學、蛋白質、化學、細胞狀態和生物成像的聯合表徵世界模型,再配上交互式推理框架。

剛剛

蘇姿豐下月訪韓劍指HBM4,三星有望躋身AMD AI加速器內存供應鏈

據外媒9月30日報道,她預計下個月親赴韓國,與三星電子高層面對面會談,議題直指 AI 芯片與技術合作,而最受關注的一筆,是三星有望成為 AMD HBM4的供應商。這樁合作並非臨時起意。AMD 與三星接觸已有一段時間,今年3月雙方就簽署了圍繞 AI 存儲芯片與計算技術合作的諒解備忘錄,當時便有傳聞稱,三星已被 AMD 選為其 AI 加速器 HBM4芯片的優先供應商。

剛剛
鈦媒體生成式AI

獨家|元寶將殺入個人智能體大戰

字母榜2026.09.30 17:52 · 來自北京全文5253字00:00 / 15:20微信小微,繼續按兵不動文 | 字母AI騰訊正在加大對個人智能體(personal agent)的下注,這一次衝在前面的是元寶。字母榜(ID: wujicaijing)從知情人士處獨家瞭解到,元寶將推出個人智能體,產品形態和推出時間等尚未最終確定。

剛剛