別再數Token了:OpenAI甩出AI時代記分卡,用"有用智能每美元"給CFO算清ROI
重點摘要
首席財務官們反覆追問同一個問題:投入人工智慧的錢,究竟換回多少實際價值?OpenAI 決定親自回答這道難題,不再讓企業在 token 計價的迷宮裡自行摸索。過去,軟體業習慣用採用率、活躍用戶數或續約率來衡量成敗,但這套邏輯放到 AI 時代已經失效——真正的刻度不該是用了多少人,而是模型確實完成了多少工作。 OpenAI 在 7 月 17 日發布的長文中,直接點出企業領導者面對的核心經濟命題:人工智慧完成任務所創造的價值,成長速度是否持續領先於生產這些成果的成本?
首席財務官們反覆追問同一個問題:投入人工智慧的錢,究竟換回多少實際價值?OpenAI 決定親自回答這道難題,不再讓企業在 token 計價的迷宮裡自行摸索。過去,軟體業習慣用採用率、活躍用戶數或續約率來衡量成敗,但這套邏輯放到 AI 時代已經失效——真正的刻度不該是用了多少人,而是模型確實完成了多少工作。OpenAI 在 7 月 17 日發布的長文中,直接點出企業領導者面對的核心經濟命題:人工智慧完成任務所創造的價值,成長速度是否持續領先於生產這些成果的成本?要回答這個問題,只看每單位 token 的價格遠遠不夠。
一個便宜的模型,token 單價或許很低,但為了得到可靠結果,可能得反覆嘗試、耗費更多時間,甚至還得疊加大量人工審核;反之,一個定價較高的模型,雖然每次呼叫的費用較高,卻有可能一次就把任務做對,省下後續所有修正成本。真正的成本,其實是產出一個成功結果所付出的完整代價,再拿這個代價去對照成果創造的價值。因此 OpenAI 提出 AI 時代的記分卡——「有用智能每美元」(Useful Intelligence per Dollar)。這個指標試圖回答四個關鍵問題:人工智慧是否在執行真正有意義的工作?每一項成功任務的實際成本是多少?人們能否信賴它的輸出結果?
隨著使用規模擴大,每投入一美元,是否創造出更多價值?第一項要衡量的是「完成了多少有用工作」。價值只在 token 轉化為人們能直接使用的實際產出時才真正產生。模型越強,能扛下的任務就越長越複雜:它開始保持上下文、進行多步推理、跨工具協作,並在過程中持續調整。最務實的做法是鎖定一個具體工作流程,先清楚定義什麼叫「完成」,然後在工作的實際發生系統裡去度量這個結果。對支援團隊而言,完成意味著一個客戶問題被解決;對工程團隊,是一筆通過測試的程式碼變更;對法務團隊,則是一份被準確且即時審查的合約。
文中舉例一個財務團隊準備預測評審的場景:在最終決策之前,團隊得找出最新預測、把資料匯入試算表、識別數字變化、核對不同頁籤、重建簡報、檢查所有數字是否吻合。這一連串繁瑣工作大部分都能交給 ChatGPT Work 處理,團隊因此騰出精力去思考真正重要的事——發生什麼變化、為什麼變、下一步該怎麼做。這就是每一美元在實際應用中換來的有用智能。第二項要計算的是一個成功任務實際花費多少錢。AI 任務的成本差異極大,一句快速回應消耗的算力極少,而編碼、研究或財務類工作流程往往涉及深度推理、工具呼叫與大量操作,它們消耗更多算力,也創造更高價值。
在模型層面,單次成功任務的成本由價格、實際用掉的計算量以及得出正確結果的機率共同決定;對企業來說,總成本還得疊上員工時間、人工審核、重試與返工。簡單公式就是把完成工作的總成本加起來,除以達到品質標準的任務數量。這正是最低 token 單價不見得能換來最低每結果成本的原因——即使對一般請求而言,如果一個前沿模型能一次給對答案,省下的重試、延遲、審核與總計算量,反而可能讓它成為最划算的選擇。OpenAI 剛發表的 GPT-5.6 就是按照這個邏輯設計的三層架構:Sol 是旗艦,Terra 在性能與成本之間取得平衡,Luna 最快也最省。
這套分層給了客戶最佳化成本的起點,但 OpenAI 強調,最終該用哪一層模型,要看整筆任務的經濟性——高吞吐流程適合 Luna,需要深度分析時適合 Terra,而當更強的推理能力能以更少嘗試換來最好結果時就該用 Sol。在訓練 GPT-5.6 時,OpenAI 的目標就是讓每個 token 產出更多有用成果:在 Artificial Analysis 程式設計智慧體指數上,開啟最大推理模式的 GPT-5.6 Sol 創下新的最佳成績,同時比另一款領先模型少用了 54% 的輸出 token;在 DeepSWE v1.1 長週期工程任務中,GPT-5.6 Sol 達到 72.
7% 的新高,高於 Claude Fable 5 的 69.9%,預估 API 成本還降低了 36.2%。每一代模型都應該在兩方面同時進步——更高效率讓舊任務變得更便宜,更強能力則讓全新類型的工作成為可能。第三項則是衡量 AI 正確完成工作的頻率,也就是可靠性。人工智慧的採用通常會分階段深化:先從輔助起草開始,接著在工具與資料之間尋找上下文、進行推理,再來開始主動採取行動、處理例外狀況、跑完整個工作流程,而人類只在必要時給出判斷與控制。每一步都創造更多價值,但也對系統提出更高要求。
可靠性本身就是錢——當結果準確、來源可靠、前後一致且能適當地升級處理時,人們花在審查、糾正與返工的時間就會減少,成功任務的成本隨之降低,組織也更有把握把 AI 應用到更重要的流程。OpenAI 建議團隊追蹤三種結果來衡量這一點:可直接使用、需要修正、需要升級處理。這比單純的模型準確率更能反映 AI 是否真的減少了完成專案所需的工作量。可靠性還需要清晰的邊界。在 AI 從起草走向主動行動之前,組織必須定義系統能存取哪些資料、可以使用或更改哪些系統、何時需要人工審查或批准特定操作。
安全、保障、隱私與控制共同構築深度使用的基礎,而 ChatGPT Work 正是建立在 ChatGPT Enterprise 的安全、合規與工作區管理之上,讓組織在保持監督的同時,將 AI 接入更有價值的流程。能力讓人願意第一次嘗試,可靠性才讓 AI 真正成為完成工作的固定環節。第四項要檢視的是隨著使用量增長,每一美元 AI 投入能否完成更多工作。企業可以長期追蹤同一個工作流程來度量:統計達到品質標準的任務數量、完成它們的總成本,以及每項成功任務的成本變化。如果完成的工作量增長快過總成本,同時品質維持不變或提升,那就代表每一美元確實產出了更多價值。
算力處於這個等式的核心——它驅動著研究,也驅動著 AI 完成的每一項任務,直接影響產品品質、速度、可靠性、可用性與成本。訓練算力構築未來能力,推理算力則交付當下價值,而兩者最終都要轉化為更好的客戶成果。更優的模型、更高效的推理、專用硬體、更高的使用率、更聰明的路由與更強的產品設計,都能拉抬算力的回報。客戶從實際體驗中就能感受到這些改進:答案更準、回應更快、修正更少、產品更可靠、完成所需工作的成本更低。這些收益會自我累積——更好的基礎設施加速研究,研究催生更強、更高效的模型,模型改進產品,產品推動採用、學習與收入成長,而這又反過來支撐下一代研究、算力、部署與安全的持續投入。
OpenAI 用一個統一的智慧平臺將所有環節收攏:使用者透過 ChatGPT 與 ChatGPT Work 使用,開發者透過 Codex 與 API 建構應用,企業則把它部署到真實工作發生的系統中。任何一層的改進,所有產品與客戶都能隨之受益。把這四項指標合在一起,這張記分卡其實在回答一個根本問題:每單位成本換來的有用智能,是否在持續上升。有用產出告訴我們 AI 能產生什麼,每項成功任務的成本讓我們知道達成結果要付出什麼代價,可靠性則反映人們可以放心使用多少成果,規模化價值則點出隨著時間推移,每一美元與每一單位算力是否實現了更多成效。
OpenAI 把自己當前的任務歸結為讓這個等式在每一代模型上都變得更好——更強的模型、更快更可靠的結果,以及持續降低客戶真正需要的任務成本。當 AI 開始用「每美元的有用智能」說話,而不是拿 token 流水帳交差,價值的衡量才算真正被釐清。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。