別再數Token了:OpenAI甩出AI時代記分卡,用"有用智能每美元"給CFO算清ROI
重點摘要
首席財務官們反覆追問同一個問題:投入人工智慧的錢,究竟換回多少實際價值?OpenAI 決定親自回答這道難題,不再讓企業在 token 計價的迷宮裡自行摸索。過去,軟體業習慣用採用率、活躍用戶數或續約率來衡量成敗,但這套邏輯放到 AI 時代已經失效——真正的刻度不該是用了多少人,而是模型確實完成了多少工作。 OpenAI 在 7 月 17 日發布的長文中,直接點出企業領導者面對的核心經濟命題:人工智慧完成任務所創造的價值,成長速度是否持續領先於生產這些成果的成本?
首席財務官們反覆追問同一個問題:投入人工智慧的錢,究竟換回多少實際價值?OpenAI 決定親自回答這道難題,不再讓企業在 token 計價的迷宮裡自行摸索。過去,軟體業習慣用採用率、活躍用戶數或續約率來衡量成敗,但這套邏輯放到 AI 時代已經失效——真正的刻度不該是用了多少人,而是模型確實完成了多少工作。 OpenAI 在 7 月 17 日發布的長文中,直接點出企業領導者面對的核心經濟命題:人工智慧完成任務所創造的價值,成長速度是否持續領先於生產這些成果的成本?要回答這個問題,只看每單位 token 的價格遠遠不夠。一個便宜的模型,token 單價或許很低,但為了得到可靠結果,可能得反覆嘗試、耗費更多時間,甚至還得疊加大量人工審核;反之,一個定價較高的模型,雖然每次呼叫的費用較高,卻有可能一次就把任務做對,省下後續所有修正成本。真正的成本,其實是產出一個成功結果所付出的完整代價,再拿這個代價去對照成果創造的價值。 因此 OpenAI 提出 AI 時代的記分卡——「有用智能每美元」(Useful Intelligence per Dollar)。這個指標試圖回答四個關鍵問題:人工智慧是否在執行真正有意義的工作?每一項成功任務的實際成本是多少?人們能否信賴它的輸出結果?隨著使用規模擴大,每投入一美元,是否創造出更多價值? 第一項要衡量的是「完成了多少有用工作」。價值只在 token 轉化為人們能直接使用的實際產出時才真正產生。模型越強,能扛下的任務就越長越複雜:它開始保持上下文、進行多步推理、跨工具協作,並在過程中持續調整。最務實的做法是鎖定一個具體工作流程,先清楚定義什麼叫「完成」,然後在工作的實際發生系統裡去度量這個結果。對支援團隊而言,完成意味著一個客戶問題被解決;對工程團隊,是一筆通過測試的程式碼變更;對法務團隊,則是一份被準確且即時審查的合約。文中舉例一個財務團隊準備預測評審的場景:在最終決策之前,團隊得找出最新預測、把資料匯入試算表、識別數字變化、核對不同頁籤、重建簡報、檢查所有數字是否吻合。這一連串繁瑣工作大部分都能交給 ChatGPT Work 處理,團隊因此騰出精力去思考真正重要的事——發生什麼變化、為什麼變、下一步該怎麼做。這就是每一美元在實際應用中換來的有用智能。 第二項要計算的是一個成功任務實際花費多少錢。AI 任務的成本差異極大,一句快速回應消耗的算力極少,而編碼、研究或財務類工作流程往往涉及深度推理、工具呼叫與大量操作,它們消耗更多算力,也創造更高價值。在模型層面,單次成功任務的成本由價格、實際用掉的計算量以及得出正確結果的機率共同決定;對企業來說,總成本還得疊上員工時間、人工審核、重試與返工。簡單公式就是把完成工作的總成本加起來,除以達到品質標準的任務數量。這正是最低 token 單價不見得能換來最低每結果成本的原因——即使對一般請求而言,如果一個前沿模型能一次給對答案,省下的重試、延遲、審核與總計算量,反而可能讓它成為最划算的選擇。 OpenAI 剛發表的 GPT-5.6 就是按照這個邏輯設計的三層架構:Sol 是旗艦,Terra 在性能與成本之間取得平衡,Luna 最快也最省。這套分層給了客戶最佳化成本的起點,但 OpenAI 強調,最終該用哪一層模型,要看整筆任務的經濟性——高吞吐流程適合 Luna,需要深度分析時適合 Terra,而當更強的推理能力能以更少嘗試換來最好結果時就該用 Sol。在訓練 GPT-5.6 時,OpenAI 的目標就是讓每個 token 產出更多有用成果:在 Artificial Analysis 程式設計智慧體指數上,開啟最大推理模式的 GPT-5.6 Sol 創下新的最佳成績,同時比另一款領先模型少用了 54% 的輸出 token;在 DeepSWE v1.1 長週期工程任務中,GPT-5.6 Sol 達到 72.7% 的新高,高於 Claude Fable 5 的 69.9%,預估 API 成本還降低了 36.2%。每一代模型都應該在兩方面同時進步——更高效率讓舊任務變得更便宜,更強能力則讓全新類型的工作成為可能。 第三項則是衡量 AI 正確完成工作的頻率,也就是可靠性。人工智慧的採用通常會分階段深化:先從輔助起草開始,接著在工具與資料之間尋找上下文、進行推理,再來開始主動採取行動、處理例外狀況、跑完整個工作流程,而人類只在必要時給出判斷與控制。每一步都創造更多價值,但也對系統提出更高要求。可靠性本身就是錢——當結果準確、來源可靠、前後一致且能適當地升級處理時,人們花在審查、糾正與返工的時間就會減少,成功任務的成本隨之降低,組織也更有把握把 AI 應用到更重要的流程。OpenAI 建議團隊追蹤三種結果來衡量這一點:可直接使用、需要修正、需要升級處理。這比單純的模型準確率更能反映 AI 是否真的減少了完成專案所需的工作量。 可靠性還需要清晰的邊界。在 AI 從起草走向主動行動之前,組織必須定義系統能存取哪些資料、可以使用或更改哪些系統、何時需要人工審查或批准特定操作。安全、保障、隱私與控制共同構築深度使用的基礎,而 ChatGPT Work 正是建立在 ChatGPT Enterprise 的安全、合規與工作區管理之上,讓組織在保持監督的同時,將 AI 接入更有價值的流程。能力讓人願意第一次嘗試,可靠性才讓 AI 真正成為完成工作的固定環節。 第四項要檢視的是隨著使用量增長,每一美元 AI 投入能否完成更多工作。企業可以長期追蹤同一個工作流程來度量:統計達到品質標準的任務數量、完成它們的總成本,以及每項成功任務的成本變化。如果完成的工作量增長快過總成本,同時品質維持不變或提升,那就代表每一美元確實產出了更多價值。算力處於這個等式的核心——它驅動著研究,也驅動著 AI 完成的每一項任務,直接影響產品品質、速度、可靠性、可用性與成本。訓練算力構築未來能力,推理算力則交付當下價值,而兩者最終都要轉化為更好的客戶成果。更優的模型、更高效的推理、專用硬體、更高的使用率、更聰明的路由與更強的產品設計,都能拉抬算力的回報。客戶從實際體驗中就能感受到這些改進:答案更準、回應更快、修正更少、產品更可靠、完成所需工作的成本更低。這些收益會自我累積——更好的基礎設施加速研究,研究催生更強、更高效的模型,模型改進產品,產品推動採用、學習與收入成長,而這又反過來支撐下一代研究、算力、部署與安全的持續投入。 OpenAI 用一個統一的智慧平臺將所有環節收攏:使用者透過 ChatGPT 與 ChatGPT Work 使用,開發者透過 Codex 與 API 建構應用,企業則把它部署到真實工作發生的系統中。任何一層的改進,所有產品與客戶都能隨之受益。把這四項指標合在一起,這張記分卡其實在回答一個根本問題:每單位成本換來的有用智能,是否在持續上升。有用產出告訴我們 AI 能產生什麼,每項成功任務的成本讓我們知道達成結果要付出什麼代價,可靠性則反映人們可以放心使用多少成果,規模化價值則點出隨著時間推移,每一美元與每一單位算力是否實現了更多成效。OpenAI 把自己當前的任務歸結為讓這個等式在每一代模型上都變得更好——更強的模型、更快更可靠的結果,以及持續降低客戶真正需要的任務成本。當 AI 開始用「每美元的有用智能」說話,而不是拿 token 流水帳交差,價值的衡量才算真正被釐清。
Related
相關文章

月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部
首頁 > 智能時代>人工智能 月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部 2026/7/20 22:20:14 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 7 月 20 日消息,近日,月之暗面發佈的新一代開源大模型 Kimi K3 登頂全球榜單,引發廣泛關注。7 月 18 日上午,埃隆 · 馬斯克(Elon Musk)在社交平臺發文稱,旗下 2 萬億參數模型在各方面都優於當前的 1.

WAIC之夜:Token堆不出“AI原生”組織
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作WAIC之夜:Token堆不出“AI原生”組織36氪的朋友們·2026年07月20日 21:09Tokenmaxing的終局與新序章 2026年上半年,AI行業最熱的兩個詞是Agent和Tokenmaxing。前者意味著模型開始從“回答問題”走向“完成任務”,後者希望通過更長上下文、更多推理步驟和更高的Token消耗,換取更復雜的任務能力。 但Tokenmaxing很快暴露出另一面。為了讓公司成為更“AI原生”的組織,一些企業把Token消耗量當作轉型指標,甚至納入團隊KPI。調用量不斷增長,實際產出、任務完成率和商業回報卻未必同步提升。行業由此開始重新討論:Token真正的價值,究竟來自消耗規模,還是來自它所進入的產品、工作流和組織系統? 7月17日晚,在2026世界人工智能大會(WAIC)舉辦期間,由騰訊新聞、騰訊科技主辦,騰訊華東總部、騰訊雲智能特別支持的“騰訊WAIC之夜”在上海舉行。騰訊科技高級編輯、AI未來指北主理人郭曉靜主持首場圓桌,崑崙萬維董事長兼CEO方漢、出門問問創始人兼CEO李志飛、沐曦股份聯合創始人、CTO楊建,圍繞模型、產品與組織三個層面,討論了Tokenmaxing退潮後浮現出的新問題。
Alibaba’s Tongyi Lab Releases Qwen-Audio-3.0-TTS, a Hosted Text-to-Speech Model in Flash and Plus Tiers Across 16 Languages
Alibaba’s Tongyi Lab has released Qwen-Audio-3.0-TTS, a production-oriented text-to-speech (TTS) system. The model ships in two variants from the same lineage. Flash targets real-time interaction. Plus targets high-quality generation.

AI巨頭正在爭奪人類的錯題本
AI 巨頭之間的競賽正從算力、數據量,延伸到一個更細膩的戰場——人類的「錯題本」。過去,大規模、高品質的標註數據是模型訓練的關鍵,但隨著參數量與訓練資料逐漸飽和,業界開始意識到,單純的「正確答案」不再能拉開差距;真正能帶來複利效應的,是那些經過反饋修正的錯誤。每一次人類犯錯後被指正、被記錄的過程,都相當於為模型提供了一面鏡子,讓它更精準地理解邊界與上下文。

OpenAI 高管批 Kimi K3 開源,硅谷多方駁斥其觀點
OpenAI 戰略負責人 Dean Ball 批評中國公司月之暗面的開源模型 Kimi K3,認為其可能帶來風險,並建議透過監管手段製造不確定性。此舉引發硅谷多位人士反駁,包括風險投資人 David Sacks,批評 OpenAI 試圖利用監管消滅開源競爭對手,並強調開放競爭的重要性。

WAICA正式啟航:打破全球AI學術版圖,上海迎來關鍵拼圖
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。