千問說95%的辦公任務標準模式就夠了,實測結果有點微妙

2026年9月14日 18:58
千問說95%的辦公任務標準模式就夠了,實測結果有點微妙
站內 AI 整理稿

藍字計劃2026.09.14 18:56 · 來自廣東全文4333字00:00 / 12:30千問能替你上班嗎?作者|黃曉彬原創首發|藍字計劃賣大模型的,居然開始勸人別總用自家最好的模型了。早些時間前,阿里旗下的AI辦公工具千問辦公上線了搭載Qwen3.8-Flash的標準模式,並隨之給出了一個非常大膽的宣傳方式:95%的日常辦公任務,標準模式就能完成,只有少數複雜任務需要高級模式。這就有點意思了。眾所周知,旗艦大模型是模型公司們的臉面,無論是在宣傳還是跑分裡都是能力最強的。在實操中,除非是很趕時間,或者確實囊中羞澀,要不然Pro 模型肯定還是比 Flash 模型更有吸引力。

但現在千問卻反過來告訴用戶,大部分時候,用標準模式就夠了。如果真能做到,當然是好事。但“95%的日常任務”覆蓋得這麼廣,總得拿一份實際工作,看看它說的“夠用”到了什麼程度。所以,我們這次選擇了一份看似簡單,但操作起來實則挺複雜的工作:把9份券商研報整理成一份Word,再壓成一頁彙報PPT。實際上,把券商研報交給AI 解讀,難度確實比普通的文檔、新聞、素材解讀要麻煩得多。不同機構會反覆引用同一組財報數據,卻可能給出不同的盈利預測和判斷。AI得把散在正文、表格裡的信息對起來,分清哪些只是重複,哪些確實存在分歧,還不能把不同年份、不同統計口徑的數字簡單粗暴地放到一起。

這次,我們把相同的材料和要求分別交給千問辦公的標準和高級模式。看看千問拍胸口推薦的標準模式,究竟能不能把這份工作做好。分析9份材料,用了10分鐘打開千問辦公,任務入口和普通AI對話沒有太大區別:文件從左下角的“+”號上傳,具體要求直接寫進輸入框,下方則是模式選擇按鈕。從我們測試時的界面看,“標準|Qwen3.8-Flash”已經處於選中狀態。點開模式列表,它也被排在最上面,旁邊還特意標上了“推薦”;下面才是擅長複雜任務的高級模式,以及Qwen3.8-Max等前沿模型。看來,“95%的日常辦公任務都用標準模式”確實不只是一句宣傳。既然千問打算“把飯喂到嘴邊“,那就先照著它的推薦來。

我們通過左下角的“+”號,把9份券商研報全部傳了進去,先讓它分析這些研報都講了什麼,隨後再按提示明確交付形式:把關鍵數據、各家機構的主要觀點和分歧整理出來,生成一份Word文檔。任務開始後,標準模式先讀取了全部文件,並在執行過程中發現,其中兩份研報雖然文件名不同,內容卻完全一致。去掉這份重複材料,它最終確認,自己實際要處理的是8份獨立研報。這其實是我專門為了千問設置的一個“坑”,看它會不會把不同文件名的同一份研報當成兩份。從結果看來這種“小伎倆”的確難不倒千問。我們接著看看千問的表現。在標準模式下,它沒有按照文件順序,把8份研報逐篇複述一遍,而是將分散在不同材料裡的內容重新歸類。

阿里的經營表現放到一起,AI模型與產品進展單獨展開,各家券商的共識和分歧也被集中整理,最後形成一份包含69個段落、兩張表格的Word文檔。整個過程用了10分24秒。從成品來看,這份Word已經有了相對完整的閱讀主線。想了解阿里的AI雲收入、利潤變化,可以直接找到對應章節;想知道幾家機構對後續表現怎麼看,也不用再回到8份PDF裡逐篇翻找。其中,還有幾個比較有意思,相對亮眼的特點值得一提。在券商分歧部分,它把各家機構對未來利潤的預測集中到了一起,並給出了918億元至1284億元的區間,同時提醒這些預測採用的口徑並不完全相同。

幾家券商對阿里的整體方向基本看好,但在利潤預測、即時零售的拖累程度,以及端側業務能否形成新增量等問題上,判斷並不一致。這樣的整理,其實已經足夠讓我快速看懂這批研報大致在討論什麼。不過,它仍然更像一份綜合摘要。各家機構為什麼得出不同判斷、預測背後用了哪些假設,展開得相對有限。如果後續準備引用具體數據或者觀點,最好還是問清楚AI 這些材料出現在哪裡,然後親自回到對應研報裡進一步核對。Word整理完以後,我馬不停蹄地提出第二項要求:把上面的內容做成一頁能夠直接彙報的PPT。這一次,標準模式共花費了3分17秒。

最終交出來的PPT採用藍白配色,頂部用四個數字卡片擺出總營收、AI雲與算力收入、集團經調整EBITA和MaaS等ARR,下面分別介紹AI模型與產品進展,以及券商的觀點和分歧,底部還附上了資料來源。第一眼看過去,標題、數字和正文已經分出了層次,幾塊內容也被規整地放進了一頁裡。不過,再往下讀,問題也比較明顯:AI產品和券商觀點部分塞了不少小字,放在電腦上都需要湊近了才能看到,要是真的放到會議室裡投屏,那可能有些小字得用望遠鏡來看了。但無論如何,它確實完成了“一頁PPT”的要求,只是在“取捨”上顯得有點不夠聰明。哪些信息應該被重點放大,哪些內容可以乾脆刪掉,還是需要用戶自己在後續再手動調整一次。

至此,標準模式已經把讀取PDF、整理Word、自檢修復和製作PPT的整套流程完成了,交付成果給人的感覺是“能用,但還能更好”。如果你是一個完美主義,或者輸出完一點都不想手動調整的,或許對這個結果不會滿意。那麼,更加強大的高級模式,能實現真正的“交付即用”嗎?高級模式,能“交付即用”嗎?帶著這個問題,我們把模式切換成“高級”,重新上傳同一批研報,並給出完全相同的任務要求。這一次,重複文件的這個坑自然也沒能騙過它。高級模式同樣發現,9份文件裡有兩份內容完全一致,最終按照8份獨立研報進行分析。不過,從這裡開始,兩種模式的處理方式逐漸拉開了差距。

標準模式更像是把散落的內容快速收攏起來,高級模式則先給這批材料建了一份“檔案”。它在文檔開頭增加了一張研報清單,把券商名稱、報告主題、發佈日期和機構評級全部列了出來,哪份關注財報、哪份專門跟蹤AI產品,非常清晰,一眼就能看清。完成清點以後,高級模式才開始進入正文。相比標準模式,高級模式交出的內容明顯專業得多。標準模式主要告訴我,這批研報形成了哪些共識、又在哪些地方出現分歧;高級模式則繼續深挖,把每家機構為什麼得出不同判斷,也儘可能放進了文檔裡。比如同樣討論阿里未來的Non-GAAP淨利潤,華泰給出的預測最高,國信相對保守,兩者相差接近400億元。

高級模式除了列出這個區間,還進一步指出,差異主要來自各家對AI實驗室投入和雲業務利潤率的假設不同。這些提醒,恰好是標準模式相對薄弱的部分。標準模式能幫我快速看懂8份研報在講什麼,高級模式真的想一個高級分析師在上課:某些判斷來自哪家機構,基於什麼口徑,引用時又要注意什麼。Word完成以後,我們繼續讓它把這些內容壓成一頁彙報PPT。高級模式一共用了10分18秒,比標準模式多花了7分多鐘。它沒有直接把頁面生成出來,而是在製作過程中加入了一輪排版檢查。從執行記錄看,第一版PPT出現了幾處問題:標題文本框與右側說明框發生重疊,部分橙色文字放在白色背景上,對比度也不夠明顯。

高級模式隨後縮窄標題框、加深文字顏色,再把PPT導出成圖片,重新檢查頁面有沒有重疊和裁切。直接把PPT 導出成圖片,看來高級模式的千問對自己的成品很有信心,一點用戶自行修改的餘地都不留。那成品怎麼樣?高級模式生成的PPT採用深藍和橙色搭配,頂部同樣放置了四個數字卡片,下面則被拆成業務全景、券商觀點和AI產品矩陣三個區域,底部再用一條深色橫欄放置核心結論。它和標準版的PPT 相比,內容確實詳實了很多。同一批材料、同樣要求做成一頁彙報,兩種模式卻替我選出了不同的重點。

標準模式特意突出MaaS等ARR,更關注模型服務業務進展;高級模式則加入淨利潤和AI雲利潤,更強調阿里在加大AI投入以後,收入增長和利潤承壓之間的關係。標準模式高級模式除了券商觀點和AI產品,高級模式還增加了雲、電商與AI實驗室的業務拆分,並在頁面右上角標出財年口徑和研報來源。但是它依然出現了標準模式版本PPT 同樣的問題。高級模式雖然解決了文字重疊和顏色對比度的問題,下面三個區域依然塞得比較滿,部分內容投到大屏幕上,同樣很難讓人一眼抓住重點。換句話說,多出來的7分鐘,確實換來了更細的內容、更完整的口徑提醒,以及一輪看得見的排版修復,但“更詳細”和“更適合彙報”並不能直接畫上等號。

高級模式離“交付即用”更近了一些,但也就一點而已。95%場景可用,保真嗎?現在再回頭看,千問宣傳的“95%場景可用”,最關鍵的其實是“可用”這兩個字,到底按什麼標準來判斷。如果只看標準模式自己的表現,它的確算得上可用。9份研報能夠全部讀取,重複文件也成功找了出來;最後生成的Word有完整結構,主要數據、機構共識和分歧基本都在;PPT雖然小字不少,但好歹整體是能用的。但看完高級模式以後,標準模式的成品好像又沒那麼“能用”了。高級模式增加了研報清單,把機構觀點、預測依據和數據口徑交代得更清楚,還主動找出了研報裡可能存在的筆誤。

原本覺得標準模式已經整理得挺完整,放到高級模式旁邊,才會發現它省略了多少細節。雖然這份“更好”,有不小的代價。以製作同一頁PPT為例,標準模式用了3分17秒,高級模式則用了10分18秒,耗時超過前者的三倍。而最終交付的產品,也還沒有達到“交付即用”的級別。這樣看的話,如果平時大部分需求只是整理資料、提煉重點、生成初稿,標準模式的確夠用;碰上正式彙報或者複雜材料,再切到高級模式也不遲。說到底,標準模式負責把活幹完,高級模式負責把活幹得更像樣。至於完全不用自己動手,千問暫時還沒打算替你上班。參考資料:千問辦公QwenWork:《首發!千問辦公上線Qwen3.

8-Flash,Agent迎來量大管飽時代》第一財經:《千問辦公劃出Agent的新基準》鳳凰網財經:《阿里動真格,大模型新的“斬殺線”出現了》

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

1 小時前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

7 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前