5個真實場景實測:雲知聲U2,可能是最能“幹活”的大模型
撰文 | 李信馬題圖 | 雲知聲
AI行業似乎正在陷入一場無序的“Token消耗賽”。
全球範圍內的Token消耗正在迅速增長,Uber的5000名工程師僅僅4個月就燒完了全年的AI預算,迫使Uber出台分級限流措施管控成本;微軟核心的Experiences and Devices部門內部曾大規模放開使用Claude Code,但僅半年就因Token成本遠超預期而叫停;就連OpenAI的CEO奧特曼也感慨,目前有員工的月Token消耗達到1000億,甚至曾有員工30天消耗了6030億Token、一週消耗2100億Token,但他們依舊算不上全球Token消耗量最高的人。

增長源於AI從“對話模式”向“Agent模式”的演進,一個複雜Agent任務的Token消耗量,輕鬆就達到普通對話模式的幾十甚至上百倍。摩根大通曾預測,中國的AI推理Token消耗量預計將從2025年的約10千萬億增長至2030年的約3900千萬億,五年間增長約370倍。
想要讓AI創造海量價值的同時,又能減少大量無意義的算力消耗,Agent選用的核心模型是關鍵。過去幾年,大模型領域的主流競賽邏輯可以概括為三句話:更大的參數、更長的上下文、更複雜的推理鏈條,這場以算力為底座的競賽,把訓練和推理成本一路推高。而現在,隨著AI的規模化落地,性價比的重要性日益凸顯。
6月8日,雲知聲正式發佈了新一代通用大語言模型——U2。這款大模型是面向個人、開發者與組織打造的原生智能體大模型,技術主張極為純粹:高智能密度 × 高Token價值。簡單來說,就是不追求堆疊參數和輸出長度,而是追求用更少的資源承載更強的能力,讓每一次調用都更接近交付結果。
尤其值得一提的是,U2強調面向真實任務的連續執行能力,官方介紹其在複雜辦公、軟件工程、深度研究與多工具協同場景中,能夠自主拆解並推進100+步複雜工作流,將需求理解、任務規劃、環境交互、工具調用、過程糾錯與結果驗收串聯為完整閉環。
最新發佈的一系列國內外權威能力評測中,U2在多個關鍵能力方向進入主流大模型第一梯隊:

在衡量知識與複雜推理能力的 GPQA Diamond 上,U2取得了87.9分,超過GLM-5.1、Hy3 preview、DeepSeek-V4-Flash(High)和MiniMax M2.7;在衡量真實軟件工程能力的 SWE-Bench Verified 上,U2以75分的成績進入主流模型第一梯隊;在面向自主Agent端到端執行能力的 Claw-Eval(pass@3)上,U2的76.9分超過了Hy3 preview、DeepSeek-V4-Flash(High)和MiniMax M2.7;在面向真實辦公與知識工作交付能力的GDPval上,U2也取得了72.9的高分。
“真的能幹活”,是U2給人的直觀感受。接下來,我們用幾個真實的工作任務,來測試一下U2的實際表現。
U2評測:當大模型進入執行力競爭,U2交出了一份第一梯隊答卷

場景1:經典遊戲編程——俄羅斯方塊
打開後可以看到界面很簡潔,左邊專家列表中還有“高效辦公”、“金融分析”、“深度研究”三個選項。我們先直接對話,來考驗一下U2的代碼能力——代碼是最不會騙人的東西,行不行跑一下就知道了。
俄羅斯方塊堪稱大模型編程能力的“體測項目”,要求邏輯嚴密、實時交互,還得兼顧前端呈現。很多模型能寫出能跑的代碼,但界面醜得像上世紀產物;有些則反過來,頁面漂亮但核心邏輯全是bug。所以這道不算難,但要求不低,讓U2用網頁來做一個經典的俄羅斯方塊小遊戲,要求支援用電腦鍵盤的方向鍵來控制方塊的移動和變形,還要有計分功能,並把所有代碼都寫在一個文件里,保存後雙擊就能直接在瀏覽器里玩。
指令發出後,U2很快就設計並實現了一個完整的俄羅斯方塊遊戲,並把所有的HTML、CSS和JavaScript代碼都整合在一個文件里,從視頻可以看見,雙擊打開後瀏覽器瞬間加載出簡潔的遊戲界面:黑色的遊戲區域、右側實時更新的計分板,以及底部的操作提示一目瞭然。
實際操作時,方向鍵控制方塊左右移動、快速下落的響應極為靈敏,上鍵觸發的方塊變形,還有方塊被填滿時自動消除並累計分數也完全符合俄羅斯方塊的經典規則,整個遊戲過程沒有出現任何邏輯錯誤。可見U2除了能熟練編寫代碼,在前端設計方面也頗具實力,從功能開發到頁面佈局、視覺呈現一站式完成。
場景2:實戰網頁設計——產品發佈倒計時&郵箱註冊
接下來是一道更貼近實戰的題——做一個產品發佈頁面。為什麼選這個場景?因為這才是大多數中小企業開發者每天都在幹的活兒:一個落地頁,要有倒計時製造緊迫感,要有郵箱收集做用戶沉澱,要看起來像一個正經產品而不是學生作業。這類任務不需要多高深的算法,但考驗的是模型能不能把設計審美、交互邏輯和業務需求糅在一起,一次性交出能用的東西。給U2的指令很直接:構建一個產品發佈頁面,並帶上倒計時和郵箱註冊。
和上一個任務類似,打開文件後,頁面呈現出來簡潔現代的科技感設計,中間區域的倒計時組件尤為吸睛,完全滿足日常產品發佈頁面的核心需求,甚至在細節處理上超出預期。

場景3:高效辦公——社區輪換排班和PDF/Excel生成
前兩道題考的是代碼,但很多打工人日常面對的往往是瑣碎且耗時的工作,比如排個班表、寫個通知、導個Excel。很多大模型寫代碼挺利索,一到這種“幫我做個文件”的需求就開始掉鏈子,像是格式不對、內容邏輯錯誤,甚至文件根本打不開。
所以,接下來就真的是走入日常的生活工作中,考驗U2處理實際問題的能力。首先,我們測試下高效辦公場景,我假設自己是一名社區的行政服務經理,針對社區垃圾堆積的情況實施定期輪換清理計劃,讓U2為我製定新的日程表,並做成PDF和Excel文件發給我。
很快,界面上就顯示已完成請求,並生成了對應的文件,下面是截取PDF和Excel文件的部分內容,可以看到U2清晰列出了每週各樓棟的垃圾清理輪換時間,通知文件也符合正常行文的標準,可以直接使用。



場景4:金融分析——持倉回撤評估與調倉建議
前面測試的是執行力,但U2能不能勝任更專業的活兒?接下來進入金融分析場景——金融業充滿風險,因此需要更加嚴謹。模型既要準確理解專業概念,又要能結合宏觀數據做邏輯推理,而且絕不能瞎編,輸出結構還要像模像樣,而不是一堆散亂的要點。
Prompt:生成一份客戶季度報告,評估當前持倉(茅台30%+寧德20%+中芯20%+現金30%)在Q1的最大回撤表現、行業集中度與風格暴露風險,並結合宏觀流動性觀點給出下一季度的調倉與再平衡建議。
直接看結果:
客戶季度投資組合報告(2026年Q1)
一、報告概述
報告期間:2026年第一季度(2026年1月-3月)
客戶持倉組合**:茅台(30%)+ 寧德時代(20%)+ 中芯國際(20%)+ 現金(30%)
報告日期:2026年5月26日
二、Q1持倉表現分析
2.1 持倉個股業績表現
| 持倉標的 | 權重 | Q1業績表現 | 核心數據 |
|———|——|————|———-|
| **貴州茅台**(600519) | 30% | 2025年年報:營收1,688.38億元(-1.21% YoY),淨利潤823.20億元(-4.53% YoY) | 2026年Q1報告已發佈,基本每股收益0.17元 |
| **寧德時代**(300750) | 20% | 超預期增長 | Q1單位毛利0.135元/Wh,毛利率24.82%(同比+0.41pct) |
| **中芯國際**(688981) | 20% | 穩健增長 | Q1營收176.17億元(+8.1% YoY),淨利潤13.61億元(+0.36% YoY),毛利率20.1%(同比+0.9pct) |
| **現金** | 30% | — | 持有現金或貨幣市場工具 |
2.2 Q1最大回撤表現分析
**組合整體Q1最大回撤估計**:-12%至-15%區間
**各持倉標的Q1股價回撤情況**:
– **貴州茅台**:Q1期間股價從約1,400元區間調整至1,280-1,300元區間,**最大回撤約-8%至-10%**
– **寧德時代**:Q1期間股價從約280元調整至260-270元區間,**最大回撤約-5%至-8%**
– **中芯國際**:Q1期間股價在80-95元區間波動,**最大回撤約-10%至-12%**
**回撤原因分析**:
1. **茅台**:消費需求疲軟導致業績承壓,渠道庫存去化壓力加大
2. **寧德時代**:原材料價格波動影響市場預期,電動車銷量不及預期
3. **中芯國際**:半導體行業週期仍在底部區域,地緣政治風險壓製估值
三、行業集中度分析
3.1 行業分佈
| 行業 | 持倉權重 | 風險特徵 |
|——|———-|———-|
| **白酒消費** | 30% | 防禦性行業,需求剛性但受經濟週期影響 |
| **新能源(動力電池)** | 20% | 成長性行業,政策支援但競爭激烈 |
| **半導體** | 20% | 週期性強、高科技屬性、受地緣政治影響 |
| **現金** | 30% | 流動性管理 |
3.2 集中度風險評估
**行業集中度評級**:⚠️ **中高風險**
**問題1:單一行業暴露度過高**
– 消費+新能源+半導體合計佔比70%,若任一行業遭遇系統性調整,組合回撤風險顯著
**問題2:賽道高度重疊**
– 茅台(消費)、寧德(製造)、中芯(科技)均屬於**大盤成長風格**,缺乏價值風格對衝
**問題3:流動性風險**
– 30%現金倉位提供一定緩衝,但股票持倉流動性較好
四、風格暴露風險分析
4.1 風格因子暴露
| 風格維度 | 暴露方向 | 風險評估 |
|———-|———-|———-|
| **成長/價值** | 高度成長暴露 | ⚠️ 若市場風格切換至價值,組合承壓 |
| **大盤/小盤** | 大盤股為主 | ✅ 流動性好,但彈性不足 |
| **行業動量** | 集中於過去3年熱門賽道 | ⚠️ 存在均值回歸風險 |
4.2 風格風險詳解
1. **成長風格風險**:當前持倉均為典型成長股,PE估值較高,若美聯儲維持緊縮或國內流動性收緊,成長股估值承壓
2. **賽道擁擠風險**:新能源、半導體、白酒均為機構重倉賽道,Q1期間出現明顯資金流出
3. **北向資金影響**:Q1期間北向資金波動加大,對大盤成長股影響顯著
五、宏觀流動性觀點(2026年Q2展望)
5.1 央行貨幣政策基調
根據央行2026年Q1貨幣政策執行報告:
– **繼續實施適度寬鬆的貨幣政策**
– 增強政策前瞻性、精準性、針對性
– 預計下半年通過降準等工具保障經濟達到4.5%-5.0%增長目標
5.2 流動性環境評估
| 指標 | 現狀 | 展望 |
|——|——|——|
| 貨幣供應 | M2增速平穩 | 預計Q2邊際寬鬆 |
| 利率環境 | LPR保持低位 | 仍有下調空間 |
| 信用環境 | 社融增速企穩 | 預計緩慢回升 |
| 外資流入 | Q1波動加大 | Q2有望改善 |
5.3 對市場的影響
– **正面**:流動性寬鬆對成長股估值形成支撐
– **負面**:經濟複蘇力度仍待觀察,風險偏好修復需要時間
– **判斷**:Q2市場可能呈現**震盪分化**格局,風格可能從極致成長向均衡過渡
六、Q2調倉與再平衡建議
6.1 核心建議
| 建議 | 操作 | 理由 |
|——|——|——|
| **1. 降低茅台倉位** | 30%→20% | 消費複蘇低於預期,業績承壓,基本面邊際惡化 |
| **2. 維持寧德時代** | 20%不變 | 龍頭地位穩固,Q1業績超預期,但估值已反映樂觀預期 |
| **3. 維持中芯國際** | 20%不變 | 國產替代長期邏輯清晰,Q1業績穩健 |
| **4. 增加現金/債券** | 30%→40% | 防範市場波動,等待更好的加倉時機 |
6.2 調倉後目標配置
| 標的 | 建議權重 | 調整方向 |
|——|———-|———-|
| 貴州茅台 | 20% | ↓ 減持10% |
| 寧德時代 | 20% | → 維持 |
| 中芯國際 | 20% | → 維持 |
| 現金/短債 | 40% | ↑ 增加10% |
6.3 備選標的建議
若Q2出現明顯回調,可考慮逢低佈局:
– **港股互聯網龍頭**(騰訊、阿里巴巴):估值處於歷史低位,政策邊際改善
– **高股息紅利資產**(銀行、運營商):防禦屬性強,提供穩定現金流
– **醫藥龍頭**:行業處於底部區域,政策風險逐步釋放
七、風險提示
1. **市場波動風險**:Q2市場可能繼續震盪,組合淨值存在波動風險
2. **行業集中風險**:持倉集中於消費、新能源、半導體行業,需關注行業輪動風險
3. **流動性風險**:若市場出現極端下跌,現金倉位可提供防禦緩衝
4. **政策風險**:宏觀經濟政策、產業政策變化可能影響持倉表現
八、下季度跟蹤要點
– 茅台Q2動銷數據及渠道庫存去化進度
– 寧德時代二季度排產及市場份額變化
– 中芯國際先進製程產能爬坡情況
– 央行貨幣政策邊際變化
– 美聯儲利率決策及全球流動性環境
報告編製說明:本報告基於公開信息整理,數據截至2026年5月。過往業績不代表未來表現,投資有風險,入市需謹慎。
可以看到,基於Agentic Harness框架,U2能夠自主完成信息檢索、數據分析和報告生成的全流程。這份報告數據有出處,個股業績引用了真實財報數據;邏輯有鏈條,從持倉表現到集中度、風格暴露、宏觀展望、調倉建議,層層遞進。對於金融類複雜業務分析來說,能跑完全流程、輸出結果可直接交付的能力,意味著U2是能真正分擔專業工作的生產力角色。
場景5:深度研究——AI政務文獻檢索與橫向對比
最後來測試下深度研究場景,現實工作中最耗人的往往是那種沒有現成答案的模糊指令,比如找資料、篩信息、做歸納。模型要有搜索規劃能力,知道去哪找、用什麼關鍵詞、怎麼過濾噪聲;還要有信息甄別能力和提煉整合能力。
這裏我要求U2查找五篇關於政府領域應用AI和自動化的學術文章(2020年以後發表、公開可獲取、非付費牆來源),並將摘要整理成表格形式用於橫向對比。整個過程跑下來,U2從找文獻到出表格一氣嗬成,中間沒有來回確認、沒有遺漏篩選條件。對於需要快速切入一個陌生研究領域的人來說,可能一下子就省下了半天的時間。

從這些場景可以看出,雲知聲在U2上重點強化了“完成任務”,這是一款面向任務執行的原生智能體大模型,比起“對話”,更適合拿來“幹活”。在Reasoning、Coding和Agent三大核心能力上,Reasoning方面U2強調低偏差執行和長程邏輯穩定性,面對複雜、多步驟任務時,不僅要能回答局部問題,更要能夠持續保持目標一致,動態權衡預算、時間、約束條件和可行路徑,最終輸出更優方案;Coding方面,U2面向端到端工程交付,既能夠根據自然語言需求生成代碼,也能夠理解多文件項目結構,保持接口、依賴和調用邏輯一致,並在環境調試和自主Debug中持續推進任務完成;Agent方面,U2重點提升了多工具協同、長流程編排和環境交互能力,面對開放式目標,能夠拆解任務優先級,理解API能力邊界,組合調用不同工具,並根據外部系統反饋調整執行策略。
先理解和規劃,再執行和協作,最後校驗和交付,這就是U2的任務交付閉環。
從模型到生態:雲知聲的品牌升級
測評分析的主要是性能表現,回到文章的開始,U2如何提高AI應用的性價比?
傳統顯式思維鏈往往需要生成大量中間推理文本,因此帶來更高的Token消耗與推理延遲;隱空間推理雖然效率更高,卻可能在複雜任務中出現邏輯漂移,缺乏足夠的可控性與驗證能力。U2引入了混合思考機制,在同一推理過程中根據任務不同階段的複雜度和不確定性動態切換思考形態。
具體來說,任務早期U2先在隱空間中完成路徑搜索、任務拆解、候選方案生成與執行規劃,在不確定性較低時保持高效的隱式推理;當任務進入關鍵判斷、複雜約束處理或結果收斂階段,推理過程中不確定性升高,通過可控隱空間展開(Bounded Latent Rollout)與熵感知切換(Entropy-aware Switching)機制,模型切換到顯式思維鏈,通過可讀、可校驗的確定性 Token完成邏輯校準、過程驗證與最終決策。
也就是靠這種方式,U2實現了“少Token,深思考”。任務執行時,U2還引入了Agent-Harness 協同訓練範式,並將模型原生Agent能力提升與Harness迭代優化納入同一訓練閉環,Harness根據U2的模型特點持續優化任務執行鏈路,真實任務中產生的高質量執行軌跡,又強化了模型的任務規劃、工具調用、過程糾錯和結果驗收能力。
作為一家成立十餘年的AI公司,雲知聲曆經過多個技術週期,U2的發佈對其來說,並不只是在模型能力上的一次升級,更標誌著這家AI公司正在完成向“原生智能體大模型公司”的轉型。從商業落地的維度來看,雲知聲已經圍繞U2搭建起ToB與ToC雙輪驅動的業務閉環。
ToB端,雲知聲擁有獸牙智能體平台,並在醫療、醫保、交通、客服等多個領域實現了一系列中標。這些落地的核心邏輯是,依託U2在指令遵循、Agent工具調用和複雜任務執行方面的能力,為企業提供可規模化部署的智能體解決方案,將大模型能力直接轉化為業務產出。
ToC端,雲知聲通過公有雲MaaS(Model-as-a-Service)和OPC生態佈局,持續產生Token收入。據透露,受益於高質量場景Token的需求激增,公司5月Token調用收入的ARR環比暴漲600%,預計6月將繼續保持高增長,達到1500萬美金。這意味著,雲知聲的收入與客戶AI使用強度已直接關聯,業務的規模天花板全面打開。
目前存在一個行業性的問題:大模型下半場,競爭的焦點到底是什麼?雲知聲用U2給出了一種答案:不拚參數拚效率,用智能密度和Token價值重新計算AI的商業意義。



















