智譜發佈GLM-5.3:編程能力躍升50%,編程與智能體能力接近Fable 5

新浪科技訊 8月14日下午消息,智譜今日發佈新一代旗艦模型GLM-5.3。在基座模型與GLM-5.2相同的基礎上,通過極致後訓練Scaling,新模型在編程與智能體任務上實現了大幅躍升,並湧現出了更強的網絡安全能力。

在多項基準測試中,GLM-5.3取得了開源模型第一的成績。在內部體感評測中,其編程能力較前代提升50%。在多項主流基準測試中GLM-5.3是當前排名最高的開源模型,編程與智能體能力接近Claude Fable 5,編程體感超過其他國產模型。

在衡量模型於真實終端環境中完成複雜任務的Terminal-Bench 3.0上,GLM-5.3得分從4.6提升至28.3;在聚焦長程軟件工程與持續代碼修改能力的DeepSWE v1.1上,得分從46.2提升至66.9;在覆蓋多類真實專業場景、強調跨工具協作與長程任務的Agents‘ Last Exam上,得分從23.8提升至28.5。

GLM-5.3展現出了出色的網絡安全能力。在白盒代碼審查與漏洞發現任務中,其表現持平行業標杆Mythos 5。在漏洞驗證測試CyberGym中,GLM-5.3得分84.5%,高於GLM-5.2的77.2%。

據悉,上述全部提升都來自後訓練。基於IndexShare、SAO、以及持續演進的新一代Slime框架,智譜在與GLM-5.2完全相同基座上推進強化學習,目前還遠未開發出這個基座的智能上界。智譜將在兩週後開放模型權重。(文猛)