阿里發佈Qwen-Image-3.0圖像模型,支持超長指令複雜圖文生成

新浪科技訊 7月21日下午消息,阿里發佈最新圖像生成基礎模型Qwen-Image-3.0。該模型支持最大4.5k token超長輸入,可一次生成涵蓋公式符號、幾何圖形、邏輯推導步驟等多元素融合的知識圖解、複雜UI界面,同時支持12國語言和20多款字體原生渲染,大幅降低了多語言產品海報、影視/漫畫分鏡等“可讀可用”商業素材的生產成本。

Qwen-Image-3.0是千問圖像生成和編輯模型系列的第三代基礎模型,對於GPT-Image-2擅長的直播間頁面,Qwen-Image-3.0也能輕鬆生成,人像攝影、數學試卷、古碑拓片,千問生成的圖片細節滿滿,栩栩如生。

Qwen-Image-3.0著重提升了模型對於複雜信息的承載能力,較前代在文本輸入長度上實現了4.5倍的躍升。這意味著,在影視短劇分鏡、複雜信息圖、產品說明頁等需要超長提示詞輸入的場景中,用戶不再需要將需求壓縮成一句話,而是可以像給設計師撰寫需求文檔一樣,完整描述畫面結構、文字內容、視覺風格和排版細節,從而讓模型更精準地生成圖文內容,減少反複生成和人工調試成本。憑藉Qwen-Image-3.0對語義並置和空間控製能力的極致把握,新模型可一次性生成涵蓋9種不同領域的9宮格知識圖解,字字清晰,幅幅準確。

此外,Qwen-Image-3.0還能輕鬆理解複雜指令和畫面的邏輯嵌套關係,可根據一條指令在同一幅圖中生成網頁、軟件界面、聊天窗口、海報等多類視覺內容的組合式表達。比如,當用戶輸入“在 VSCode 編程界面中,通過千問App生成一張發佈在聊天界面里的手衝咖啡海報”時,模型能夠準確理解其中的多層UI嵌套關係,並依次生成VSCode編程界面、千問App界面、社交媒體聊天界面和咖啡海報,在保持各層界面結構、風格準確的同時,甚至連手機截圖里的時間數字,低至10像素的小字,都清晰可辨。(文猛)