實測京東剛開源的「邊播邊改」AI:能換衣服、戴帽子,適配電商直播
影片創作正在被可實時編輯改寫。8月5日,京東宣佈開源自研的實時流式影片編輯模型JoyAI-Video-Edit,讓用戶可以一邊觀看影片,一邊修改人物穿搭、替換商品和場景。
京東方面回應新京報貝殼財經記者,該開源技術向開發者及內容創作者開放。不同於傳統「先完成素材再進行後期修改」的影片生產邏輯,新技術實現了「邊預覽、邊創作」的模式,能夠適配直播電商、短影片帶貨、家裝設計等電商業務場景。
記者實測:綠色T恤秒變粉色,動作略有延時
新京報貝殼財經記者實測發現,用戶打開攝像頭,只需在文本框內寫入「僅將上衣換為白色圓領純棉T恤,可見棉質紋理」一類的指令,模型便可在影片播放的同時,對人物外觀進行即時替換,無需重新剪輯或等待成片導出。
圖/記者實測截圖。在第一組實測中,記者佩戴眼鏡、身穿綠色T恤自拍,輸入指令「將上衣的描述改為‘粉色’」,模型便實時將畫面中人物的整件綠色T恤替換為粉色。記者繼續體驗,點擊「戴上寫有‘京東’字樣的紅色棒球帽與深色鏡片墨鏡」的指令,右邊影片也實時進行了飾品佩戴操作。不過實時生成畫面的動作,相比原始影片存在輕微延時。
從實測效果與模型交互界面來看,JoyAI-Video-Edit可覆蓋多項高頻影片編輯功能:支持實時替換影片人物的衣物顏色、款式與面料;可同步調整髮型、帽子、眼鏡等配飾,完成人物外貌改造;能夠精細調控棉質紋理、皮革反光等服裝材質質感;可把寫實影片轉換成動畫、插畫、電影等不同藝術風格;也可完成實景與虛擬背景之間的場景置換,實現人物形象向其他真人或虛擬角色的轉換,同時還支持參考圖驅動換裝,上傳參考圖片即可複刻對應形象到影片主體上。
適配電商直播等場景,實用門檻仍在提示詞質量
影片實時編輯首先要解決速度問題。影片由一幀幀連續畫面組成,如果模型處理速度跟不上播放速度,就會出現卡頓與延遲。
京東探索研究院相關負責人表示,JoyAI-Video-Edit基於全自研JoyAI-Video模型,在720P解像度下實現每秒30幀的模型推理速度,能夠在保持較高畫面清晰度的同時,跟上常見影視影片的播放節奏。
從記者的兩組實測看,該模型的「實用門檻」仍在於提示詞質量。同一段影片,僅改變上衣顏色的描述(白色/粉色),模型便迅速給到對應的版本;但若提示詞過於籠統,如只寫「換一身衣服」,模型則可能「擅自」補充未明確要求的配飾、變換髮型,甚至影響畫面整體風格。換言之,模型聽得懂,但聽得「有點多」——使用者需要更精細的提示詞描述來鎖定編輯範圍。
記者發現,該模型在體驗頁給出了一組預設場景按鈕:實時換裝、參考圖換裝、風格演繹、外貌改造、質感變身、場景切換、主角變身,記者對照實測發現,這七個場景基本上覆蓋了電商直播、家裝設計這類對成品確定性要求高的場景。
主流廠商重在「文生影片」,京東押注「邊播邊改」
新京報貝殼財經記者梳理髮現,自2024年OpenAI Sora引爆AI影片生成賽道以來,國內主流廠商在文生影片、圖生影片領域能力快速迭代:阿裡通義萬相2.1於2025年2月全面開源14B與1.3B參數版本;快手可靈AI迭代至2.5Turbo版本,全球用戶超4500萬,2025年第三季度營收超3億元;依託Seedance多模態模型的字節即夢AI,與抖音、剪映深度打通,第三方統計顯示2025年3月其月活躍用戶達893萬。
相比之下,主流玩家押注的多為「先有素材再生成」,即上傳圖片、文字或腳本,一鍵生成一段新影片;而JoyAI-Video-Edit選擇押注「先有影片,再邊播邊改」。
京東的另一層用意,在於拓展具身智能的訓練數據。上述負責人透露,JoyAI-Video-Edit還為具身智能數據大規模合成提供了新的技術路徑。機器人訓練需要大量物體抓取、搬運與操作影片,但真機數據採集成本較高,危險或少見場景也難以反復採集。依託對場景、物體與畫面內容的可控編輯能力,JoyAI-Video-Edit可將人手操作影片轉化為機械手或機械臂操作素材,並在保留物體位置、空間關係與動作軌跡的基礎上,替換場景、物體與機器人形態,讓一段影片擴展出更多訓練樣本。
新京報貝殼財經記者梳理髮現,京東已搭建起面向物理世界的JoyAI模型矩陣:JoyAI‑Image‑Edit負責空間理解與圖像編輯,JoyAI‑Echo聚焦長音影片生成,JoyAI‑VL‑Interaction可實現AI持續觀察畫面並實時反饋,JoyAI‑Talker承擔實時語音交互能力,JoyAI‑RA面向機器人操控。此次開源的JoyAI-Video-Edit補齊實時影片編輯能力,也是該矩陣中首個支持任意時長影片流式編輯的模型。
新京報貝殼財經記者 程子姣
編輯 楊娟娟
校對 穆祥桐



















