來源於:自變量發布 WALL-開雲登入口
發布時間:2026-08-27 23:35:54
文章摘要:
自變量發布 WALL-開雲登入口:自變量發布 WALL-開雲登入口 自變量發布 WALL-開雲登入口
世界模型已經成為具身智能的自變重要技術範式。它試圖構建一個符合物理規律的自變“虛擬世界”,作為試驗機器人動作的自變開雲手機網頁登錄入口“訓練場”,讓機器人提前看到動作帶來的自變結果,從而決定要執行哪些動作。自變 然而現有世界模型仍麵臨三大瓶頸:首先是自變模型更習慣按照視覺畫麵“猜測”未來,卻忽略動作指令;其次是自變推演時間一長,畫麵就開始崩潰,自變出現物體變形、自變位置錯亂等問題;第三是自變在虛擬世界中可行的動作策略,到了真實物理世界卻無法複現,自變導致世界模型無法成為可靠的自變評測環境。 今日,自變自變量機器人正式發布 WALL-SS,自變即下一尺度自回歸世界模型。自變它突破傳統擴散模型以單片段生成視頻的方式,創新采用“下一尺度自回歸”架構:如同畫家作畫一般,先勾勒粗尺度輪廓,再逐層細化畫麵與物理細節,開雲手機網頁登錄入口從而實現對未來畫麵更穩定、更精細的預測。 WALL-SS 實現了三方麵突破:預測錨定動作,生成的未來嚴格遵循動作指令;長時間穩定,推演較長時間仍能保持畫麵和物體狀態連貫;可驗證性,在虛擬世界驗證的動作能夠作為真實世界中的有效參考。 測試結果顯示,WALL-SS 的“動作跟隨”得分達到 0.29,是所有對比模型中唯一不為零的模型;推演時長達到 60 秒,畫麵仍未出現明顯崩潰;虛擬世界與真實世界的任務成功率吻合度達到 93%。 WALL-SS 學習“動作—畫麵變化”的物理規律,並通過下一尺度自回歸,從粗到精生成未來畫麵。 預測畫麵不聽動作“指揮”?WALL-SS 讓動作真正控製畫麵生成 現有世界模型在預測未來狀態時,往往高度依賴對背景和物體的先驗模式,而對動作信號的細微變化不夠敏感。 以機械臂抓杯子為例,手指的位置相差 1 毫米,在物理世界中就可能對應“成功抓起”和“撞翻杯子”兩種完全不同的結果。然而,由於兩種情況在視覺上高度相似,模型很容易忽略這 1 毫米的動作偏差,依據視覺慣性和先驗經驗,直接生成“穩穩抓住杯子”的虛假結果。 WALL-SS 提出了“尺度對齊的動作條件注入”:將機器人動作指令嚴格對齊到不同生成尺度中,讓動作從生成畫麵的“輔助信號”變為必須遵循的核心條件。 在不同尺度的畫麵預測中,動作都直接參與決策:粗尺度決定機器人的大致位置,精尺度決定手指是否合攏,動作信號貫穿畫麵生成的全過程。同時,WALL-SS 對動作與畫麵進行嚴格對齊,統一時間軸和坐標係,並通過多攝像頭信息協同,確保動作、視角與畫麵狀態保持一致。 分別輸入向左、向前、向右三種動作指令,藍色虛線為指令軌跡,橙色實線為生成軌跡,兩者高度重合,表明模型生成能夠遵循動作指令。 在“動作跟隨”測試中,WALL-SS 得分 0.29,是所有對比模型中唯一得分不為零的模型。也就是說,此前的模型都難以讓預測畫麵中的虛擬機器人真正遵循給定的動作指令。不僅如此,生成視頻與給定動作軌跡指令的重合度也從 0.251 提升至 0.539,提升 115%。 時間一長畫麵就崩壞?WALL-SS 讓模型分層處理記憶 世界模型麵臨的另一大挑戰是,如何保持在長時間的穩定預測。模型需要連續生成未來的多個畫麵,而後續畫麵又建立在前麵的預測基礎上,因此任何細微的誤差都會不斷累積,最終導致預測崩潰:物體突然消失,桌麵變得扭曲,機器人手中的物體瞬間回到原位。 預測崩潰的根本原因,在於模型必須將曆史畫麵作為上下文。曆史信息保留得太少,模型就容易“忘記”早先發生的事情;保留得太多,又會讓上下文長度和內存開銷快速增長。因此,如何在有限的資源下,持續保留對未來預測真正有用的曆史信息,成為世界模型實現長時間穩定預測的關鍵。 WALL-SS 提出了“尺度壓縮的長時間跨度記憶”:並非所有曆史信息都需要被同等精細地保留,越近的記憶保留得越精細,越久遠的則壓縮為更粗粒度。比如,模型可以記住機器人幾秒前“用左手抓住了杯子”,幾十秒前“移動到了桌子旁邊”,對於更久遠的信息,隻需保留“場景中有桌子和杯子”這樣的概括。如此一來,模型不論推演多久,內存占用始終恒定。 WALL-SS 推演至 60 秒,畫麵仍保持清晰,物體位置穩定;通用視頻模型在約 30 秒後物體消失。 不僅如此,WALL-SS 還會記住“是什麽動作導致了這個畫麵”,在壓縮視覺信息時同步壓縮動作曆史,讓動作與結果之間的因果關係始終保持清晰。此外,自變量還提出“尺度級夢境強迫”,在訓練時故意給模型“喂錯題”,讓它學會從錯誤中恢複,從而在推理過程中及時發現並修正誤差。 在“流式推演”測試中,WALL-SS 能穩定推演 60 秒,畫麵依然清晰,物體位置也保持準確。作為比較,僅保留最近幾幀信息的模型,推演 20-30 秒後就開始出現明顯的畫麵崩壞。 虛擬世界預測“不足信”?WALL-SS 讓模型成為可靠“試驗場” 世界模型麵臨的第三個關鍵問題是:在虛擬世界裏驗證成功的動作策略,到了真實世界裏是否依然有效?世界模型預測未來的目的,就是為物理世界中的動作提供依據。如果虛擬世界與真實世界存在明顯偏差,預測結果就很難幫助機器人決策。 WALL-SS 提出了“視覺動力學的在線策略對齊”:讓模型在自己預測的軌跡上通過強化學習“實戰練習”,並根據兩個裁判的反饋不斷修正:一個檢查“動作對不對”,即畫麵預測是否遵循動作指令;另一個檢查“長期一致性”,即不同時間尺度下的畫麵是否保持連貫。通過這兩重約束,WALL-SS 能進一步縮小虛擬世界預測與物理現實之間的差距。 在“閉環策略一致性”測試中,自變量在 6 個任務、5 個訓練階段分別進行測試,發現同一策略在虛擬世界和真實世界中的任務成功率,吻合度達到 93%。這意味著,虛擬世界中的測試結果已經具備較高的現實參考價值,可以將世界模型作為檢驗機器人動作策略的“試驗場”,大幅提升篩選效率。 同一個策略在虛擬世界與真實世界中分別測試,任務成功率高度吻合,相關係數達到 0.93。 不僅如此,WALL-SS 的同一個網絡既能充當模擬器,也能充當規劃器:模擬器根據給定的動作預測未來,規劃器則根據任務目標自主生成動作路徑。這樣一來,就可以利用模型生成動作方案,再立即通過模擬器驗證結果,整個“生成方案—驗證效果—篩選最優”的閉環都在同一個模型裏完成。 WALL-SS 還內置了動作解碼頭,可以從預測的未來畫麵中直接讀取機器人下一步動作。傳統世界模型隻能回答“未來會發生什麽”,還需要另一個模型將預測畫麵轉換為動作指令;WALL-SS 則能夠直接輸出動作。這使 WALL-SS 不僅是一個可以預測和仿真的“虛擬試驗場”,也能直接驅動機器人執行任務。 結語 具身智能要真正走進現實世界、服務於人,很大的挑戰是在真實環境中試錯,成本高、周期長且存在風險。世界模型能夠讓機器人在動手之前“先想一步”,提前推演不同動作帶來的結果,再擇優執行;WALL-SS 則讓這個過程更可信、更穩定、更接近真實,有望大幅縮短機器人策略開發與篩選的周期。 WALL-SS 推動的不隻是一項世界模型技術的突破,更為機器人構建了一條低成本、高效率的能力成長路徑——讓機器人先在虛擬環境中學習和驗證,再將成熟的操作能力遷移到家庭、工廠和養老院等真實場景,讓機器人擁有服務千家萬戶的能力。
返回首頁