欧美精选在线播放_在线日韩第一页_亚洲理论在线观看_亚洲国产精品嫩草影院久久

您現在的位置:首頁 > 資訊 > 即時 > 正文

Jim Fan、李飛飛團隊新作:機器人也能「上下文scaling」

時間:2026-07-27 10:34:49    來源:學術頭條    

過去,受限于極短的上下文窗口,機器人很快就會遺忘剛剛發生的一切。那么,機器人能不能像當前的大語言模型(LLM)一樣,記住并利用更長的上下文?

針對這一問題,英偉達高級研究科學家 Jim Fan 與斯坦福大學教授、“AI教母”李飛飛團隊及其合作者,推出了機器人模型與訓練方案 RoboTTT(Test-Time-Training Robot Policies),將視覺運動上下文擴展到 8K 時間步,相當于 5 分鐘的“肌肉記憶”,比現有 SOTA 策略高出 3 個數量級,且不增加推理延遲。

論文鏈接:https://arxiv.org/abs/2607.15275


(資料圖片僅供參考)

這意味著,RoboTTT 可以將一整段視頻作為上下文輸入,并根據人類視頻進行一次性模仿。它還擁有實時“自我改進”的能力,能將修正信息納入上下文,并在執行中不斷調整動作,從而在多階段長程任務上取得更好的表現。

研究團隊表示,上下文長度將成為機器人基礎模型的新 scaling 方向:使用 8K 時間步上下文訓練的 RoboTTT,比使用 1K 時間步預訓練的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上發帖稱:“很快,即使是 100 萬上下文,也不再是幻想。”

面向機器人策略的長上下文建模

RoboTTT 將測試時訓練(TTT)嵌入機器人基礎模型,用快速權重作為模型的循環狀態。每次接收傳感器輸入,模型都會執行一步梯度更新,把歷史信息寫入權重。這樣做的好處是,由于隱藏狀態大小固定,機器人可以在較低開銷下保留更長歷史信息,并在部署后繼續學習。

圖|RoboTTT 的模型架構、訓練和推理。

RoboTTT 主要包含三項設計,如下:

1.模型架構:RoboTTT 由視覺-語言模型(VLM)骨干和帶有 TTT 層的 DiT 動作頭組成。注意力層處理單個時間步內的信息,TTT 層加在注意力層之后,負責沿時間維度處理跨時間信息。為提高效率,模型不直接將所有視覺-語言 token 輸入 TTT 中,而是使用少量 register token 在時間上傳遞視覺-語言信息。為保留預訓練能力,TTT 輸出經 Tanh Gating 后再加入注意力輸出。

圖|帶有 Tanh Gating 的計算流程。

2.序列訓練:為擴展訓練上下文的長度,RoboTTT 結合了序列動作強制和截斷反向傳播算法。訓練時,序列動作強制為每個動作塊獨立采樣噪聲水平,以穩定 flow-matching 訓練;TBPTT 將長序列切分為片段,只在片段內反傳梯度,但讓快速權重繼續跨片段傳遞,這樣既能讓 TTT 貫穿整條序列,又能把顯存開銷控制在片段長度范圍內。

圖|TBPTT。

3.長上下文約束:RoboTTT 會把部分時間步只作為上下文使用,這些時間步會寫入快速權重,但不參與動作損失計算。基于這一機制,模型可以從兩類上下文中學習:

  • 視頻模仿:人類視頻作為上下文,只更新快速權重;動作損失在同任務機器人軌跡上計算。測試時,單個人類視頻即可作為未見配置的條件。
  • DAgger 蒸餾:完整 DAgger 軌跡都會更新快速權重,其中次優機器人動作提供失敗上下文,人類糾正動作提供監督目標;損失只在人類糾正動作上計算,把失敗后的糾正方式寫入快速權重。

圖|DAgger 蒸餾。

上下文越長,性能越強

研究團隊在三個長程雙臂裝配任務上評估了 RoboTTT。整體而言,RRoboTTT 能夠利用自身更多的歷史信息進行訓練,除了上述更強的閉環性能之外,它僅需一段包含上下文信息的人類視頻,即可進行一次性模仿、實時自我改進,以及對物理擾動魯棒。

圖|評估任務。

1.在長程任務上持續優于基線

主評估顯示,RoboTTT 的平均任務完成分數達到 79%,高于單步上下文基線 GR00T N1.7 和將 TTT 層替換為 Gated DeltaNet 的 GDN。

圖|主評估:三個裝配任務上的任務完成分數。

此外,RoboTTT 也是完全成功次數最多的方法,尤其是在平均約 5 分鐘、包含 10 個階段的“齒輪機器人”(Gear Bot)任務上,RoboTTT 是唯一完整完成任務的方法。

圖|主評估:三個裝配任務上的完全成功試驗次數。

簡單拼接過去觀測并不能可靠提升表現。在 Pup Go Car(玩具車裝配)任務上,加入一個歷史幀的 GR00T N1.7 Hist 得分為 39.5%,低于只看當前觀測的 GR00T N1.7(57%)。GDN 將歷史壓縮為循環狀態,但沒有在所有任務上帶來提升。

RoboTTT 更善于跟蹤任務進度、恢復錯誤和完成細粒度操作。在視覺相似的多階段裝配中,RoboTTT 能更好地區分當前階段;電鉆未對準螺絲時,它也會重新對齊并再次嘗試;在插入、扣緊電路組件等細粒度操作中,動作也更精確。

2. 預訓練上下文越長,閉環表現就越好

研究團隊將預訓練上下文從 128 擴展到 8K 時間步后評估發現,RoboTTT-8K 的平均任務完成分數達到 71.5%,比 1K 版本高 63%,比短上下文基線高 57%,且沒有出現飽和跡象。相比而言,上下文變長后,GDN 卻沒有獲得同樣的性能提升。

研究團隊認為,這一差異來自更新機制,RoboTTT 通過梯度下降更新快速權重,并學習快速權重的初始化和更新方式;GDN 則使用線性關聯狀態,不具備這種元學習機制。

圖|閉環性能隨預訓練上下文長度擴展而提升。

3.one-shot 模仿與擾動魯棒

RoboTTT 能基于上下文中的人類視頻完成 one-shot 模仿。在 Circuit(電路裝配任務中),機器人只能通過上下文中的人類視頻判斷該裝配哪種電路配置。結果顯示,RoboTTT 在 10 次未見配置試驗中成功 6 次,任務完成分數為65%;GDN 沒有取得完全成功,任務完成分數為 33%。

圖|從上下文內人類視頻進行一次性模仿。

長上下文約束也提升了擾動恢復能力。當人類在游戲過程中移除已安裝的部件時,RoboTTT 會根據自身的部署情況返回并重新安裝該部件。車頂被移除時,RoboTTT 的恢復率為 75%,高于 GDN 的 65% 和短上下文基線的 50%;輪胎被移除時,RoboTTT 與 GDN 的恢復率均達到 90%,也高于短上下文基線。

4.更強的即時恢復能力

RoboTTT 具備更強的即時恢復能力,并優于標準 DAgger。標準 DAgger 只在人類糾正動作上微調,平均提升9%;DAgger 蒸餾把完整軌跡作為上下文,包括次優機器人動作,但只在人類糾正動作上計算損失,平均提升 33%。通過 DAgger 蒸餾,RoboTTT 學習了一種隱式糾錯算法,并能在線從自身的錯誤中恢復,無需人工干預。

圖|DAgger 蒸餾在 Pup Go Car 上的結果。

不足與未來方向

研究團隊指出,盡管 RoboTTT 展示了上下文長度作為機器人基礎模型新 scaling 軸的潛力,但仍存在一些不足。

首先,擴展訓練上下文長度會增加訓練成本。雖然 RoboTTT 在推理時保持成本恒定,但訓練更長上下文仍需要更多開銷。未來,研究人員應采用更高效的 TTT 訓練技術(如 TNT)來降低這一成本。

其次,TTT 層的目標函數仍有探索空間。當前工作提出了一種將 TTT 整合進機器人基礎模型的方法,但面向機器人的 TTT 層目標(類似視覺領域中的相關探索)將是一個有潛力的方向。

此外,RoboTTT 仍未覆蓋部署中可能出現的全部失敗模式。研究團隊表示,RoboTTT 與強化學習結合,直接優化任務成功率,有望進一步提升實際執行表現。

更多技術細節,詳見原論文。

作者:夏千斯

如需轉載或投稿,請直接在本文章評論區內留言

標簽: 算法 動作 李飛飛 機器人 上下文 scaling

相關資訊

凡本網注明“XXX(非現代青年網)提供”的作品,均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和其真實性負責。

特別關注

熱文推薦

焦點資訊