欧美精选在线播放_在线日韩第一页_亚洲理论在线观看_亚洲国产精品嫩草影院久久

您現(xiàn)在的位置:首頁 > 資訊 > 即時(shí) > 正文

Jim Fan、李飛飛團(tuán)隊(duì)新作:機(jī)器人也能「上下文scaling」

時(shí)間:2026-07-27 10:34:49    來源:學(xué)術(shù)頭條    

過去,受限于極短的上下文窗口,機(jī)器人很快就會遺忘剛剛發(fā)生的一切。那么,機(jī)器人能不能像當(dāng)前的大語言模型(LLM)一樣,記住并利用更長的上下文?

針對這一問題,英偉達(dá)高級研究科學(xué)家 Jim Fan 與斯坦福大學(xué)教授、“AI教母”李飛飛團(tuán)隊(duì)及其合作者,推出了機(jī)器人模型與訓(xùn)練方案 RoboTTT(Test-Time-Training Robot Policies),將視覺運(yùn)動上下文擴(kuò)展到 8K 時(shí)間步,相當(dāng)于 5 分鐘的“肌肉記憶”,比現(xiàn)有 SOTA 策略高出 3 個(gè)數(shù)量級,且不增加推理延遲。

論文鏈接:https://arxiv.org/abs/2607.15275


(資料圖片僅供參考)

這意味著,RoboTTT 可以將一整段視頻作為上下文輸入,并根據(jù)人類視頻進(jìn)行一次性模仿。它還擁有實(shí)時(shí)“自我改進(jìn)”的能力,能將修正信息納入上下文,并在執(zhí)行中不斷調(diào)整動作,從而在多階段長程任務(wù)上取得更好的表現(xiàn)。

研究團(tuán)隊(duì)表示,上下文長度將成為機(jī)器人基礎(chǔ)模型的新 scaling 方向:使用 8K 時(shí)間步上下文訓(xùn)練的 RoboTTT,比使用 1K 時(shí)間步預(yù)訓(xùn)練的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上發(fā)帖稱:“很快,即使是 100 萬上下文,也不再是幻想。”

面向機(jī)器人策略的長上下文建模

RoboTTT 將測試時(shí)訓(xùn)練(TTT)嵌入機(jī)器人基礎(chǔ)模型,用快速權(quán)重作為模型的循環(huán)狀態(tài)。每次接收傳感器輸入,模型都會執(zhí)行一步梯度更新,把歷史信息寫入權(quán)重。這樣做的好處是,由于隱藏狀態(tài)大小固定,機(jī)器人可以在較低開銷下保留更長歷史信息,并在部署后繼續(xù)學(xué)習(xí)。

圖|RoboTTT 的模型架構(gòu)、訓(xùn)練和推理。

RoboTTT 主要包含三項(xiàng)設(shè)計(jì),如下:

1.模型架構(gòu):RoboTTT 由視覺-語言模型(VLM)骨干和帶有 TTT 層的 DiT 動作頭組成。注意力層處理單個(gè)時(shí)間步內(nèi)的信息,TTT 層加在注意力層之后,負(fù)責(zé)沿時(shí)間維度處理跨時(shí)間信息。為提高效率,模型不直接將所有視覺-語言 token 輸入 TTT 中,而是使用少量 register token 在時(shí)間上傳遞視覺-語言信息。為保留預(yù)訓(xùn)練能力,TTT 輸出經(jīng) Tanh Gating 后再加入注意力輸出。

圖|帶有 Tanh Gating 的計(jì)算流程。

2.序列訓(xùn)練:為擴(kuò)展訓(xùn)練上下文的長度,RoboTTT 結(jié)合了序列動作強(qiáng)制和截?cái)喾聪騻鞑ニ惴āS?xùn)練時(shí),序列動作強(qiáng)制為每個(gè)動作塊獨(dú)立采樣噪聲水平,以穩(wěn)定 flow-matching 訓(xùn)練;TBPTT 將長序列切分為片段,只在片段內(nèi)反傳梯度,但讓快速權(quán)重繼續(xù)跨片段傳遞,這樣既能讓 TTT 貫穿整條序列,又能把顯存開銷控制在片段長度范圍內(nèi)。

圖|TBPTT。

3.長上下文約束:RoboTTT 會把部分時(shí)間步只作為上下文使用,這些時(shí)間步會寫入快速權(quán)重,但不參與動作損失計(jì)算。基于這一機(jī)制,模型可以從兩類上下文中學(xué)習(xí):

  • 視頻模仿:人類視頻作為上下文,只更新快速權(quán)重;動作損失在同任務(wù)機(jī)器人軌跡上計(jì)算。測試時(shí),單個(gè)人類視頻即可作為未見配置的條件。
  • DAgger 蒸餾:完整 DAgger 軌跡都會更新快速權(quán)重,其中次優(yōu)機(jī)器人動作提供失敗上下文,人類糾正動作提供監(jiān)督目標(biāo);損失只在人類糾正動作上計(jì)算,把失敗后的糾正方式寫入快速權(quán)重。

圖|DAgger 蒸餾。

上下文越長,性能越強(qiáng)

研究團(tuán)隊(duì)在三個(gè)長程雙臂裝配任務(wù)上評估了 RoboTTT。整體而言,RRoboTTT 能夠利用自身更多的歷史信息進(jìn)行訓(xùn)練,除了上述更強(qiáng)的閉環(huán)性能之外,它僅需一段包含上下文信息的人類視頻,即可進(jìn)行一次性模仿、實(shí)時(shí)自我改進(jìn),以及對物理擾動魯棒。

圖|評估任務(wù)。

1.在長程任務(wù)上持續(xù)優(yōu)于基線

主評估顯示,RoboTTT 的平均任務(wù)完成分?jǐn)?shù)達(dá)到 79%,高于單步上下文基線 GR00T N1.7 和將 TTT 層替換為 Gated DeltaNet 的 GDN。

圖|主評估:三個(gè)裝配任務(wù)上的任務(wù)完成分?jǐn)?shù)。

此外,RoboTTT 也是完全成功次數(shù)最多的方法,尤其是在平均約 5 分鐘、包含 10 個(gè)階段的“齒輪機(jī)器人”(Gear Bot)任務(wù)上,RoboTTT 是唯一完整完成任務(wù)的方法。

圖|主評估:三個(gè)裝配任務(wù)上的完全成功試驗(yàn)次數(shù)。

簡單拼接過去觀測并不能可靠提升表現(xiàn)。在 Pup Go Car(玩具車裝配)任務(wù)上,加入一個(gè)歷史幀的 GR00T N1.7 Hist 得分為 39.5%,低于只看當(dāng)前觀測的 GR00T N1.7(57%)。GDN 將歷史壓縮為循環(huán)狀態(tài),但沒有在所有任務(wù)上帶來提升。

RoboTTT 更善于跟蹤任務(wù)進(jìn)度、恢復(fù)錯(cuò)誤和完成細(xì)粒度操作。在視覺相似的多階段裝配中,RoboTTT 能更好地區(qū)分當(dāng)前階段;電鉆未對準(zhǔn)螺絲時(shí),它也會重新對齊并再次嘗試;在插入、扣緊電路組件等細(xì)粒度操作中,動作也更精確。

2. 預(yù)訓(xùn)練上下文越長,閉環(huán)表現(xiàn)就越好

研究團(tuán)隊(duì)將預(yù)訓(xùn)練上下文從 128 擴(kuò)展到 8K 時(shí)間步后評估發(fā)現(xiàn),RoboTTT-8K 的平均任務(wù)完成分?jǐn)?shù)達(dá)到 71.5%,比 1K 版本高 63%,比短上下文基線高 57%,且沒有出現(xiàn)飽和跡象。相比而言,上下文變長后,GDN 卻沒有獲得同樣的性能提升。

研究團(tuán)隊(duì)認(rèn)為,這一差異來自更新機(jī)制,RoboTTT 通過梯度下降更新快速權(quán)重,并學(xué)習(xí)快速權(quán)重的初始化和更新方式;GDN 則使用線性關(guān)聯(lián)狀態(tài),不具備這種元學(xué)習(xí)機(jī)制。

圖|閉環(huán)性能隨預(yù)訓(xùn)練上下文長度擴(kuò)展而提升。

3.one-shot 模仿與擾動魯棒

RoboTTT 能基于上下文中的人類視頻完成 one-shot 模仿。在 Circuit(電路裝配任務(wù)中),機(jī)器人只能通過上下文中的人類視頻判斷該裝配哪種電路配置。結(jié)果顯示,RoboTTT 在 10 次未見配置試驗(yàn)中成功 6 次,任務(wù)完成分?jǐn)?shù)為65%;GDN 沒有取得完全成功,任務(wù)完成分?jǐn)?shù)為 33%。

圖|從上下文內(nèi)人類視頻進(jìn)行一次性模仿。

長上下文約束也提升了擾動恢復(fù)能力。當(dāng)人類在游戲過程中移除已安裝的部件時(shí),RoboTTT 會根據(jù)自身的部署情況返回并重新安裝該部件。車頂被移除時(shí),RoboTTT 的恢復(fù)率為 75%,高于 GDN 的 65% 和短上下文基線的 50%;輪胎被移除時(shí),RoboTTT 與 GDN 的恢復(fù)率均達(dá)到 90%,也高于短上下文基線。

4.更強(qiáng)的即時(shí)恢復(fù)能力

RoboTTT 具備更強(qiáng)的即時(shí)恢復(fù)能力,并優(yōu)于標(biāo)準(zhǔn) DAgger。標(biāo)準(zhǔn) DAgger 只在人類糾正動作上微調(diào),平均提升9%;DAgger 蒸餾把完整軌跡作為上下文,包括次優(yōu)機(jī)器人動作,但只在人類糾正動作上計(jì)算損失,平均提升 33%。通過 DAgger 蒸餾,RoboTTT 學(xué)習(xí)了一種隱式糾錯(cuò)算法,并能在線從自身的錯(cuò)誤中恢復(fù),無需人工干預(yù)。

圖|DAgger 蒸餾在 Pup Go Car 上的結(jié)果。

不足與未來方向

研究團(tuán)隊(duì)指出,盡管 RoboTTT 展示了上下文長度作為機(jī)器人基礎(chǔ)模型新 scaling 軸的潛力,但仍存在一些不足。

首先,擴(kuò)展訓(xùn)練上下文長度會增加訓(xùn)練成本。雖然 RoboTTT 在推理時(shí)保持成本恒定,但訓(xùn)練更長上下文仍需要更多開銷。未來,研究人員應(yīng)采用更高效的 TTT 訓(xùn)練技術(shù)(如 TNT)來降低這一成本。

其次,TTT 層的目標(biāo)函數(shù)仍有探索空間。當(dāng)前工作提出了一種將 TTT 整合進(jìn)機(jī)器人基礎(chǔ)模型的方法,但面向機(jī)器人的 TTT 層目標(biāo)(類似視覺領(lǐng)域中的相關(guān)探索)將是一個(gè)有潛力的方向。

此外,RoboTTT 仍未覆蓋部署中可能出現(xiàn)的全部失敗模式。研究團(tuán)隊(duì)表示,RoboTTT 與強(qiáng)化學(xué)習(xí)結(jié)合,直接優(yōu)化任務(wù)成功率,有望進(jìn)一步提升實(shí)際執(zhí)行表現(xiàn)。

更多技術(shù)細(xì)節(jié),詳見原論文。

作者:夏千斯

如需轉(zhuǎn)載或投稿,請直接在本文章評論區(qū)內(nèi)留言

標(biāo)簽: 算法 動作 李飛飛 機(jī)器人 上下文 scaling

相關(guān)資訊

凡本網(wǎng)注明“XXX(非現(xiàn)代青年網(wǎng))提供”的作品,均轉(zhuǎn)載自其它媒體,轉(zhuǎn)載目的在于傳遞更多信息,并不代表本網(wǎng)贊同其觀點(diǎn)和其真實(shí)性負(fù)責(zé)。

特別關(guān)注

熱文推薦

焦點(diǎn)資訊