李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

賈浩楠 發自 凹非寺

量子位 | 公眾號 QbitAI

嚯!這陣容論文,誰組的局?

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

李飛飛論文,ImageNet奠基人,美國三院院士;

Trevor Darrell論文,伯克利BAIR聯合創始人,他的Caffe深度學習框架曾是計算機視覺領域最廣泛使用的平臺之一;

Jitendra Malik論文,R-CNN的核心貢獻者之一,深刻影響了計算機視覺的發展軌跡,同樣美國三院院士;

Pieter Abbeel,深度強化學習先驅,伯克利機器人學習實驗室主任、BAIR實驗室聯合主任論文。ACM計算獎得主;

Ken Goldberg論文,機器人學泰斗,30年前就深耕機器人抓取和自動化,IEEE會士;

Jim Fan,英偉達GEAR實驗室掌舵者,具身智慧領域最受矚目的年輕學者之一論文

具身智慧學術圈,可能是第一次迎來如此全明星陣營論文

有模型的、算力的、本體的、資料的等等…..在各自細分賽道上如雷貫耳的big name們論文,齊聚具身智慧,但關注點嘛~一下就讓人好奇起來:

不是當下大熱的機器人通用大腦,而是——靈巧手論文

T-Rex從何而起論文,要解決什麼問題?

自動駕駛靠純視覺,是有可能解決問題的,但機器人,尤其是靈巧手卻很難論文

展開全文

這是一個直觀且淺顯的事實論文

手指、手掌進行精密複雜操作時,很難只用攝像頭記錄運動資料論文

360°無死角的影片資料量有多龐大暫且不說,首先機位就沒法佈置論文。不同任務類別,很難像自動駕駛那樣形成標準化資料集——模型泛化性受限。

自然而然,給模型加入觸覺這個資料模態,就成了一石三鳥的方法:感知精度更高、操作更精準細膩,以及可以形成較為標準的資料集論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

但反常識的事情出現了:

同樣的靈巧手、同樣的任務,T-Rex團隊把觸覺力訊號直接拼接到一個預訓練好的VLA模型裡,想給它“加點手感”——結果任務成功率從17%掉到了6%論文

觸覺不是想加就能加的,論文把原因拆成了三層論文

第一層,資料太貴論文

現有的大規模機器人資料集主要面向平行夾爪——兩根手指一捏一放,遙操作門檻低論文。但靈巧手有22個自由度,操作員要戴資料手套,每一個手勢都要精確對映到機械手上,還要保證視覺、觸覺、關節狀態嚴格對齊,目前靈巧手遙操作成本是平行夾爪的5到10倍。

第二層,頻率對不上論文。視覺模型處理一幀影像動輒幾百毫秒,只能跑到5到10Hz。但觸覺反應需要毫秒級,20Hz以上才能捕捉到“正在滑”和“已經滑了”的臨界點。

兩種訊號塞進同一個低頻Transformer,視覺來不及看,觸覺來不及反應論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

第三層,表徵太淺論文。很多方法把觸覺當成一個靜態的數字——“當前壓力5牛頓”。但觸覺本質是時序訊號:滑動、插入、按壓、搓動,每種接觸狀態都有力隨時間變化的獨特模式。

好,問題在這裡,先看看T-Rex團隊解決的怎麼樣論文

在12項真實世界的靈巧操作任務上,T-Rex平均成功率達到65%,比最強純視覺基線的35%高出了30個百分點論文

翻書頁96%對68%,開鎖70%對0%——純視覺方案在這個任務上完全被碾壓論文

消融實驗更直接:把T-Rex的觸覺輸入全部拿掉,成功率從65%掉到42%,降了23個百分點——12項任務裡超過三分之一的有效操作純靠“手感”撐著論文

資料效率也很驚人:僅給10條微調演示時,經過中期訓練的T-Rex能達到約40%成功率,沒經過中期訓練的模型直接歸零論文

這說明模型不是“背下了”資料,而是真正理解了“搓”“捏”“擰”這些動作的通用手感論文

一句話總結:視覺資料對靈巧手來說,本質上是不夠用的——觸覺不是錦上添花,而是必選項論文

誰先解決“觸覺怎麼加”的架構問題,誰就可能在靈巧手這個賽道上卡住位置論文

怎麼做到的論文

T-Rex的核心思路並不複雜——給觸覺單獨開一條高速通路,而不是讓它和視覺擠在同一條慢車道上論文

整體架構叫Mixture-of-Transformer-Experts,三個專家分工明確論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

Latent Expert處理視覺和語言,預測未來的視覺表徵,相當於給模型提供一個“接下來會發生什麼”的大局感論文

Action Expert做低頻動作規劃,引數量1.41B,是三個專家裡最大的那個,跑一次管一個動作塊論文

Tactile Expert做高頻觸覺精修,引數量只有0.62B,輕量到可以頻繁觸發論文

關鍵機制是Cascaded Flow Matching論文

擴散去噪通常需要10步才能從一團隨機噪聲變成一個乾淨的動作軌跡論文,而T-Rex在第4步處一切兩半:

前6步由Action Expert完成,生成一個“大方向對了但缺乏手感細節”的半成品;後4步由Tactile Expert接手,注入即時觸覺資料完成精修論文

為什麼是第4步?作者團隊透過實驗對比發現太早切,Action Expert去噪步數太少,繼承不了大規模人類影片預訓練獲得的先驗知識;太晚切,動作分佈已經定型,觸覺訊號進來也來不及修正了論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

第4步剛好處在“該有的形狀都有了,但細節還能改”的黃金位置論文

這就像寫文章:主編(Action Expert)定好大框架後就去忙別的了,四個編輯(Tactile Expert)在不同的節點上輪番檢查細節,不需要主編每次都回來重看一遍全文論文

觸覺訊號怎麼編碼是另一個關鍵設計論文

觸覺感測器有零點漂移和高頻噪聲,直接拿原始電壓值餵給模型,模型很可能把感測器噪聲當成接觸特徵學進去論文

T-Rex用VQ-VAE把過去16幀(約0.5秒)的力歷史壓縮成64個離散碼字論文。不同接觸狀態——按壓、插入、滑動——會被自動聚類到不同的碼字上。

這樣一來,感測器漂移被過濾掉了,觸覺訊號還變得可解釋——你能看到模型“理解”了什麼型別的接觸論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

兩個工程細節,第一個:讓碼本“活起來”論文。 VQ-VAE碼本,理訓練時經常出現“碼本坍塌”——大部分抽屜空著,少數幾個塞滿各種雜亂狀態。T-Rex的做法是定期檢查哪些抽屜閒置,主動塞點資料進去“啟用”它,確保所有碼字都被利用起來。

第二個,給“有手感”的時刻更高權重論文。 避免模型化90%的精力去學好“零接觸”這個最容易學的狀態,而忽略真正有價值的接觸瞬間。T-Rex給高力幀更高的學習權重,讓模型把算力集中在關鍵接觸點上。

論文正文不會寫、但做靈巧手工程化的人一看就懂論文

最後是訓練策略論文

T-Rex採用三階段訓練論文

先在大規模人類影片上預訓練(22,889小時)論文,讓模型看懂“人是怎麼動的”;

再用100小時遙運算元據做中期訓練,覆蓋207種物體和22種動作基元——目的是把人類影片裡的運動知識遷移到機器人本體上,而不是死磕某個具體任務論文

最後用約100條任務演示做後訓練,快速適配特定需求論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

其中最核心是中期訓練,解決了一個根本問題:人手抓杯子的方式和機械手抓杯子的方式不一樣,策略不一樣,受力反饋也不一樣論文。如果直接拿人類影片訓練出來的模型去操控機器人,它不知道怎麼把“看來的”轉化成“做出來的”。

中期訓練就是用100小時的遙運算元據,把這道鴻溝填上論文。它不是讓模型死磕某一個具體任務,而是讓模型接觸207種物體和22種動作基元的組合,理解“搓”這個動作在不同物體上應該怎麼執行、“捏”這個動作需要多大的力。

這就像一個人學完游泳理論後,在淺水區把蛙泳、自由泳、仰泳都練了一遍——不追求速度,只追求“會用”論文

有了這個基礎,最後階段只用100條任務演示就能快速適配——因為模型已經知道“手感”是什麼了,只需要知道“用在哪兒”論文

T-Rex的技術路線清晰指向一個判斷——視覺和觸覺在靈巧操作中不是主從關係,而是並行關係論文

它用一個非同步架構解決了頻率不匹配的底層矛盾,用一套時序編碼把漂移的感測器訊號變成了可解釋的離散詞彙,用一組基元組合的覆蓋策略替代了特定任務的深度堆疊論文

這三件事單看都不是“發明新數學”,但組合在一起,為靈巧手的觸覺利用提供了一套可複用的系統方案論文

靈巧手論文,存在一個“第一性原理”嗎?

靈巧手賽道眼下最熱鬧的爭論,集中在兩個地方:關節運動形式和自由度數量論文

腱繩還是連桿?絲槓還是齒輪?11個自由度夠用還是得幹到27個?不同廠商各執一詞,技術路線遠未收斂論文

這些爭論當然都有意義——傳動方案決定成本、可靠性和使用壽命,自由度決定靈巧程度的上限——但學術前沿的核心關注,不在這些問題中的任何一個上面論文

因為一個更深層的問題很少被討論:有了這些硬體論文,演算法能不能用好?

傳統大模型正規化幾乎以視覺資料為主,沒有針對觸覺模態的有效利用方案論文。T-Rex論文裡那個17%掉到6%的實驗,恰好說明了這一點——不是觸覺沒用,是現有多模態大模型架構消化不了觸覺。

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

T-Rex團隊的探索最大價值可能在這裡: 跳出硬體引數的爭論論文,回到一個更根本的問題——靈巧手做精細操作,到底需要什麼資料?

關節形式和自由度數量解決的是“能不能動”的問題,觸覺資料解決的是“能不能感知和反應”的問題,由此衍生出需要什麼樣的觸覺資料這個體系化問題,並給出了一個能泛化的方案論文

當然,T-Rex這項研究得以完成,一個關鍵前提是Sharpa Wave提供的硬體基礎——22個自由度、180Hz高頻觸覺訊號、穩定的感測器輸出論文

靈巧手的硬體天花板頂高了,T-Rex才得以在演算法層面去夠這個上限論文

反過來,T-Rex的演算法探索也給硬體提出了新要求:手掌區域需要觸覺感知,不同感測器的資料格式需要統一論文

T-Rex的軟體、SHARPA的硬體探索方向,後續可能會給這個細分領域帶來更深刻的變化論文

首先靈巧手可能從具身智慧本體中分化出來,成為一個獨立賽道——佔整機成本15%到20%,經濟上可行,技術上門檻也足夠高論文

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了

但如果觸覺資料成為核心壁壘,靈巧手就不僅僅是執行器,而是整個感知-決策-執行鏈條中資料價值最高的一環論文。誰掌握觸覺資料的採集能力和模型訓練能力,誰就掌握了議價權。

第二個變化,更多專用場景的具身應用可能被啟發論文。當前具身智慧的主流敘事是“通用”——一個模型解決所有任務。

但這個敘事在接觸密集型任務上遇到了困難,因為通用資料裡觸覺是缺失的論文。T-Rex則證明的是另一種可能性:在一個足夠具體的垂直場景裡,用專用的資料模態(觸覺)、專用的架構設計(非同步級聯)、專用的資料收集策略(基元×物體),可以取得比“通用”方案好得多的效果。

這條路徑如果走通,會啟發更多人去尋找類似的高價值專用場景論文

T-Rex的貢獻不是發明了“新數學”,而是把現有工具組合成一套可用的系統方案,試圖建立具身智慧觸覺資料統一的採集、訓練正規化,推動靈巧手真正scale up起來論文

專案地址論文

作者簡介

牛丹彤,UC Berkeley PhD Candidate,NVIDIA Gear Lab實習生,導師Trevor Darrell,主要從事具身靈巧手大模型的研究,曾以第一作者或共同第一作者身份在CVPR, ICML, ICLR等國際頂級會議上發表論文8篇,領導或主要貢獻T-Rex,EgoScale等工作,目前谷歌學術引用1100+論文

劉卓洋,北京大學元培學院本科生,導師仉尚航,目前在UC Berkeley訪問,導師Trevor Darrell,主要從事具身多模態推理大模型方向的研究,曾以第一作者或共同第一作者身份在ICML, ICLR, NeurIPS, ICRA等國際頂級會議上發表論文6篇,其他參與論文共計15篇,目前谷歌學術引用400餘次論文。曾獲2026商湯獎學金(全國30人),2025北京大學學術新星提名,北京大學元培學院年度科研獎勵,北京大學新生獎學金等。

Trevor Darrell教授,最廣為人知的成果是開發了Caffe深度學習庫論文。這個庫在深度學習領域具有重要的地位,為眾多的研究人員和開發者提供了便捷的工具,極大地推動了深度學習技術的發展。

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://amp.yxd-1688.com/post/58920.html

🌐 /