我的頻道

* 拖拉類別可自訂排序
恢復預設 確定
設定
快訊

9月底前完成三項簡單財務檢視 一年可省數千元

哈利王子返英想拍攝「黛妃電影」?傳威廉感到強烈挫折

鋼鐵飛人破紀錄 卻端不好一杯水?

聽新聞
test
0:00 /0:00
老年服務機器人正在進行端水杯演示。(新華社)
老年服務機器人正在進行端水杯演示。(新華社)

AI重點

文章重點整理:

  • 重點一:人形機器人可破運動紀錄,卻在靈巧操作上明顯落後。
  • 重點二:VLA模型泛化能力不足,真機數據成為後訓練關鍵。
  • 重點三:世界模型被視為新方向,但預訓練成本高且路線未收斂。

前言:能破人類紀錄的「鋼鐵飛人」,卻可能端不好一杯水,這種體格與「大腦」的嚴重錯位,是當下人形機器人行業最尷尬的縮影。但AI競賽的下一階段,能率先將智能能力大規模部署到數以百萬計機器之上的才是贏家。 

在北京舉行的第二屆世界人形機器人運動會上,機器人在400米賽跑及跳高項目屢屢寫下超越人類選手的世界紀錄。但隔壁的靈巧手專項賽現場,機器人做積木搭建、鑷子夾豆等「指尖微操」甚至未必穩得過學齡前兒童。運動會組委會委員鞏瀟坦言,預賽中不少機器人遇到物體材質、軟硬度或擺放角度的細微變化,自主決策仍可能出現偏差,面對真實物理世界的不確定性,是目前技術攻關的核心難點,「卡」住的恰是最核心的「大腦」之困。

第二屆世界人形機器人運動會田徑100米決賽中,天驍隊(右1)的人形機器人在100...
第二屆世界人形機器人運動會田徑100米決賽中,天驍隊(右1)的人形機器人在100米小型組的決賽中衝線。(新華社)

Demo困境 泛化能力不足

據中國新聞周刊報導,近期的世界機器人大會(WRC)現場,一位負責人形機器人後訓練的工程師說,一些人形機器人「幹活」的Demo,往往只是在特定場景執行單一任務,一般只需要幾百條數據微調,但從Demo到真實場景應用還存在巨大的鴻溝,是因為具身模型的泛化能力不足。

「泛化能力就是機器人今天只學習抓起蘋果,明天就能抓起梨,而不是只有學過才會做。」北京人形機器人創新中心(下稱「北京人形」)具身智能部負責人鞠笑竹說。崑崙行機器人聯合創始人兼CTO郎咸朋以機器人拿起杯子為例,訓練時機器人只見過空杯子,那麼它是否能成功拿起裝滿水的杯子,這就是對泛化能力非常直觀的一個檢驗。

人形機器人正學習給杯子倒水。 (中新社)
人形機器人正學習給杯子倒水。 (中新社)
人形機器人進行開窗訓練。(新華社)
人形機器人進行開窗訓練。(新華社)

人形機器人每次面對新的任務、場景都需要重新學習,這在很大程度上被認為受困於具身模型當前的技術路線。在具身智能領域,VLA模型(視覺—語言—動作模型)2023年興起;2025年,國內的銀河通用、智平方、自變量等企業均對外發布VLA模型,希望最終實現執行任意任務的能力。

「2025年初,大家發現VLA模型泛化能力並沒有那麼好。」鞠笑竹認為,限制VLA模型泛化能力的一個關鍵因素在於數據。「VLA模型無法使用大量視頻數據訓練,更多依賴真機採集數據,很難上量。」

國內企業對於具身模型的真正投入都比較有限。「多數具身模型其實就是兩類來源,要麼是很小的數據量套用開源框架簡單訓練而來,要麼就是直接微調開源模型而來。」自變量CEO王潛表示。

場景任務 狂「卷」後訓練

當前具身模型在部署到具體場景時都需要後訓練,這也是國內人形機器人企業在跳過模型預訓練,更多「卷」後訓練的原因。鞠笑竹認為,針對具體場景和任務,基於VLA進行後訓練,對於基礎模型能力的提升意義有限,更多只是在拚落地能力與交付。

一款搭載具身大模型的機器人進行整理家務訓練(下圖)。(新華社)
一款搭載具身大模型的機器人進行整理家務訓練(下圖)。(新華社)
一款搭載具身大模型的機器人在AI原點社區內的一處真實場景試驗室進行播放唱片訓練。...
一款搭載具身大模型的機器人在AI原點社區內的一處真實場景試驗室進行播放唱片訓練。(新華社)
人形機器人進行整理家務訓練。(新華社)
人形機器人進行整理家務訓練。(新華社)

「目前來看,機器人面對具體場景和任務的表現,在數據上的差異相比模型上的差異能產生更大影響,特別是真機數據,使用1萬小時的真機數據訓練出的模型,可能比用10萬小時模擬數據訓練出的效果更好。」優必選副總裁、具身智能與人形機器人研究院院長焦繼超說。

「隨著數據積累,一旦突破某個點之後人形機器人能力的提升就會變得非常快。」焦繼超坦言,如果人形機器人面對從未見過的快件,可能很難完成分揀,但是如果只是快件尺寸、顏色發生變化,人形機器人能展現出一定的泛化能力,並非一定需要「見過」。

「像搬運這樣的場景會在今年或明年實現真正規模化落地,下一步會轉向一些輕便靈巧類的任務,比如擰螺絲,以及一些長程任務。其實客戶更關注機器人在工作場景中的表現,對成功率的關注高於效率。」焦繼超說。

在具身模型能力有限的情況下,通過「卷」後訓練落地具體場景,更多是商業化的權宜之計。

現況堪比10年前的智駕

今年以來,自變量、智元等公司相繼發布世界模型。朗咸朋是智駕領域VLA路線的擁護者,坦言具身智能需要「新故事」,主題就是世界模型。世界模型之所以讓人興奮,便在於其展現的泛化能力。

在浙江杭州機器人學校,機器人正練習叠衣服。 (中新社)
在浙江杭州機器人學校,機器人正練習叠衣服。 (中新社)

宇樹科技人形機器人於2026年世界機器人大會期間表演集體舞。(路透)
宇樹科技人形機器人於2026年世界機器人大會期間表演集體舞。(路透)

「當前針對單一場景任務,基於VLA模型再進行後訓練,確實能獲得更好效果,世界模型生成的動作在精度上還沒有達到VLA模型的水平。」郎咸朋做出這樣的類比,世界模型與VLA模型的差距有一些像智能駕駛是否依賴高精度地圖的區別,如果依賴高精度地圖,每到一座新的城市,就需要從採集數據做起。

「其實世界模型也分為不同的路線,比如國內比較火熱的路線是基於現有視頻生成模型的世界模型。」儘管鞠笑竹認為,它可能並非未來具身模型的終極答案,但是仍對其在泛化性上的表現感到興奮。

不過,一旦涉及基礎模型,特別是世界模型預訓練,對機器人企業算力、數據、人才和資金等資源方面的壓力都比較大。宇樹科技上市後,模型研發成為最大的單一募投方向。但因技術尚未收斂,沒人敢押注特定模型路線。

具身智能公司联合創始人兼CTO郎咸朋將當前具身智能所處的階段類比於10年前的智能駕駛,當時智駕領域也是Demo很多,但是技術並未收斂。「未來具身模型的範式可能還會經歷迭代,迭代可能導致之前的努力白費,但讓機器人理解物理規律一定是方向。」

精華 FAQ

  • 因為目前機器人的運動能力與精細操作能力嚴重失衡。它們在跑步、跳高等單一動作上表現亮眼,但遇到材質、角度、重量等細微變化時,決策與控制仍容易失準。

  • 因為VLA等模型的泛化能力仍有限,且無法像其他AI那樣大量使用視頻數據訓練,主要仰賴真機數據。業界因此先針對單一場景做後訓練,以提高交付與落地成功率。

  • 世界模型被看好,是因為它更強調對物理規律與場景變化的理解,泛化潛力較大。不過它需要更多算力、數據、人才與資金,且技術路線尚未收斂,短期內仍難成為統一答案。

人形機器人

上一則

黃之鋒承認串謀勾結外國勢力罪 最高可判終身監禁

下一則

香港兩名12歲滑板小將首征日本亞運會 開心緊張但無懼

超人氣

更多 >