實體AI的關鍵拼圖:世界模型驅動機器人大腦升級

免費
字數 5302
頁數 8
出版作者 林研詩
出版單位 工研院產科國際所
出版日期 2026/09/24
出版類型 產業評析
所屬領域 半導體
瀏覽次數 29
加入購物車 直接下載 直接下載 加入最愛

一、AI機器人大腦開發三要素:模型、資料、算力

實體AI (Physical AI)或稱物理AI,為AI能思會動,裝上身體後的代名詞,亦被視為是一種具身智慧(Embodied AI)的表現,廣義涵蓋機器人、無人機、自駕車…等智慧載具,被科技產業公認為是繼代理型AI發展的下一波技術浪潮。

最受矚目的實體AI項目之一為人形機器人(Humanoid Robot),集尖端科技於一身,可望成為解決人類未來大缺工時代的生產力利器,近期2026世足賽在巴西與挪威比賽中,人形機器人Atlas精準遞球給裁判的直播亦成為話題。相較之下,雖然傳統機器人已經發展一段時間,動作與肢體的技能(以小腦功能比喻)成熟,但目前商業化產品最令人詬病的是,機器人可以依照程式語法設定任務,從路徑A點移動到B點,但遇到任務以外的突發狀況即失能,無法像人的大腦可自主判斷處理。為了解決上述問題,業界正努力從三個關鍵要素進行技術突破,為機器人大腦升級做準備,1.算法面-多樣化模型開發、2.資料面-蒐集實作資料與搭配模型訓練策略、3.算力面-雲地算力協同運用,創造成本與效率最佳化等方式並進,如下圖1所示。

 

資料來源:工研院產科國際所 ITIS研究團隊(2026/09)

圖1 機器人大腦能力建構三要素

 

下文將重點介紹與說明具備推演未知情境能力的世界模型,如何讓機器像人類的心智模型一樣具備思考、預測、規劃與創造能力,成為打造機器人大腦想像力工程的關鍵拼圖。

 

二、世界模型演進與實體AI的交會-打造即時推演未知情境的能力

當前AI業界所提到的世界模型(World Models)一詞並無一致的說法,各領域如電腦視覺、機器人、強化學習、生成式 AI 都在推進各自的世界模型,因此與其拘泥在明確的定義上,不如將世界模型理解為存在於一系列能力之上。與大語言模型(LLM)不同的是,LLM以自然語言為溝通基礎,改變了人與電腦的互動方式;世界模型則是協助實體AI實現機器與物理世界互動的方式。深度學習與電腦視覺領域先驅李飛飛近期發表〈 A Functional Taxonomy of World Models〉將世界模型分成三類,包括1.渲染器(Renderer)、2.模擬器(Simulator)、3.規劃器(Planner),可分別類比為畫家、科學家以及規劃家。畫家畫出「觀看者會看到什麼」,而非「實際是什麼」。科學家負責回答「世界如何運作」,強調幾何、物理、一致性與可互動狀態。規劃家則負責回答「機器人下一步該怎麼做?」 並負責各類機器人決策系統,例如手指取物要用多大力、下一步該往哪裡移動。

學術界則常用三個維度描述世界模型的能力:1.功能(如決策耦合、通用模擬器):評估模型是否能將模擬推演與動作決策、2.時間(序列模擬推斷、全局差異預測):衡量模型在時間序列上的推演能力,包含理解因果關係並預測狀態隨著時間推移(全局)的動態變化與差異、3.空間(潛在空間語義特徵、顯式幾何/神經場):檢視模型如何編碼與表徵三維空間,例如透過壓縮高維感測數據(潛在變數)或是直接建構顯式的物體幾何、神經輻射場(NeRF)等結構。以下介紹世界模型演進的重要歷程:

 

(一)世界模型(World Models)逾三十年演進-讓機器人從「看懂」世界到「想懂」因果關係

世界模型(World Models)的演進,主要經歷了四波發展歷程,其技術核心是表徵學習架構的升級與多模態資料規模的成長:

 

1. 第一波(1990 - 2018年):早期模型奠基與強化學習

早在1990年代,學者就已經嘗試讓AI建立環境模型,並在模型中進行策略練習。而2018年David Ha 和Jürgen Schmidhuber在論文〈世界模型〉中提出讓 AI以神經網路在虛擬賽車遊戲Car Racing與第一人稱射擊遊戲VizDoom中,學習預測遊戲狀態與模擬執行最佳策略,即使用內部世界模型而非直接強化學習。此階段奠定環境動力學模型為實體AI提供虛擬「想像體驗」以優化策略的基礎,即是一套能夠學習預測和理解環境的系統。

 

2. 第二波(2019 - 2022年):潛在空間動力學與樣本效率突破

以 Dreamer 系列軟體為代表,機器人開始學會在潛在空間(Latent Space)中做夢。AI不需要把整個世界逐像素重建,而是可以把環境壓縮成較低維度的「潛在空間」。機器人可在一秒鐘內於夢境裡練習走路或抓取成千上萬次,大幅減少在真實世界試錯所需的時間與硬體損耗。

 

資料來源:工研院產科國際所 ITIS研究團隊(2026/09)

圖2 世界模型演進歷程與分類

 

3. 第三波(2022 - 2024年):聯合嵌入預測與非生成式表徵

深度學習領域的重要奠基者楊立昆提出聯合嵌入預測架構(JEPA),指出大腦在想像未來時,不需要像照片一樣畫出每一個背景細節。此架構,以預測重要的「物理常識」與抽象語義,取代昂貴的像素解碼大幅地提升計算速度與抗干擾能力。

 

4. 第四波(2025 - 2026年):通用基礎物理模擬器與世界動作模型融合

近年的發展藉由通用基礎物理模擬器與世界動作模型融合,重點的業者以及產品包括: Google Genie 3、Nvidia Cosmos 3等能夠生成高度逼真、可互動的超級虛擬地球模擬器。同時,業界將「環境預測」與「動作生成」深度一體化,催生世界動作模型(World Action Models, WAMs),讓機器人能在統一架構中協同處理物理世界演化預測與動作執行。

 

(二)世界模型成為實體AI落地的關鍵基石

目前多種世界模型走向正引領AI從單純的語言模仿,跨越至理解物理法則與空間屬性的「通用人工智慧」(AGI),成為驅動自駕車及機器人等實體AI發展的關鍵基石。列舉部份主流技術如下:

 

1. 主流一、影片生成型

代表案例如 OpenAI Sora、Google Genie 3互動式世界模型等,藉由讓生成式 AI 渲染出「能動起來的世界畫面」,隨時間演化甚至能與使用者即時互動。優點:視覺畫面直觀可見,易落地應用於內容產業(例如影視創作、遊戲開發),並符合縮放定律(Scaling Law),即資料越多效果呈指數級提升。缺點:並非真的瞭解物理世界運作的法則,模型僅畫出圖片像素的機率分佈,未真正建立 3D空間結構。例如雖然畫面會出現彈跳的球,但不瞭解彈跳球背後的動力學原理,甚至出現美觀卻不科學的物件穿模幻覺畫面。

 

2. 主流二、3D空間生成型

代表案例如李飛飛的World Labs Marble多模態世界模型:不追求畫面逼真,著重於把世界的「場景搭建」出來,理解物體的空間幾何關係與物理法則。優點:生成視覺畫面為人類顯而易見的結構,並且能直接與物理引擎結合,對機器人和自動駕駛等需要精確操作的領域特別重要。缺點:高質量的 3D 訓練資料稀缺、開發成本高昂,並且運算量遠大於 2D 模型。

 

3. 主流三、虛擬世界訓練型

代表案例如 Google SIMA,與Google Genie 3負責創造世界的任務不同,SIMA是被投放到生成的世界中作為虛擬訓練場,讓實體AI在遊戲等虛擬環境中不斷試錯、練級,最終將能力泛化遷移到真實世界,兩者創造「生成環境 + 自主學習」的循環。又例如Nvidia Cosmos的開源世界模型平台,則試圖成為實體AI完成任務的共同技術底層,既能產生合成資料,又可做策略評估,以及為機器人、自動駕駛提供虛擬訓練環境。優點:平台化的價值在於可把資料、模型、後訓練、標竿、部署工具做成一套可重複使用基礎架構。缺點:虛擬與現實落差(Sim-to-Real Gap),虛擬環境的物理規則(如摩擦力、重力、材質軟硬度)難以百分之百還原真實世界,AI 學到的技能在現實中可能失準。

 

4. 主流四、抽象結構預測型

代表案例如楊立昆(Yann LeCun)的 JEPA:讓 AI 直接在潛在空間(Latent Space),即一個低維度的資料空間,可用來捕捉和表示高維度資料,透過視覺與感測器等真實世界的資料訓練AI,使其具備「持久記憶」,學習真實世界的抽象因果結構與未來變化,甚至在採取行動前,先模擬多種可能的情境與後果,確保行動的安全與可靠性,減少算力應用於「畫細節(生成像素)」以發揮決策效益最大化。

楊立昆近期即以此模型創立AMI Labs公司,初期獲得高達 10.3 億美元的種子輪融資,並與數位健康新創 Nabla 合作開發世界模型臨床AI系統,致力將基於JEPA技術應用於不容出錯,重視決策效益的醫療領域中。其優點包括:運算成本低,更容易捕捉因果關係,具備強大的泛化能力;缺點則是因為是隱式的潛在空間,難以直接觀察驗證,且尚缺乏統一的評估標準。

 

資料來源:工研院產科國際所 ITIS研究團隊(2026/09)

圖3 世界模型擴增實體AI落地應用的能力

 

總體而言,世界模型協助實體AI掌握「物理直覺」,例如能理解球離桌會掉落、物體被遮擋依然存在等,並能根據結果預判和規劃後續行為。雖然模型多樣化發展,但都是建構實體AI落地應用的基石,解決空間理解、物理常識、模擬訓練、行動規劃、泛化遷移、安全互動…等問題,不同技術之間並非彼此互斥,而是可能逐步融合,成為未來真正可用的機器人大腦。

 

三、適配多元模型訓練機器人需克服資料與雲地算力挑戰

大語言模型(LLM)可以透過學習網路資料湧現能力,然而機器人需要的是涵蓋視覺、力覺/觸覺、關節位置、電機控制訊號等多維度感測資料,且必須時間戳同步(Timestamp Synchronization)、動作軌跡完整,才可作為模型訓練資料。這類型資料過去沒有被系統性地記錄,每一條高品質資料都必須重新產生,幾乎也不存在於網路上。因此為了克服機器人訓練資料的瓶頸,業界將資料的品質與取得成本的解方,排序出實機遠距操作、模擬合成資料、第一視角動作捕捉、網路影片混合而成的資料金字塔,如圖4所示。

 

資料來源:工研院產科國際所 ITIS研究團隊(2026/09)

圖4 世界模型依賴輸入高品質實作資料訓練機器人

 

因實作資料稀缺,近期業者透過訓練工廠與高值資料採集訓練機器人,案例如下:日本Telexistence公司,藉由VR遠距操作(Teleoperation)蒐集動作捕捉資料,直接導入至基礎模型進行訓練以實現實體AI完整管線流程(Pipeline)。該公司已與日本7-Eleven合作開發人形機器人「Astra」,預計2029年於門市導入,目前透過試點方式訓練無遠端介入的自主抓取裝袋能力,以累積實機資料。其他蒐集機器人動作捕捉資料訓練資料案例包括Apptronik Robot Park、Figure AI 與 Brookfield 合作蒐集住宅第一視角影片訓練 Helix 模型;智元機器人(Agibot)旗下的覓蜂科技數據採集工廠、戴盟機器人具身數據採集5S店、LG Electronics機器人資料工廠、印度新興產業-以穿戴裝置蒐集手部動作資料訓練機器人等…皆為近期業界因應機器人訓練資料稀缺所成立的新事業單位。

 

四、近期展會-ICRA 2026指出機器人資料、長尾情境、算力分工重要性

2026 年的 IEEE 國際機器人與自動化會議(ICRA 2026)於 2026 年 6 月 1 日至 5 日在奧地利維也納的 Messe Wien 圓滿落幕。本屆大會以「Robots for All」為主題,匯集近 9,000名產學研專家(較2025年的6,200人明顯成長),重點探討具身智慧等尖端技術在人形機器人、視覺-語言-動作模型(VLA)、世界動作模型(WAM)、強化學習、靈巧手、觸覺感知、虛實模擬(Sim-to-Real)、空間智慧(Spatial AI)、機器人專用模型與產業落地的解法。

整體趨勢顯示,機器人不再只是「自動化設備」,而是朝向在真實場域持續學習的「自主化實體AI」發展。多場工作坊與主題演講指向重點包括:1.機器人資料成為下一階段競爭焦點:因機器人資料不像文字或影像資料容易大量取得,具有高成本、低密度、難標註、強場域依賴等特性。因此,如何蒐集高價值示範資料、失敗資料、觸覺/力覺資料、真實場域資料,將決定機器人模型能否落地。2.長尾情境( Out of distribution, ODD)或需世界模型填補:例如自駕車多數意外都發生在訓練資料涵蓋不到的長尾情境,Tesla執行長Elon Musk曾表示需累積100億英里數據,FSD才能脫離監督式限制,顯示端到端(E2E)自駕模式的限制,導入世界模型後,有望讓車輛像人類一樣,在遇險前先進行模擬合成資料進行預測,提前迴避風險,而非以記憶資料反應。但目前真正的實體AI自駕尚未被實現以致於實機資料不易累積,此外世界模型運算規模過於龐大,如何壓縮後植入地端算力,業界仍在摸索。3. 算力分工-雲端要想得深,地端要反應快:因世界模型通常需要龐大運算資源,然而機器人真正在現場工作時,不能每個動作都等雲端算完再回應,走路、防跌倒、避障、抓取柔軟物體,都需要高速反應。因此,未來機器人大腦可能採用分層架構,雲端負責大規模訓練、合成資料生成、長期策略優化與模型更新;地端邊緣裝置負責即時感知、快速決策、安全控制與低延遲反應。

 

五、結論

(一) 世界模型將成為實體AI實現可部署、可泛化、可修正的關鍵中介層

世界模型將成為實體 AI 邁向可部署、可泛化、可持續修正的關鍵中介層,串聯資料、模擬、模型、控制與現場部署,成為實體 AI 技術體系的核心樞紐。透過世界模型,機器人得以從虛擬環境中的訓練與推演,進一步走入工業、物流、服務、照護與災害應變等真實場域,理解物體、人、空間與時間的動態變化,並據此進行預測、決策與行動。

要讓機器人具備近似人腦的物理直覺,真正做到「看得懂、想得清、做得對」,必須同步強化三項關鍵要素:資料面「質量並進」(Data as Food),兼顧資料規模、品質與多樣性;演算法面「多模並濟」(Multi-modal as Fusion),融合視覺、語言、動作與觸覺等多模態資訊;以及算力面「雲地並馳」(Edge as Fast),結合雲端訓練與邊緣即時推論,支撐機器人在複雜、動態且不可預期的真實世界中持續學習與可靠行動。

 

(二) 未來由AI模型決定競爭力

未來機器人產業的價值鏈將重新分配,機器人本體仍然重要,但真正拉開差距的會是AI模型競爭力,包括掌握高價值資料、提供模擬與訓練平台、把模型安全部署到工廠、倉庫、醫院與家庭、讓機器人在場域中持續學習等,透過可靠的世界模型,將讓具身智慧走出受控場域。這也會帶動邊緣AI晶片、機器人控制器、低功耗推論、模型壓縮、蒸餾與雲地協同平台的市場機會。未來勝出的不會只是最大模型,而是能在成本、功耗、延遲與可靠度之間取得最佳平衡的系統。

對我國產業而言,布局機會在於「必要但稀缺」的環節,例如高品質場域資料、機器人測試驗證、Sim-to-Real平台、邊緣AI模組、感測器與致動器整合、特定產業應用解決方案等。我國在半導體、ICT硬體、工業電腦與製造場域累積深厚,若能進一步結合世界模型與實體AI模型堆疊,將有機會從硬體供應者升級為實體AI系統整合與應用創新者。

上一篇全球彩妝品市場發展現況與趨勢
下一篇2026年AI PC發展動向
熱門點閱
推薦閱讀
推薦新聞

若有任何問題,可使用下方檢索互動介面找解答,或是寫信到客服信箱。

itismembers@iii.org.tw

星期一~五
9:00-12:30/13:30-18:00