課程形式
線上
課程名稱
NAPAI計畫-SIGRobot#6-Learning and Planning to Act in a Physical World (780)
課程編號
780
課程期間
2026-06-11 ~
老師
柯宗瑋 (助理教授 / 國立臺灣大學)
課程類別
AI人工智慧
時數
3 (小時)
修課人數
0
標籤
機器人運動規劃, 動作規劃, 行為學習, 模仿學習, 強化學習, 視覺語言動作模型, VLA模型, 馬可夫決策過程, RRT演算法, Sim-to-Real
簡介

  1. Learning and Planning to Act in a Physical World

本課程由國立臺灣大學資訊工程學系柯仲偉老師主講,專為欲掌握機器人實體世界行動規劃的學習者設計。前半段將系統化梳理傳統運動規劃演進,從網格搜尋與組態空間(Configuration Space)出發,剖析機率路徑圖法(PRM)與隨機樹(RRT/RRT*)等演算法原理,並探討其在未知動態環境中過度依賴感測器與地圖的運算瓶頸。

後半段則轉向前沿的機器學習範式,從馬可夫決策過程(MDP)出發,探討「視覺-語言-動作模型(VLA)」與擴散策略如何將指令端到端轉化為機器人動作。課程將剖析模仿學習因「複合誤差」脫軌的痛點,並解構 PPO、GRPO 等強化學習(RL)機制,說明如何透過自主試錯克服數據瓶頸並提升泛化能力,引導學員掌握建構通用機器人的核心技術。

更多資訊--
5b88a4da55cc1f1e365357e39e7104d1.png

報名資訊    
報名期間
開始: 2026-09-15
總人數限制
無限制
其他資訊
承辦人
林瑞雅 / 網路學習科技研究所碩士班
葉家綸 / 土木工程學系
張珀瑞 / 土木工程學系
開課單位
教學發展中心
課程 QR code
https://ncuxms.ncu.edu.tw/course/780
課程教材
  1. 1.
    機器人動作規劃與行為學習演進
    本段落系統化梳理機器人在實體世界運行與執行動作的核心技術演進,探討如何擺脫早期「手刻規則」的物理限制,轉向現代智慧感知與學習路徑。課程首先回顧傳統的規劃方法,深入剖析基於演算法(如 RRT* 演算法)的運動規劃與控制原理,並探討其在動態未知環境中,因極度依賴感測器精準度與環境地圖重建,所面臨的運算瓶頸與系統脆弱性。接著,課程聚焦於近年蓬勃發展的機器學習方法,詳細解析現代機器人如何運用行為複製(Behavior Cloning)、模仿學習(Imitation Learning)與強化學習(Reinforcement Learning)等技術,直接透過高維度的任務指令與環境感知,端到端(End-to-End)地預測運動軌跡與低階馬達控制(Low-Level Controller)。最後,本章節將對比傳統規劃與機器學習兩大範式的優缺點,說明如何透過兩者的融合與互補,來克服單純依賴海量數據或死板規則的瓶頸,為建構具備高度適應力的通用機器人奠定扎實基礎。
  2. 2.
    視覺-語言-動作模型(VLA)與適應性學習策略
    本段落深入探討現代通用機器人如何結合學習方法來執行複雜任務,並聚焦於模仿學習(Imitation Learning)與強化學習(Reinforcement Learning)兩大範式的實務應用。課程詳細解析了具備前沿架構的「視覺-語言-動作模型(Vision-Language-Action, VLA)」,如 OpenVLA 模型,說明其如何將高維度的環境觀察(Observation)與多模態指令直接轉化為機器人的具體行動。針對 OpenVLA 在面對全新、未曾見過的未知環境時可能出現的適應力瓶頸,課程系統化對比了兩種主流的優化路徑:一端是利用行為示範進行微調的模仿學習(如監督式微調 SFT),另一端則是近期非常火熱的研究領域——利用強化學習(RL)在模擬或真實環境中進行自主試錯與交互,藉此大幅增強 VLA 模型的泛化與環境適應能力,為建構高彈性的智慧機器人系統提供核心策略。
  3. 3.
    馬可夫決策過程與強化學習基本概念
    本段落深入淺出地解析強化學習(Reinforcement Learning)的核心底層邏輯與運作機制。課程首先將複雜的數學模型進行直觀的簡化,重點介紹馬可夫決策過程(MDP)的核心四要素:狀態(State)、動作(Action)、狀態轉移機率(Transition Probability)以及獎勵函數(Reward Function),引導學員理解智慧代理人(Agent)如何與環境進行動態交互。接著,課程系統化對比了「模仿學習」與「強化學習」的本質差異,詳細剖析模仿學習因極度依賴人類專家展示(Demonstration),在面對未曾見過的未知狀態時,容易因「複合誤差(Compounding Error)」導致機器人完全脫軌的瓶頸。最後,本章節著重探討強化學習如何透過讓機器人在虛擬環境中自主試錯、累積獎勵回饋來克服此痛點,並深入思辨「手刻獎勵函數」與傳統「監督式學習(Supervised Learning)」在定義上的落差與學術界觀點,為後續進階的機器人策略訓練奠定扎實的理論基石。