偏好學習 RLHF vs 純模仿學習:機器人該從示範裡學,還是從人類的比較評分裡學
2026-09-11
「做給我看」跟「哪一個比較好」,是兩種不同的教學方式
教機器人學會一項技能,除了本站在模仿學習 vs 強化學習一文中討論過的直接示範(模仿學習)與試錯探索(強化學習)兩種主要範式,還存在第三種訓練訊號的來源——RLHF(Reinforcement Learning from Human Feedback,從人類回饋強化學習),核心邏輯不是讓人類示範正確動作,而是讓人類針對機器人產生的多個候選動作,指出哪一個比較好,再用這種相對偏好判斷訓練出獎勵模型,指導後續的強化學習。
為什麼「比較」比「示範」更容易提供某些類型的訓練訊號
模仿學習需要人類提供明確的正確動作示範,但有些任務品質差異是「難以示範、卻容易比較」的——判斷「這次抓取動作比上次更穩、更符合期待的流暢度」這類細膩的品質差異,人類很難直接示範出一個絕對意義上的完美動作,卻能相對輕易地在兩個候選動作之間指出哪一個比較好。RLHF 正是利用這種認知特性上的落差,透過蒐集大量人類對候選動作的相對偏好判斷,訓練出一個獎勵模型,再用這個學習出來的獎勵模型指導強化學習訓練——這種訓練訊號的性質,補足了純模仿學習示範資料難以直接提供的一塊拼圖。
額外的複雜度代價:獎勵模型可能學錯評分標準
引入獎勵模型也帶來額外的失敗環節——如果訓練獎勵模型的人類偏好資料涵蓋不夠多樣,或存在系統性偏誤,獎勵模型可能學到跟真正期望行為不完全一致的評分標準,導致後續強化學習訓練出來的策略去迎合獎勵模型的評分漏洞,而非真正符合人類期望的行為,這種現象在大型語言模型的 RLHF 訓練領域已經被稱為獎勵模型錯位(reward hacking),機器人領域套用同樣方法論時同樣需要正視這個風險。這也是為什麼多數實務應用把 RLHF 當作在模仿學習暖啟動基礎上的進一步微調手段——先用模仿學習建立一個行為模式相對合理的初始策略,再用 RLHF 做細膩的品質微調,而不是從頭就完全依賴獎勵模型指導訓練。
機器人領域的獨特挑戰:連續動作空間讓人類評分更困難
機器人 RLHF 面臨一項語言模型訓練不需要處理的額外挑戰——機器人的動作空間是連續的物理量,而非語言模型的離散 token 空間,這讓候選動作之間的差異更難被人類評分者直覺地判斷與比較,尤其涉及本站在運動學奇異點、全身控制等文章討論過的多自由度協調動作時,人類很難單純從觀察畫面就準確判斷「哪一組關節角度組合更合理」。這種評分難度的提升,某種程度上限制了機器人 RLHF 訓練能蒐集到的偏好資料規模與品質,也是為什麼機器人領域的 RLHF 應用目前仍集中在相對容易人工評分的整體任務品質判斷(動作流暢度、任務完成度),距離語言模型 RLHF 已經大規模應用在生產流程的成熟度仍有落差。
三種訓練範式的關係:互補,而非互相取代
模仿學習、強化學習與 RLHF 這三種訓練範式,不是互相競爭的技術路線,而是分別擅長提供不同性質訓練訊號的互補工具——模仿學習擅長讓策略快速獲得基本任務能力,強化學習擅長讓策略在明確定義的獎勵目標下持續優化超越示範水準,RLHF 則擅長把難以直接示範、但容易相對比較的細膩品質偏好,轉化成可用於訓練的訊號。多數走在技術前沿的機器人學習專案,正逐漸把這三種範式組合成一套完整的多階段訓練流程,而非只採用單一種方法解決所有訓練需求。
- rlhf
- imitation-learning
- preference-learning
- reward-model
- robot-learning