學習、獎勵與信用分配
從半秒標記開始
Section titled “從半秒標記開始”志強做出正確行為後,最好在接近當下的時間說出固定標記詞。這個「半秒左右」不是志強的記憶上限,而是為了讓牠更容易判斷:究竟是哪一個剛發生的動作得到回饋。
時間拖得越久,中間可能又出現抬頭、走動、坐下、看人或舔嘴,獎勵就可能被錯誤歸到其他行為。
這個問題可以抽象成:
最後出現一個結果時,學習系統要如何判斷前面哪一個行為真正應該得到功勞或責任?
在強化學習中,這通常稱為信用分配問題。
局部回饋與最終目標
Section titled “局部回饋與最終目標”以尿墊訓練為例,如果志強只是踩上尿墊就得到零食,牠可能學會:
踩上尿墊,就能得到獎勵。
但人真正想教的是:
在尿墊上完成排尿,才是正確結果。
因此,局部行為可以用來引導或降低難度,但主要獎勵必須鎖定真正目標。否則系統可能把代理指標最佳化,卻沒有完成原本任務。
套用到 AI:
- 每完成一個中間步驟就給分,可以讓學習更快。
- 中間指標設計錯誤,AI 可能只追求容易拿到的分數。
- 只在最後給一次分數,目標較純粹,但系統較難知道是哪一步造成成功或失敗。
結果獎勵不等於因果理解
Section titled “結果獎勵不等於因果理解”AI 在完成整段任務後得到一個總分,不代表它已經像人類一樣理解整條因果鏈。
最簡單的強化方式可能只是讓整段成功軌跡更容易再次出現。更進一步的系統,才會估計每一步如何改變最終成功機率,或利用回放、世界模型與反事實測試重新分配功勞。
因此需要區分:
- 整段行為得到高分:知道這條路結果不錯。
- 價值訊號往前傳遞:估計哪些狀態較可能通往成功。
- 過程監督:判斷某一步是否符合已知規則。
- 因果分析:判斷某一步是否真正改變結果。
- 反事實驗證:改掉那一步後,結果是否真的不同。
動物學習與 AI 的共同抽象問題
Section titled “動物學習與 AI 的共同抽象問題”可以成立的類比是:
- 回饋出現太晚時,行為與結果的對應會變得模糊。
- 中間獎勵可能加速學習,也可能讓系統學偏。
- 最終獎勵可以守住真正目標,但需要更好的信用分配機制。
- 情境中的連續小回饋,可以把很長的任務串成可學習的行為鏈。
狗的學習受到神經系統、演化、情緒、氣味、身體狀態和社會互動影響;AI 的獎勵傳遞方式則由資料、模型結構與演算法決定。
所以「志強需要即時標記」不代表 AI 也只能使用相同時間尺度;真正相似的是抽象問題:結果如何正確歸因到先前的行為。
較好的智慧系統不應只依賴一種回饋,而應同時具備:
- 快速的局部檢查
- 可重複使用的階段技能
- 不可被代理指標取代的最終驗證
- 任務完成後的回放與重新歸因
- 必要時用干預或反事實測試驗證因果
相關的志強訓練原理可參考:狗怎麼學與訓練時機。