Skip to content

學習、獎勵與信用分配

志強做出正確行為後,最好在接近當下的時間說出固定標記詞。這個「半秒左右」不是志強的記憶上限,而是為了讓牠更容易判斷:究竟是哪一個剛發生的動作得到回饋。

時間拖得越久,中間可能又出現抬頭、走動、坐下、看人或舔嘴,獎勵就可能被錯誤歸到其他行為。

這個問題可以抽象成:

最後出現一個結果時,學習系統要如何判斷前面哪一個行為真正應該得到功勞或責任?

在強化學習中,這通常稱為信用分配問題

以尿墊訓練為例,如果志強只是踩上尿墊就得到零食,牠可能學會:

踩上尿墊,就能得到獎勵。

但人真正想教的是:

在尿墊上完成排尿,才是正確結果。

因此,局部行為可以用來引導或降低難度,但主要獎勵必須鎖定真正目標。否則系統可能把代理指標最佳化,卻沒有完成原本任務。

套用到 AI:

  • 每完成一個中間步驟就給分,可以讓學習更快。
  • 中間指標設計錯誤,AI 可能只追求容易拿到的分數。
  • 只在最後給一次分數,目標較純粹,但系統較難知道是哪一步造成成功或失敗。

AI 在完成整段任務後得到一個總分,不代表它已經像人類一樣理解整條因果鏈。

最簡單的強化方式可能只是讓整段成功軌跡更容易再次出現。更進一步的系統,才會估計每一步如何改變最終成功機率,或利用回放、世界模型與反事實測試重新分配功勞。

因此需要區分:

  1. 整段行為得到高分:知道這條路結果不錯。
  2. 價值訊號往前傳遞:估計哪些狀態較可能通往成功。
  3. 過程監督:判斷某一步是否符合已知規則。
  4. 因果分析:判斷某一步是否真正改變結果。
  5. 反事實驗證:改掉那一步後,結果是否真的不同。

可以成立的類比是:

  • 回饋出現太晚時,行為與結果的對應會變得模糊。
  • 中間獎勵可能加速學習,也可能讓系統學偏。
  • 最終獎勵可以守住真正目標,但需要更好的信用分配機制。
  • 情境中的連續小回饋,可以把很長的任務串成可學習的行為鏈。

狗的學習受到神經系統、演化、情緒、氣味、身體狀態和社會互動影響;AI 的獎勵傳遞方式則由資料、模型結構與演算法決定。

所以「志強需要即時標記」不代表 AI 也只能使用相同時間尺度;真正相似的是抽象問題:結果如何正確歸因到先前的行為。

較好的智慧系統不應只依賴一種回饋,而應同時具備:

  • 快速的局部檢查
  • 可重複使用的階段技能
  • 不可被代理指標取代的最終驗證
  • 任務完成後的回放與重新歸因
  • 必要時用干預或反事實測試驗證因果

相關的志強訓練原理可參考:狗怎麼學與訓練時機