Skip to content

開放問題與後續假說

這一頁保存目前仍不能確定的問題。這些內容不是既定結論,而是後續討論、閱讀或實驗可以繼續追蹤的方向。

  • 任務長度、環境不確定性與獎勵稀疏程度,達到什麼條件時,系統才需要更昂貴的回放與重新歸因?
  • 中間獎勵應由人類設計、由模型學習,還是由兩者共同調整?
  • 如何讓中間評分器協助學習,又不成為可被模型利用的新代理目標?
  • 最終獎勵要如何有效傳回早期決策,而不把整段軌跡一律視為同樣重要?
  • 智能體如何可靠區分「某一步與成功同時出現」和「某一步真正造成成功」?
  • 世界模型中的反事實推演,準確到什麼程度才值得信任?
  • 在無法重跑真實環境的任務中,哪些替代證據足以支撐因果判斷?
  • 動物在睡眠或休息時的經驗重播,與 AI 的 replay buffer、軌跡回放或離線訓練,在功能層級上可以比較到什麼程度?
  • 狗因馴化而更依賴人類,能否為人機協作型智能體提供有效類比,還是只是一個容易誤導的故事?
  • 狼與狗的能力專門化,是否能幫助我們設計不同類型的 AI,而不是用單一基準衡量所有智能?
  • 志強在房間學會的規則不會自動完整套用到客廳;AI 的跨情境泛化有哪些真正相似之處?
  • 要如何判斷一個系統已經學到抽象規則,而不是只記住表面線索?
  • 情境變化到什麼程度時,應該重新訓練、加入示範,或只需要少量提示?

每次新增問題時,應盡量連回一個具體志強案例或動物行為觀察。若問題後來得到較可靠答案,應移到對應主題知識頁或設計原則,並在此保留簡短的解決紀錄。