R—01 / LEARNING OBJECTIVE
风险敏感的策略学习
不只优化平均奖励,而是研究奖励分布的不同区域如何改变探索、稳定性与困难 样本上的学习信号。重点关注风险度量、可验证反馈和策略优化之间的联系。
- Risk measures
- Policy optimization
- Verifiable feedback
01 Research Profile
研究智能系统如何在不确定性与现实约束下学习和决策。
02 Research Threads
这些不是互不相关的项目标签。它们都在处理同一个问题:如何把不确定性、 约束和证据边界真正写进学习与决策过程。
R—01 / LEARNING OBJECTIVE
不只优化平均奖励,而是研究奖励分布的不同区域如何改变探索、稳定性与困难 样本上的学习信号。重点关注风险度量、可验证反馈和策略优化之间的联系。
R—02 / DISTRIBUTION SHIFT
使用生成模型描述未来不确定性,再用强化学习求解带尾部风险的动态决策。 更关心样本外失效、真实路径检验和决策约束,而不是只报告模拟环境中的高分。
R—03 / HUMAN OVERSIGHT
当 AI 在不同任务上的可靠性未知且差异明显时,研究如何把稀缺的人类判断 投向最需要校准的位置,同时保留基础人工程序、审计能力和最终责任。
03 Notes & Tools
将研究中反复使用的机制、公式和估算过程拆开说明。内容只保留可以公开、 可以复核的部分,不把论文或项目材料原样搬到网页。
04 Current Practice
Formulate
Evaluate
Govern
05 About
我的工作横跨机器学习与管理科学:既关心模型如何训练,也关心目标函数、 数据生成过程、组织约束和人工判断如何共同决定结果。这个网站用于公开机制 笔记、可复核的小工具,以及不涉及敏感材料的研究方法总结。
本站为非商业个人学习与研究记录。未公开论文、受限数据、合作方材料和未经 复核的实验结果不在这里展示。