01 Research Profile

Rui Tao Artificial Intelligence × Decision Science

研究智能系统如何在不确定性与现实约束下学习和决策。

Decision FrontierRisk / Return
风险收益决策前沿 横轴表示平均表现,纵轴表示尾部稳健性。蓝色曲线连接不被其他方案同时超越的 Pareto 有效策略,实心蓝点表示在最低稳健性约束下选择的折中方案。 minimum tail robustness Pareto frontier selected policy Tail robustness Expected performance →
横轴为平均表现,纵轴为尾部稳健性;蓝线是 Pareto 前沿,蓝点是在最低稳健性 约束下的折中选择。

02 Research Threads

正在推进的三条线索

这些不是互不相关的项目标签。它们都在处理同一个问题:如何把不确定性、 约束和证据边界真正写进学习与决策过程。

R—01 / LEARNING OBJECTIVE

风险敏感的策略学习

不只优化平均奖励,而是研究奖励分布的不同区域如何改变探索、稳定性与困难 样本上的学习信号。重点关注风险度量、可验证反馈和策略优化之间的联系。

  • Risk measures
  • Policy optimization
  • Verifiable feedback

R—02 / DISTRIBUTION SHIFT

分布偏移下的序贯决策

使用生成模型描述未来不确定性,再用强化学习求解带尾部风险的动态决策。 更关心样本外失效、真实路径检验和决策约束,而不是只报告模拟环境中的高分。

  • Generative scenarios
  • CVaR
  • Backtesting

R—03 / HUMAN OVERSIGHT

人机协同与复核分配

当 AI 在不同任务上的可靠性未知且差异明显时,研究如何把稀缺的人类判断 投向最需要校准的位置,同时保留基础人工程序、审计能力和最终责任。

  • Adaptive allocation
  • Uncertainty
  • Human-in-the-loop

03 Notes & Tools

公开笔记与本地工具

将研究中反复使用的机制、公式和估算过程拆开说明。内容只保留可以公开、 可以复核的部分,不把论文或项目材料原样搬到网页。

04 Current Practice

我如何判断一项结果是否可信

Formulate

先确认真正优化的目标,而不是从算法名称反推问题

Evaluate

把生成场景表现、样本外检验与真实路径结果分开报告

Govern

在高风险应用中保留人工复核、权限边界与可追溯证据

05 About

比模型得分更重要的,
是它支持了什么决策。

我的工作横跨机器学习与管理科学:既关心模型如何训练,也关心目标函数、 数据生成过程、组织约束和人工判断如何共同决定结果。这个网站用于公开机制 笔记、可复核的小工具,以及不涉及敏感材料的研究方法总结。

本站为非商业个人学习与研究记录。未公开论文、受限数据、合作方材料和未经 复核的实验结果不在这里展示。