智猩猩AI整理 编辑:六六 美国加州大学伯克利分校(UC Berkeley)博士后 顾尚定近日入职了上海交通大学计算机学院,担任长聘教轨副教授。 他还入选了国家级青年人才计划,并与上海人工智能实验室安全中心双聘。 2024 年,顾尚定在德国慕尼黑工业大学拿到计算机科学博士学位;随即赴 UC Berkeley 从事博士后研究,与 Dawn Song、Costas Spanos 两位教授合作,研究安全智能决策及其在工业场景中的应用。 从慕尼黑到伯克利再到上海,他的研究主线没怎么变过:怎么让智能系统在开放、动态、甚至危险的现实环境里,既足够聪明,又不会闯祸。 他系统地研究了强化学习中性能和安全约束之间的权衡: 想让 Agent 跑得快,就得担风险;想让它绝对安全,性能就掉下来。 围绕这个矛盾,他做了一系列工作:一篇关于安全强化学习的综述发表在了 IEEE TPAMI 上,该成果引用量达到了 1000+;AAAI 2024 Oral 的工作从梯度操控角度处理奖励与安全的权衡,NeurIPS 2024 的工作则用样本操控提升数据效率。 他还提出了 Robust-Gymnasium(ICLR 2025),一个覆盖状态、动作、奖励和环境动力学四类扰动的统一鲁棒强化学习基准 ,塞进六十多个单机器人和多机器人任务。这一工作把“鲁棒性”从一个形容词,变成了可以跑分的东西。 近两年顾尚定的重心明显从单点算法往系统层面扩展。他开始思考 Agent 的规模效应,围绕 Agentic AI 的系统扩展、多智能体规模化、模型数据效率以及真实世界自主系统开展研究。 比如他发表的《From Model Scaling to System Scaling》,讨论的就是 Agentic AI 中 Harness 的扩展问题。此外他参与提出的 Agentic Web 被 IEEE Spectrum 和《经济学人》报道过。 在 RSI 这一前沿方向上,顾尚定也有所参与。近日由 MIT-IBM Watson AI Lab 与 Amazon A-EVO Lab 联合华盛顿大学、伯克利等机构发布的 OpenRSI-Index v0.1 上线,该项目把真实开源项目变成 AI Agent 的“自动科研场”,让 Agent 长时间自主实验,检验其能否迭代出超过人类方案的新方法。他作为项目团队成员参与了相关工作。 顾尚定的研究并没有局限在AI领域,他参与的用强化学习操控分子扩散模型做药物设计的论文被 Science Advances 接收;此前他还在泛林集团分享了 Agentic AI 用于半导体制造的主题演讲。 在研究以外值得一提的是,他 2022 年底发起的 Safe RL 在线研讨会一直办到了现在,每月至少请一位讲者;此外,他牵头了 IEEE TASE 特刊“基础模型时代具身智能体自动控制的可信 AI”;今年还受邀担任 NeurIPS 2026 Area Chair。 如今入职上海交通大学,他的研究继续聚焦在 安全可信的 AI Agent,具身智能与机器人学习,以及面向真实世界的智能决策 (半导体制造、自动化系统、AI4S)这三个方向。 关注+星标,获取AI前沿进展与开源一线动态 特别