
演讲嘉宾俞扬南京大学人工智能学院教授所属大会2026 奇点智能技术大会 · 北京对奇点智能大会2026的完整技术议题感兴趣可前往奇点大会官方渠道免费获取PPT详细资料。一、引言从 AlphaGo 到真实世界的决策智能2016 年AlphaGo 击败李世石让全世界见识了强化学习Reinforcement Learning, RL的强大威力。然而从游戏 AI 到真实世界的自主决策之间隔着一条巨大的鸿沟真实世界没有重置按钮每一次试错都可能带来真实的成本和风险。南京大学人工智能学院教授俞扬是国内强化学习领域的顶尖学者。他的研究聚焦于离线强化学习Offline RL和真实世界决策致力于让 AI 在无法随意试错的环境中也能做出最优决策。本次大会他将分享从游戏 AI 到真实世界决策智能的技术演进与最新突破。二、强化学习的核心范式2.1 基础框架强化学习的核心是一个智能体Agent与环境Environment的交互过程# 强化学习基础框架classReinforcementLearning:def__init__(self,env,agent):self.envenv self.agentagentdeftrain(self,num_episodes):训练智能体forepisodeinrange(num_episodes):stateself.env.reset()episode_reward0whileTrue:# 选择动作actionself.agent.select_action(state)# 执行动作next_state,reward,done,infoself.env.step(action)# 存储经验self.agent.store_experience(state,action,reward,next_state,done)# 更新策略self.agent.update()episode_rewardreward statenext_stateifdone:breakprint(fEpisode{episode}: Reward {episode_reward})2.2 从在线到离线范式转变传统强化学习是在线学习——智能体通过与环境实时交互来学习。这在游戏等虚拟环境中可行但在真实世界中往往不可行对比维度在线 RL离线 RL交互方式实时环境交互使用历史数据试错成本可接受虚拟环境不可接受真实世界数据获取自主探索已有数据集主要挑战样本效率分布偏移典型应用游戏、仿真医疗、自动驾驶、推荐# 离线强化学习框架classOfflineRL:def__init__(self,dataset,agent):self.datasetdataset# 历史经验数据集self.agentagentdeftrain(self,num_epochs):使用离线数据训练forepochinrange(num_epochs):# 从数据集中采样批次batchself.dataset.sample(batch_size256)# 更新策略不与环境交互lossself.agent.update_offline(batch)# 评估在验证集上ifepoch%1000:eval_rewardself.evaluate()print(fEpoch{epoch}: Loss {loss:.4f}, Eval Reward {eval_reward:.2f})defevaluate(self):在验证集上评估策略# 使用重要性采样或模型评估pass三、离线强化学习的核心挑战3.1 分布偏移问题离线 RL 面临的最大挑战是分布偏移Distribution Shift训练数据来自旧策略而新策略可能访问数据分布之外的状态-动作对。# 分布偏移问题示意classDistributionShift:def__init__(self,behavior_policy,target_policy):self.behavior_policybehavior_policy# 生成数据的策略self.target_policytarget_policy# 要学习的策略defillustrate_shift(self,states):展示分布偏移behavior_actionsself.behavior_policy.sample(states)target_actionsself.target_policy.sample(states)# 计算动作分布的差异shift_magnitudetorch.norm(target_actions-behavior_actions,dim1).mean()ifshift_magnitudethreshold:print(f警告分布偏移严重 ({shift_magnitude:.2f}))print(目标策略可能访问数据分布之外的状态)returnshift_magnitude3.2 主要技术路线俞扬团队总结了离线 RL 的三大技术路线路线核心思想代表算法优势局限策略约束限制新策略与旧策略的距离BCQ、BEAR稳定、安全保守、性能上限低值函数正则对 OOD 动作进行悲观估计CQL、IQL理论保证强实现复杂模型学习学习环境模型在模型中规划MOPO、MOReL可泛化模型误差累积# Conservative Q-Learning (CQL) 核心逻辑classCQL:def__init__(self,q_network,policy_network):self.q_networkq_network self.policy_networkpolicy_networkdefcompute_loss(self,batch):CQL 损失 标准 Bellman 误差 保守性正则项states,actions,rewards,next_states,donesbatch# 标准 Bellman 误差q_valuesself.q_network(states,actions)withtorch.no_grad():next_actionsself.policy_network(next_states)next_qself.q_network(next_states,next_actions)target_qrewardsgamma*next_q*(1-dones)bellman_lossF.mse_loss(q_values,target_q)# 保守性正则项降低数据集外动作的 Q 值dataset_qself.q_network(states,actions)# 采样所有可能的动作random_actionstorch.uniform(-1,1,actions.shape)policy_actionsself.policy_network(states)random_qself.q_network(states,random_actions)policy_qself.q_network(states,policy_actions)conservative_loss(torch.logsumexp(torch.cat([random_q,policy_q],dim0),dim0)-dataset_q.mean())total_lossbellman_lossalpha*conservative_lossreturntotal_loss四、世界模型从数据中学习环境4.1 世界模型的价值世界模型World Model是离线 RL 的重要补充——它从离线数据中学习环境的动力学允许智能体在想象中进行规划和探索classWorldModelBasedRL:def__init__(self,world_model,policy):self.world_modelworld_model self.policypolicydefplan_in_imagination(self,initial_state,horizon50):在世界模型中进行规划best_trajectoryNonebest_reward-float(inf)# 蒙特卡洛树搜索MCTSforsimulationinrange(num_simulations):stateinitial_state trajectory[]total_reward0forstepinrange(horizon):actionself.policy.sample(state)# 在世界模型中模拟next_state,rewardself.world_model.predict(state,action)trajectory.append((state,action,reward))total_rewardreward statenext_stateiftotal_rewardbest_reward:best_rewardtotal_reward best_trajectorytrajectoryreturnbest_trajectory4.2 世界模型的学习classWorldModel:def__init__(self,state_dim,action_dim,hidden_dim256):self.transition_modelnn.Sequential(nn.Linear(state_dimaction_dim,hidden_dim),nn.ReLU(),nn.Linear(hidden_dim,hidden_dim),nn.ReLU(),nn.Linear(hidden_dim,state_dim))self.reward_modelnn.Sequential(nn.Linear(state_dimaction_dim,hidden_dim),nn.ReLU(),nn.Linear(hidden_dim,1))self.done_modelnn.Sequential(nn.Linear(state_dimaction_dim,hidden_dim),nn.ReLU(),nn.Linear(hidden_dim,1),nn.Sigmoid())defpredict(self,state,action):预测下一状态、奖励和是否结束satorch.cat([state,action],dim-1)next_statestateself.transition_model(sa)# 残差预测rewardself.reward_model(sa)doneself.done_model(sa)returnnext_state,reward,donedeftrain(self,dataset):从离线数据中学习世界模型optimizertorch.optim.Adam(self.parameters(),lr1e-3)forbatchindataset:states,actions,rewards,next_states,donesbatch# 预测pred_next,pred_rewards,pred_donesself.predict(states,actions)# 损失transition_lossF.mse_loss(pred_next,next_states)reward_lossF.mse_loss(pred_rewards,rewards)done_lossF.binary_cross_entropy(pred_dones,dones)losstransition_lossreward_lossdone_loss optimizer.zero_grad()loss.backward()optimizer.step()五、Sim-to-Real从仿真到真实世界5.1 Sim-to-Real 的核心挑战从仿真到真实世界的迁移面临现实鸿沟Reality Gap差异来源仿真环境真实世界影响动力学简化模型复杂物理控制策略失效感知完美传感器噪声、遮挡状态估计错误延迟可忽略显著控制不稳定摩擦恒定时变运动精度下降外观程序化多样化视觉策略泛化差5.2 域随机化与适配classSimToReal:def__init__(self):self.domain_randomizerDomainRandomizer()self.adaptation_moduleAdaptationModule()deftrain_with_randomization(self,env,policy):使用域随机化训练forepisodeinrange(num_episodes):# 随机化环境参数randomized_envself.domain_randomizer.randomize(env)# 训练trajectoryself.collect_trajectory(randomized_env,policy)policy.update(trajectory)defadapt_to_real(self,real_data,policy):使用真实数据适配策略# 系统辨识real_dynamicsself.system_identification(real_data)# 微调策略adapted_policyself.adaptation_module.adapt(policy,real_dynamics)returnadapted_policyclassDomainRandomizer:defrandomize(self,env):随机化环境参数env.set_friction(np.random.uniform(0.3,1.2))env.set_mass_scale(np.random.uniform(0.8,1.2))env.set_gravity(np.random.uniform(9.0,10.0))env.set_latency_ms(np.random.uniform(0,50))# 视觉随机化env.set_lighting(intensitynp.random.uniform(0.5,1.5),color_tempnp.random.uniform(3000,7000))returnenv六、真实世界应用案例6.1 自动驾驶决策离线 RL 在自动驾驶中的应用行为克隆从人类驾驶数据中学习基本驾驶策略安全增强使用离线 RL 优化安全性避免危险行为场景泛化通过世界模型在罕见场景中训练6.2 推荐系统优化classRLForRecommendation:def__init__(self):self.user_modelUserModel()self.item_modelItemModel()self.policyRecommendationPolicy()defrecommend(self,user_id,context,top_k10):基于强化学习的推荐# 用户状态表征user_stateself.user_model.encode(user_id,context)# 候选物品表征candidate_itemsself.item_model.get_candidates()# 策略选择scoresself.policy.score(user_state,candidate_items)# 探索 vs 利用ifnp.random.random()epsilon:# 探索随机选择selectednp.random.choice(len(candidate_items),top_k)else:# 利用选择最高分的selectednp.argsort(scores)[-top_k:]return[candidate_items[i]foriinselected]6.3 医疗决策支持离线 RL 在医疗领域的特殊价值治疗方案优化基于历史患者数据优化治疗策略药物剂量调整个性化药物剂量推荐手术规划辅助手术决策和路径规划重要约束医疗应用需要严格的临床试验验证离线 RL 提供的是决策支持而非替代医生判断。七、未来方向7.1 技术趋势俞扬教授对强化学习未来发展的判断大规模离线 RL利用互联网规模的数据训练通用决策模型多任务迁移学习跨任务的通用决策能力人类反馈集成将 RLHF 扩展到更广泛的决策场景安全保证发展具有理论安全保证的 RL 算法7.2 从决策智能到通用智能决策智能是通向通用人工智能的重要路径规划能力长程规划和战略思维适应能力快速适应新环境和新任务学习能力从有限经验中高效学习协作能力与其他智能体包括人类协作八、总结俞扬教授的分享将展示强化学习从游戏到真实世界的技术跨越。离线强化学习、世界模型、Sim-to-Real 迁移——这些技术的融合正在开启自主决策的新时代。2026 年 11 月奇点智能技术大会与俞扬一起探索决策智能的边界。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店参会报名https://boolan.com/enroll/c1051/event/1162?channelseo立即报名了解强化学习与决策智能的前沿进展