大模型算法工程师
上海
实习
数字技术
职位 ID:A219421
职位描述
1.研究与实现端到端智能辅助驾驶规划算法,聚焦 Diffusion-based Trajectory Generation 与 Reinforcement Learning;2.复现前沿论文(如 Diffusion Policy、Flow-GRPO、DriveDPO 等),探索 生成式模型与强化学习(RL) 方法融合;3.参与闭环实验,分析模型在不同驾驶场景(交互、避障、合流、车道保持等)下的表现;4.优化训练与推理流程,包括 采样效率、策略一致性、reward建模与policy微调 等;5.协助构建或清洗规划相关数据集,用于Diffusion与RL任务。
职位要求
1.熟悉 PyTorch,具备良好的代码工程能力;2.理解 Diffusion Models(DDPM/DDIM/SDE/ODE) 与 强化学习(RL/IL/IRL) 的基本原理;3.有端到端 planner、行为克隆(BC) 或 强化学习策略优化 实践经验者优先;4.具备较强的论文理解、实验复现与算法实现能力;5.逻辑清晰、自驱力强,对智能辅助驾驶和智能决策方向有浓厚兴趣。加分项:1.有使用 CARLA、nuPlan、Waymo Open Motion 或内部仿真平台 的经验;2.有 Diffusion Policy / DriveDPO / IRL-VLA / Hydra-MDP / DriveLM 等论文复现或对比实验经验;3.熟悉 闭环评测、reward shaping、policy fine-tuning、RLHF 或 preference learning 等方法;4.在顶会(CVPR/ICLR/CoRL/NeurIPS等)论文阅读或发表经验者优先
投递
Similar jobs