创建提醒
向我发送相似的招聘

强化学习算法工程师

Premium Full-time
强化学习算法工程师
上海
校招
正式
技术族 - 算法类
职位 ID:A151195
职位描述
1. 参与面向机器人智能体的强化学习算法研发,提升 Agent 在导览、导购、接待、问答、任务执行等场景中的决策能力和任务完成率。 2. 研究强化学习、离线强化学习、偏好学习、模仿学习、Reward Model、LLM Agent 训练与优化等方法在真实业务场景中的应用。 3. 基于机器人交互日志、用户反馈、任务 Trace、对话 Session、人工标注数据等,构建 Agent 训练与评测数据集。 4. 设计智能体行为策略优化方案,包括工具调用策略、任务规划策略、多轮对话策略、异常恢复策略、打断处理策略和主动服务策略等。 5. 参与 Agent 评测体系建设,设计任务成功率、用户满意度、响应质量、工具调用正确率、上下文保持能力、安全合规性等指标。 6. 构建 Agent 仿真与回放环境,支持在上线前对不同 Agent 版本、Prompt、Workflow、模型和策略进行离线评测与回归验证。 7. 参与 Reward 设计与自动化打分机制建设,包括规则打分、LLM Judge、人工反馈、用户行为反馈等多种信号融合。 8. 跟踪 Agent RL、RLHF、RLAIF、DPO、GRPO、Agent Learning、Self-Play、Tool-use Learning 等前沿方向,并进行原型验证和业务落地。 9. 与智能体平台、交互云、数据闭环、产品和业务团队协作,推动 Agent 从“可配置”走向“可评测、可优化、可持续进化”。
职位要求
1. 计算机、人工智能、软件工程、自动化、数学、统计学等相关专业,硕士及以上优先,优秀本科生也可。 2. 熟悉机器学习和深度学习基础,了解强化学习基本概念,如状态、动作、奖励、策略、价值函数、探索与利用等。 3. 熟悉至少一种强化学习或智能体优化方法,如 PPO、DQN、SAC、离线强化学习、模仿学习、RLHF、DPO、Reward Model 等。 4. 熟悉 Python,掌握 PyTorch、TensorFlow、JAX 等至少一种深度学习框架。 5. 具备良好的工程实现能力,能够完成数据处理、模型训练、实验评估、结果分析和迭代优化。 6. 对 LLM、Agent、RAG、Tool Calling、Workflow、多轮对话、Prompt Engineering 等方向有兴趣或项目经验。 7. 了解 LLM Agent 评测、对话评测、自动化打分、LLM Judge、A/B Test、数据闭环等方向者优先。8. 具备较强的数学基础、实验设计能力、问题抽象能力和快速学习能力。9. 对机器人、具身智能、AI Agent、智能体平台有兴趣,愿意把算法应用到真实复杂场景中。
投递

More from 智元创新(上海)科技有限公司
智元创新(上海)科技有限公司 3 hours ago
智元创新(上海)科技有限公司 3 hours ago
智元创新(上海)科技有限公司 4 days ago