Create Alert
Email me similar jobs

视频生成算法工程师 (强化学习)

Premium Full-time Rewriting Diffusion Hacking
视频生成算法工程师 (强化学习)
北京、上海、深圳
全职
研发 - 算法
职位描述
负责视频生成模型的后训练算法,基于 reward model、人工偏好和自动评测信号,提升模型在文本对齐、审美、动态、稳定性和用户满意度上的综合表现:1. 设计视频生成后训练流程,包括 SFT、DPO、diffusion RL 等。2. 基于多维 RM 构建训练 reward,优化文本-视频对齐、运动质量、美感、主体一致性和崩坏率。3. 探索 reward hacking 防御、多 reward balance、online/offline preference data mixing。4. 支持 recaption model RL,探索基于 benchmark 或 RM 的 prompt rewriting 优化。5. 与 RM / 评测团队协作,构建可用于训练的高质量 preference 数据。6. 分析后训练带来的能力提升和副作用,推动稳定迭代。
职位要求
1. 熟悉 DPO、GRPO、NFT等经典 LLM / diffusion 后训练算法。2. 有 LLM / diffusion 后训练、多模态 RL 经验优先。3. 对 reward design、数据偏差、评测污染、reward hacking 有较深理解。4. 能独立设计实验,并从复杂 case 中归因问题来源。
投递