Create Alert
Email me similar jobs

大模型训练框架工程师-2027届

Premium Full-time MOE
大模型训练框架工程师-2027届
北京、上海
校招
正式
研发 - 算法
职位描述
训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。你会参与:- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。
职位要求
基本要求:- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;- 能够独立定位系统问题,提出可落地的优化方案并推动实施;- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。加分项:- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;- 有千卡/万卡规模训练系统经验;- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。
投递