创建提醒
向我发送相似的招聘

云端训推优化负责人

Premium Full-time CUDA PyTorch AI Kernel Python
云端训推优化负责人
北京、深圳
全职
智能制造 / 工业互联网 / 工业自动化
职位描述
负责云端训练与推理优化团队整体建设和管理,对模型训推效率负责;负责大模型、VLM / VLA、机器人模型等训练任务的性能优化,包括:训练吞吐、GPU 利用率、Tensor Core 利用率、显存利用率、多机多卡扩展效率负责分布式训练优化,包括 Data Parallel、Tensor Parallel、Pipeline Parallel、FSDP / ZeRO 等方案设计与落地;负责模型推理优化,包括算子优化、KV Cache、Batching、量化、并行推理及服务化性能优化;针对模型结构和训练流程进行 Profiling,定位通信、计算、显存、IO 等性能瓶颈,并推动系统性优化;负责训练/推理框架和基础组件建设,沉淀可复用的性能优化能力;与模型算法团队协作,在保证模型效果的前提下优化模型结构、训练策略和推理方案;与智算平台团队协作,提升 GPU 集群整体资源利用率,降低单位训练与推理成本;建立训推性能指标体系和 Benchmark,持续跟踪不同模型、硬件和框架下的性能表现。
职位要求
5 年以上深度学习系统、训练加速、推理优化、AI Infra 或相关工作经验,有团队管理经验;熟悉 PyTorch 及主流深度学习训练框架,理解计算图、Autograd、CUDA 执行模型;熟悉大规模分布式训练,有 NCCL、FSDP、DeepSpeed、Megatron-LM 等实际优化经验;对 GPU 架构和性能优化有深入理解,熟悉 CUDA、Tensor Core、显存层级、算子执行机制;熟悉模型性能 Profiling,能够使用 Nsight Systems / Compute、PyTorch Profiler 等工具定位性能问题;熟悉常见推理优化技术,包括 TensorRT、vLLM、量化、算子融合、Continuous Batching 等;具备较强的软件工程和系统设计能力,熟悉 Python / C++,有 CUDA 开发能力优先;有较强的问题定位能力,能够从模型、框架、算子、通信和硬件多个层面分析性能瓶颈。加分项:有千卡级或更大规模 GPU 集群训练优化经验;有 VLM、VLA、多模态、Diffusion、机器人模型相关训推优化经验;有自研 CUDA Kernel、Triton Kernel 或算子库经验;熟悉 FlashAttention、Transformer Engine、FP8 / INT8 / INT4 等低精度训练与推理技术;有 TensorRT-LLM、SGLang、vLLM 等推理框架深度优化经验;有从 0 到 1 建设训练/推理性能团队或 AI Infra 团队经验。
投递
相似的工作