创建提醒
向我发送相似的招聘

软件工程师 - 大模型端侧优化和部署

Premium Full-time CUDA Profiling Linux AI
软件工程师 - 大模型端侧优化和部署
北京、广州、上海
全职
职位描述
负责将大模型部署到自动驾驶车端芯片平台(NVIDIA Orin / Thor 等),并进行极致的性能、内存与能效优化。你将在算力、内存、功耗与实时性严格受限、且对安全与稳定性要求极高的车载环境下,打通从推理引擎定制、核心算子优化到车端运行时管理的全栈链路,推动大模型在自动驾驶(端到端决策、场景理解等)场景的规模化落地。岗位职责1. 适配、移植与深度优化车端推理引擎/运行时(TensorRT-LLM、TensorRT Edge-LLM、vLLM、SGLang 等),通过计算图优化、算子融合、高性能 CUDA 算子开发及 KV Cache、投机采样等优化,充分发挥 Orin / Thor 平台算力,满足实时性要求;2. 建立 Benchmark 与 Profiling 体系,跟踪首字延迟(TTFT)、吞吐、内存峰值、冷启动、模型切换、cache 命中率、长稳与抖动等车端核心指标。支持场景理解、Function Calling、结构化输出、流式输出、多模态推理等核心场景的低延迟落地;
职位要求
1. 计算机、电子工程、人工智能、自动化等相关专业,本科及以上学历;2. 具备 2 年以上 AI 推理部署、端侧AI、系统性能优化或模型工程化相关经验;3. 精通 C/C++ 与 Python,具备扎实的计算机体系结构知识,熟悉 Linux 下的开发与调试;4. 深入理解 Transformer / LLM / VLM 推理机制,熟悉 prefill、decode、KV Cache、attention、batching、streaming 等关键概念;5. 精通至少一种推理框架(TensorRT-LLM / vLLM / SGLang / ONNX Runtime 等),具备引擎定制、算子开发或 graph 优化经验;6. 精通大模型核心算子(Attention、FFN/MoE、LayerNorm/RMSNorm)的底层实现与性能优化方法;加分项1. 有 Qwen 等主流开源大模型的部署经验;2. 有在 NVIDIA Orin / Thor 等车端平台部署大模型的经验(熟悉 TensorRT Edge-LLM 等工具链,了解 Orin 支持 FP16/INT8/INT4、Thor 支持 FP8/NVFP4 等平台特性差异);3. 有自动驾驶大模型量产落地经验,有端到端自动驾驶大模型或多模态大模型部署优化经验。
投递