创建提醒
向我发送相似的招聘

高可用架构师

Premium Full-time AI
高可用架构师
北京、上海
社招
全职
研发 - 基础架构
职位描述
一、一句话定位负责建设面向大模型训练、推理及 Agent 在线业务的公司级稳定性治理体系与高可用架构能力,让核心系统可预防、可观测、可恢复、可持续演进。二、为什么这个岗位重要大模型训练、推理和 Agent 业务具有资源密集、链路长、依赖复杂、流量波动大等特点。训练任务中断、推理服务不可用、工具调用失败或上下游依赖异常,都会直接影响模型研发效率、产品体验和业务连续性。随着 GPU 集群、模型服务、Agent 编排和在线业务规模增长,稳定性不能只依赖人工响应。我们需要通过架构设计、平台能力和治理机制,系统性识别风险、隔离故障、快速恢复,并持续提升核心业务的可靠性。 你将以公司全局视角,指导训练、推理、平台和业务团队建设高可用能力,沉淀适用于模型业务的稳定性标准、工具和方法论。三、你将负责什么1. 负责公司级稳定性体系规划与建设,包括稳定性目标、SLO/SLI、技术标准、治理流程、度量指标和持续改进机制。2. 指导训练、推理、Agent 及核心在线业务进行高可用架构设计与演进,覆盖多活容灾、故障隔离、流量调度、限流降级、熔断、弹性伸缩等能力。3. 建设训推链路的风险识别、容量规划、压测验证、应急预案、故障演练和复盘治理机制。4. 推动 GPU 集群、分布式训练、推理服务及关键基础设施的稳定性治理,提升资源供给、任务执行和服务交付的可靠性。6. 主导重大稳定性问题的架构诊断与技术攻坚,推动跨团队完成止损、定位、恢复和长期治理闭环。7. 建立架构评审、变更防护、稳定性验收和重大活动保障机制,降低变更和发布带来的系统风险。8. 沉淀高可用架构方案、稳定性规范、最佳实践和工具平台,为各技术团队提供架构指导。
职位要求
我们期望你具备1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。2. 具备 5 年及以上后端、平台、基础设施或架构相关经验,有大型互联网业务稳定性或高可用架构建设经验。3. 有多机房、多地域容灾或多活架构实践经验,理解流量治理、限流降级、熔断、隔离、容灾切换等核心机制。4. 有稳定性体系建设经验,能够推动 SLO/SLI、容量管理、压测、故障演练、应急响应及复盘治理落地。5. 具备较强的系统性思考、跨团队协作和技术推动能力,能够将复杂问题沉淀为标准、工具和平台能力。6. 有 Owner 意识,能在重大故障和关键业务保障场景中承担技术责任并推动闭环。加分项- 有大模型训练、推理、在线模型服务或 AI 平台的稳定性与高可用架构经验。- 有 Agent 或多 Agent 系统稳定性实践,包括任务编排、工具调用、长链路执行、异步任务、外部依赖治理、重试幂等、降级与恢复机制。- 主导过高并发、大规模用户或关键核心业务的高可用架构设计与演进。- 建设过可观测性、容量压测、混沌工程、故障演练或稳定性治理平台。
投递