创建提醒
向我发送相似的招聘

大模型评测测试工程师

Premium Full-time AI
大模型评测测试工程师
北京
全职
智能制造 / 工业互联网 / 工业自动化
职位描述
【岗位职责】1. 负责 AI 眼镜语言、语音、视觉及 Agent 能力的整体评测工作,建立覆盖模型选型、产品准入、版本验收和线上复盘的评测体系。2. 结合 AI 眼镜真实使用场景,定义核心评测维度、指标体系和测试标准,包括准确性、任务完成率、响应速度、稳定性、幻觉、安全性、弱网表现、功耗与成本等。3. 分方向建设专项评测能力: - 语言:意图理解、知识问答、指令遵循、上下文理解与生成质量; - 语音:唤醒、ASR、TTS、打断、远场、噪声及多人环境表现; - 视觉:拍照问答、OCR、物体与场景理解、视频理解及多模态推理; - Agent:工具调用、任务规划、状态管理、异常恢复及端到端任务完成率。4. 建设与维护具有代表性的评测数据集、场景库、Bad Case 库和回归测试集,确保评测结果能够反映真实产品体验。5. 负责不同模型、不同技术方案及不同版本的横向评测,形成清晰、可信的分析结论,为模型选型、上线决策和迭代优先级提供依据。6. 推动自动化评测平台和数据闭环建设,完善人工评测、模型评测、端到端测试和线上数据监控相结合的评测机制。7. 与算法、产品、软件、硬件、测试及数据团队密切协作,定位模型问题,推动问题修复并验证优化效果。8. 持续跟踪大模型、多模态、语音、Agent 及 AI 硬件行业进展,将新的模型能力、评测方法和行业标准转化为团队可落地的实践。9. 负责评测团队的工作规划、任务拆解和人才培养,对评测结论的准确性、客观性和交付质量负责。
职位要求
【任职要求】1. 本科及以上学历,计算机、人工智能、语言学、信号处理、自动化或相关专业优先。2. 具备 5 年及以上 AI、算法测试、模型评测、AI 产品或相关工作经验,有评测体系从 0 到 1 建设经验。3. 至少深入理解大语言模型、语音、多模态视觉或 Agent 中的两个方向,并能够快速建立对其他方向的判断能力。4. 能够将模糊的产品体验问题转化为可衡量的评测指标、测试任务和版本准入标准。5. 熟悉人工评测、自动化评测、LLM-as-a-Judge、A/B 测试、统计分析及 Bad Case 归因等常见方法,理解其适用边界。6. 具备较强的数据分析和技术理解能力,能够使用 Python、SQL 或相关工具完成数据处理、评测和结果分析。7. 具备较强的逻辑思维、沟通表达和跨团队推动能力,能够对复杂问题形成明确判断并推动落地。8. 有较强的责任心和结果意识,能够在模型能力快速变化、标准尚不完善的情况下持续推进工作。
投递