创建提醒
向我发送相似的招聘

多模态数据算法工程师 (音频)

Premium Full-time Python
多模态数据算法工程师 (音频)
北京
全职
互联网 / 电子 / 网游
职位描述
1、负责构建超大规模高质量视听觉多模态中的音频数据集,建立从原始音视频抓取、多音轨分离、降噪清洗、质量评估到自动化标注的全链路工业化流水线;2、实施支持语音识别(ASR)、方言识别、情绪分析、背景音乐(BGM)与环境音(Event)识别的专项音频数据工程,通过自动化手段生产高精度对齐、跨语种/方言、多情感色彩的配对与描述数据;3、研发高性能音频数据处理与特征提取工具链,利用前沿语音/音频大模型与信号处理算法,实现视频中语音转写、声学特征、语义理解及大规模声纹库检索的精准解析,确保持续产出高质量训练样本;4、建立音频数据质量监控与闭环体系,通过量化指标(如 WER、分类准确率、声纹召回率等)驱动数据集的迭代更新,支撑音视频生成及多模态大模型在真实工业场景下的效果落地。
职位要求
1、具备深厚的音频信号处理(DSP)与大规模音频数据工程经验,熟练掌握音频降噪、去混响、语音活动检测(VAD)、音视频对齐及自动化标注技术;2、精通 ASR(语音识别)、方言识别、情感计算(Emotion Recognition)、音频分类(Audio Tagging)及声纹识别(Speaker Verification) 等核心算法模型的部署与应用,熟悉大规模声纹库检索与向量检索技术;3、扎实的编程功底与大规模数据处理能力,熟练掌握 Python 及 Kaldi、PyTorch、Librosa、Torchaudio 等主流音频/深度学习框架,具备处理海量音频非结构化数据及维护高性能分布式数据流水线的实战经验;4、极强的工业化落地能力,目标导向,善于将复杂的音视频业务需求拆解为可执行的数据与算法方案,并具备快速迭代和交付的能力;5、熟悉主流音频生成(如 Vocoder、TTS、AudioLDM 等)或音视频多模态联合建模技术架构,能够根据模型反馈精准调整音频数据生产策略者优先。
投递