职位要求
具体岗位描述:
定义分析清洗ASRTTS训练测试数据;
开发高精度低延迟的端到端语音识别(ASR)系统,支持多语种多方言与个性化语音识别;
研发自然富有表现力的神经语音合成(TTS)与歌声合成技术;
分析评估ASRTTS产品性能改善产品性能;
探索大模型与语音识别/合成的结合,提升模型在上下文理解与情感表达上的能力。
硕及以上学历英语4级以上;
深入理解语音识别/合成全链路,熟悉Kaldi, Espresso, Transformer等框架,对音素韵律学有研究。
扎实的linuxpython功底;
熟悉k2有TTS经验者优先。
招聘人数:1人