ASR 自动语音识别 ASR 自动语音识别 基本流程 语音信号 特征(MFCC、Fbank)→ 声学模型 帧长、帧移、加窗 梅尔滤波器组、对数能量 声学模型 解码 文本 声学得分、语言模型 束搜索、解码图 端到端:语音直接到文字 流式、chunk-based 传统与深度学习 HMM DNN 等大模型 ASR 应用场景 语音助手、智能音箱 会议转写、实时字幕 客服质检、多语种识别 工程要点 流式 vs 离线、VAD 端点检测 实时率、首包延迟 静音检测、断句 噪声与口音鲁棒性 数据增强、多条件训练 前端去噪、说话人自适应 标点、数字与专有名词 后处理、逆归一化 热词、定制词表