跳至主要內容

AI工程化

JohntonYong大约 2 分钟

AI工程化

典型视觉AI流程

例如:

IPC摄像头 → 人脸识别 / 目标检测 / 车牌识别 Camera IPC | | RTSP流 | | FFmpeg/GStreamer (视频解码) | | OpenCV (图像处理/预处理) | +-----------+-----------+ | | Resize Normalize | | +-----------+-----------+ | | Tensor输入 | | +----------------------+ | | ONNX Runtime OpenVINO Runtime | | | | YOLO OpenVINO YOLO | | AI推理结果 | | +------+------+------+ | | | 人 车 车牌 检测 检测 OCR

音频算法

基本定义

名称全称作用
AECAcoustic Echo Cancellation消除扬声器回声
ANS/NSAutomatic Noise Suppression降低环境噪声
AGCAutomatic Gain Control自动调整音量
AINSAI Noise Suppression基于AI的智能降噪

算法对比

AECANSAGCAINS
中文回声消除噪声抑制自动增益AI智能降噪
目标去回声去噪声调音量复杂噪声增强
传统DSP
AI模型
ONNX/OpenVINO
替代难度替代ANS
当前趋势保留逐渐AI化保留快速发展

AEC负责消回声,AINS负责智能降噪,AGC负责音量稳定。未来趋势不是AI替代全部3A,而是“传统AEC/AGC + AI ANS”的混合架构。

典型听觉AI流程

例如:

麦克风 → 回声消除 → AI降噪 → 语音编码 Microphone | | PCM数据 | | 音频前处理(Audio DSP) | +-------------+-------------+ | | | AEC ANS AGC 回声消除 噪声抑制 自动增益 | | Clean PCM | | 音频特征提取 | | STFT (时频转换) | | Tensor输入 | | +----------------------------+ | | ONNX Runtime OpenVINO Runtime | | DPCRN DeepFilterNet AI-NS AI-NS | | 增强语音 | | Opus编码 | | 网络传输

安防场景中音视频AI项目中的推荐组合

         摄像头RTSP混合流
                |
                |
          OpenCV / WebRTC
                |
    +-----------+-----------+
    |                       |
  视频AI                 音频AI
    |                       |

YOLO/Face/OCR AINS | | ONNX Runtime ONNX Runtime | Intel设备: | OpenVINO Runtime

   |
   ↓

检测: 人 车 车牌 | ↓ 告警/录像/跟踪