到这里你已经能构建生产级 WebRTC 系统。本目录是专家深水区:源码、自研、AI 增强、超大规模、新一代标准。
阅读顺序(计划)
| 顺序 | 文件 | 解决的问题 |
|---|
| 1 | libwebrtc源码导读.md | PeerConnection / Call / Channel / Transport |
| 2 | 自研SFU设计要点.md | 转发策略、订阅模型、级联与负载均衡 |
| 3 | 大房间方案.md | 万人会议、千人连麦、SVC + 选择性订阅 |
| 4 | AI增强实时字幕与降噪.md | Whisper streaming、RNNoise、DeepFilterNet |
| 5 | 虚拟背景与超分.md | MediaPipe、WebGPU、模型上链路 |
| 6 | 低延迟直播WHIP-WHEP落地.md | OBS 推流到自研服务端 |
| 7 | WebTransport与未来.md | WebTransport vs DataChannel、WebRTC-NV |
这一层的判断原则
- 不要为了"进阶"而进阶。除非你真的扛万人房间或有 ML 增强需求,否则用 LiveKit / mediasoup 就够了。
- AI 增强放在客户端:实时性要求高,云端往返延迟难接受。
- WebGPU 是未来:虚拟背景、超分、姿态识别都在迁移到 WebGPU。
- WHIP/WHEP 是趋势:信令统一为 HTTP,CDN 化更容易。
大房间常用招
| 招 | 含义 |
|---|
| SVC(Scalable Video Coding) | 一路上行编码出多层,SFU 按需丢弃高层 |
| Simulcast | 上行多档独立编码,SFU 选层转发 |
| 选择性订阅 | 只订阅说话者或聚焦的人,节省下行 |
| SFU 级联 | 多 SFU 互联,按地域分桶 |
| Pacing / 主动播报 | 谁在说话由服务端推送,避免端做 N 人决策 |
AI 增强常见落地
| 能力 | 推荐方案 |
|---|
| 实时字幕 | 客户端 Whisper streaming(onnxruntime-web)/ 云端 ASR + WebSocket 推回 |
| 降噪 | RNNoise(WASM)/ DeepFilterNet / 浏览器内置 |
| 回声消除 | 浏览器 AEC + 自研声学回声管理 |
| 虚拟背景 | MediaPipe Selfie Segmentation + WebGPU |
| 超分 / 美颜 | 客户端 ONNX 模型 + WebGPU |
| 说话人识别 | 服务端 ASR + 声纹模型 |
详见 L5-AI 增强会议。
权威资料