岗位职责
- 构建高性能音视频理解 Pipeline,负责各类理解模型的推理、训练和持续优化。
- 持续优化 Caption、Tag、PE、QA、Quality Assessment 等理解能力,提高数据生产质量。
- 优化 CPU/GPU 推理效率,包括模型部署、Batching、Quantization、TensorRT、ONNX 等。
- 持续优化各类专家模型,包括但不限于: - Motion Detection - Shot/Scene Cut Detection - Artifact Detection - Audio-Visual Sync - OCR - ASR - Speaker Detection - Quality Assessment
- 与生成模型团队共同设计自动化数据生产 Pipeline,提升整体数据质量和处理效率。
职位要求
- 熟悉 Transformer、Vision Transformer、多模态模型基础。
- 熟悉 Qwen VL、Gemma、Gemini、SeedVL 等理解模型。
- 熟悉 TensorRT、ONNX Runtime、CUDA Optimization。
- 熟悉 FFmpeg、OpenCV、CUDA Video Codec。
- 有千万级以上视频 Pipeline 经验。 我们希望你:
- 不只是调用模型,而是持续优化模型效果、效率和成本。
- 乐于做 Benchmark,能够系统分析误差来源并持续迭代。
- 对模型效果有 Owner 意识,而不是模块 Owner。