岗位职责
- 设计和建设百亿级多模态数据处理管线,覆盖数据清洗、解码、转换、过滤、标注及训练加载等环节。
- 深入分析 CPU、内存、网络、存储、编解码及任务调度瓶颈,提升端到端吞吐、资源利用率和系统稳定性。
- 建设数据校验与质量评估体系,保障数据完整、一致、可追溯,持续提升数据的准确性、多样性和有效性。
- 基于 Ray、FFmpeg、PyTorch、vLLM 等技术建设高性能数据处理与模型推理组件,优化任务切分、批量推理、资源调度、数据传输及容错恢复。
- 面向 Pretrain、SFT、RL 等训练阶段,协同设计数据格式、分片策略、存储布局和读取链路,提升训练数据供给效率。
- 建立数据管线可观测体系,持续监控吞吐、延迟、资源利用率、失败率及数据质量,并分析数据特征与模型效果的关联。
- 与算法、训练框架及基础设施团队协作,完成复杂数据链路的架构设计、性能优化和规模化落地。
职位要求
- 计算机基础扎实,熟练使用 Python,具备良好的 Linux 系统开发能力。
- 熟悉 PyTorch、FFmpeg、vLLM 等技术,具备多媒体数据处理或模型推理经验。
- 熟悉 Ray 或其他分布式计算框架,理解任务调度、数据传输、容错和资源管理机制。
- 具备系统性能分析与调优能力,能够定位 CPU、网络、存储、I/O 及编解码瓶颈。
- 了解多模态大模型及不同训练阶段的数据需求,重视数据质量,具备良好的跨团队协作能力。