岗位职责
该职位会专注于大规模离线LLM推理在文本处理场景中的研究和开发,具体职责包括:
- 大模型的量化调优,在较低内存和CPU算力的环境中,依然可以达到较高的token处理和生成速率。
- 常用推理框架(e.g. vLLM, Llama.cpp),在网页文本处理任务上的性能调优,特别是针对质量分计算或者打标场景的调优。
- 中低端GPU对于小参数LLM(
- 5B/3B/7B/14B等规格)的推理性能调优。
职位要求
- 扎实的工程能力,优良的编程风格,熟悉C++/Python等面向对象编程语言,以及常用设计模式;
- 具备较好的问题分析、解决和归纳能力,具备一定的性能分析和调优经验;
- 顺畅的表达和沟通能力、以及良好的团队合作意愿;
- 熟悉计算机体系结构基础知识,并具备一定的对复杂系统的分析、设计能力。 加分项:
- 有突出的学术背景和创新研究能力;
- 有常用推理框架的使用和调优经验;
- 具有GPU高性能Kernel开发和优化经验。