岗位职责
大模型借助庞大的文本语料和巨量的计算资源,展现出了惊人的性能表现。之前大量的研究工作聚焦于模型参数量、计算量以及数据总量的scaling law,忽略了模型中词汇量的大小对模型的影响。大的词汇量会提升分词的压缩比,从而提升模型的训练和推理效率,但词汇量应该增大到何种程度,以及不同规模的模型对词汇量的需求是否一致等这些关键且基础的问题仍需要进一步的探索。我们期望将相应的技术路线充分探索并加以优化以大幅提升通义千问模型的训练和推理的效率和性能。 拟解决技术问题:
- 研究构建高效大模型词表的方式。
- 研究大模型词表对模型输出质量的影响。
- 研究不同规模、不同数据下模型词表大小对模型性能的影响。
- 研究通过词表压缩技术减少模型参数量且保持性能。
职位要求
- 计算机及相关专业的博士或硕士研究生,NLP方向且对LLM有充分的兴趣;
- 最好有模型词表方向优化的经验,需要产出论文和专利等高水平的学术成果,并将成果转化到千问Qwen大模型中。