岗位职责
- 参与多模态感知模型的训练与微调,并将其应用于实际屏幕行为和用户交互场景;
- 探索主动响应的感知技术,通过分析用户屏幕使用轨迹和行为数据,实现对用户意图的实时推断;
- 融合视觉、屏幕和系统事件等多模态数据,研究具备自主环境感知和交互响应能力的感知大模型;
- 搭建端侧屏幕理解能力,实现泛场景的GUI事件感知与自动化响应;
- 关注机器学习与感知领域前沿技术,探索跨领域技术融合,并参与撰写论文或专利;
- 参与OSAgent感知能力预研,包括记忆、决策与主动响应机制。
职位要求
- 硕士及以上学历,人工智能、计算机科学、电子、信息工程、机器人等专业,有C++/python开发经验;
- 熟练掌握至少一种深度学习框架,如Tensorflow、PyTorch等;
- 对深度学习有深刻认识,熟悉各种神经网络及背后数学原理;
- 对大模型有设计应用经验者优先;
- 对声音、图像、视频、各类传感器的通用融合感知算法有实际经验的优先;
- 在AI或NLP相关顶级会议或者刊物,如ICML、NeurIPS、AAAI、ACL等发表论文者优先。