达摩院大模型方向实习生招聘

达摩院大模型方向实习生招聘
阿里巴巴达摩院招收【科研型实习生】!!!
包括但不限于【大模型、AIGC】等方向。
简历投递:
zhangjiajin.zjj@alibaba-inc.com
tudanyang.tdy@alibaba-inc.com
地点: 杭州
欢迎有基础大模型、AIGC等相关背景的优秀同学,一起探索前沿科技,打造前沿影像AI算法,发表高质量文章。我们这里有行业顶尖的多模态数据,充足的计算资源和顶级的计算机视觉和医疗专家,还有国内外资深医生倾力合作;实验室已经在Nature Medicine、Nature Communications,TPAMI,CVPR,ICLR,ICCV,ECCV等顶会顶刊发表多篇高质量文章,快来加入我们吧!
岗位描述:
研究基础模型、AIGC分析领域技术攻关及技术创新,包括基于医学影像的计算机视觉多模态大模型等前沿技术探究。负责算法原型实现、算法优化及测试等内容,同时发表相应的高质量技术论文。
岗位要求:
1、海内外优秀在读硕士、博士,非常优秀的本科生也可以!
2、具备良好的编程基础和计算机视觉、机器学习等算法方向的研究和实践经验,能熟练运用pytorch等深度学习框架解决算法问题,熟练掌握C/C++、Java、Python等至少一门编程语言。
3、良好的逻辑思维能力,有好奇心,追求卓越和有自我驱动力。
3、在计算机视觉、医学图像的顶级会议和期刊发表过高水平论文者优先。有医学图像分析经验的优先。
4、热爱解决问题,喜欢学习新知识。
地点:杭州
#互联网大厂实习# 实习生内推 #内推# 找实习 #阿里巴巴# 达摩院 #科研# 实习 #互联网大厂# 高薪#牛客AI配图神器#
全部评论
感谢大佬分享
点赞 回复 分享
发布于 2025-09-28 16:14 安徽

相关推荐

2025-11-20 18:15
山东大学 算法工程师
1.实习介绍2. Lora 原理(核心是低秩分解:将原始权重更新近似为两个低秩矩阵乘积,减少参数量,保留主导方向,训练高效)3.了解 DeepSpeed 吗,ZeRO -1, ZeRO -2和 ZeRO3分别做了哪些优化(1优化优化器状态,2优化梯度,3切分参数,全面节省显存)4. Qwen的模型结构是怎么样的,相比于 LLaMA,DeepSeek 有什么区别(Qwen采用GQA+SwiGLU+RMSNorm,和LLaMA架构非常相似,差异在训练数据和tokenizer中文支持更好;DeepSeek只用MoE/MLA架构,Qwen系列主要是Dense模型)5.怎么缓解大模型的幻觉问题(RAG,RLHF对齐,事实监督)6.大模型的 MoE 结构相比于 Dense 结构训练的难点在什么地方,DeepSeekMoE为什么效果好,有什么值得我们借鉴创新点(MoE面临负载不均衡、训练不稳定问题;DeepSeekMoE通过细粒度专家和共享专家设计提升稳定性和效果)7.知道FP16和BF16有什么区别吗,包括FP32和INT8这些,在训练大模型的时候,应该怎么选择(FP16精度高但易溢出,BF16动态范围大;训练常用BF16混合精度,推理用INT8量化加速)8.讲-下 RLHF 的流程,写-下 PPO和 DPO的 Loss表达式(训练奖励模型后用PPO/DPO优化策略:PPO Loss: policy ratio + KL 约束/ DPO Loss: logit preference diff + sigmoid binary loss)9.对于超长上下文业界一般是怎么做的,你知道 Qwen是怎么做的吗(业界常用ROPE 变体/滑动窗口注意力/稀疏注意力等:Qwen使用YaRN和窗口注意力扩展上下文)10.开放题:你觉得目前大模型的上限在哪里(推理能力、长期记忆、具身交互和能耗效率,需要架构创新和多模态融合突破)11.代码:152.乘积最大子数组
查看9道真题和解析
点赞 评论 收藏
分享
评论
1
2
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务