百度大模型实习一面 1h
攒人品中,祝大家都能拿到满意的Offer!
1.项目拷打
2.DPO损失函数怎么算的
3.梯度检查点如何提升效率
4.详细讲一下deepseed
5.以7B的模型为例,计算训练需要多少显存说明都有哪些部分,每部分怎么算的,以及用deepseed每一个阶段节省多少内存,怎么节省的,计算过程中都有乘以2字节是为什么,什么原理
6.做Rag 时候的分块策略
7.BM25原理,RRF的原理
8.Kl散度的输入是什么,怎么来的
手撕:用torch实现kl散度
1.项目拷打
2.DPO损失函数怎么算的
3.梯度检查点如何提升效率
4.详细讲一下deepseed
5.以7B的模型为例,计算训练需要多少显存说明都有哪些部分,每部分怎么算的,以及用deepseed每一个阶段节省多少内存,怎么节省的,计算过程中都有乘以2字节是为什么,什么原理
6.做Rag 时候的分块策略
7.BM25原理,RRF的原理
8.Kl散度的输入是什么,怎么来的
手撕:用torch实现kl散度
全部评论
梯度检查点原理

这点东西面了这么久啊
相关推荐
03-15 23:11
南开大学 Java
牛客91882925...:慢慢来,别给自己那么大压力,天无绝人之路。学习中成长,这背景已经超越绝大多数牛友了。多面几次就好了,我第一次面试前睡都睡不好,不过面试官人还好,进行一会面试就注意力全在题上了。所以跟面试官关系也很大 点赞 评论 收藏
分享
03-15 20:47
西南财经大学 产品经理 俺不紧张俺肯定可以的:某书放假offer卖资料的多,看多了知道是广,牛友是真拿到offer,感觉在这更焦虑


点赞 评论 收藏
分享
查看20道真题和解析