高德地图 算法 二面面经

一小时,拷打transformer
你怎么理解AIGC?
讲一下transformer
transformer和cnn的区别
transformer中embeding怎么做的
位置编码你了解哪些形式
三角函数位置编码有哪些好处,旋转位置编码呢
position embeding 和input怎么融合的
多头注意力相比单头优势,encode的时候多头会做融合吗?还是什么时候做融合?
拆成多少个头有什么规律吗?
之后的层归一化怎么实现的
前馈神经网络有几层,为什么要用mlp这种结构?
像gpt和图像生成,大都是decoder-only架构,为什么
xl参数量多少
相比于传统的模型和思路方法,为什么能达到现在这个效果,以及你怎么看待它未来的发展。
多模态模型了解哪些?
无手撕
#阿里##算法##面经##如何判断面试是否凉了##秋招#
全部评论
还挺,朴实的
1 回复 分享
发布于 2024-09-03 20:41 天津
根本答不出来
1 回复 分享
发布于 2024-09-01 03:15 浙江
大佬面的哪个岗位or部门哇~
点赞 回复 分享
发布于 2024-10-20 02:45 北京
佬蹲蹲后续
点赞 回复 分享
发布于 2024-09-27 17:23 上海
attention 拆成多少个头有什么规律吗? 请问这个有说法吗?不会
点赞 回复 分享
发布于 2024-09-23 13:23 美国
佬,XL是哪个啊?
点赞 回复 分享
发布于 2024-09-01 17:54 陕西
佬有论文吗?
点赞 回复 分享
发布于 2024-09-01 11:02 北京
太细了
点赞 回复 分享
发布于 2024-09-01 10:46 北京

相关推荐

✅小红书商业化部门 NLP-内容理解 4面1️⃣第一面1、n时间复杂度找出数组第K大的值说出思路了 用快排思想,不过没写出来,不过面试官还行 没写出来也让我过了然后问的比较古老的一些Nlp细节2、比如问你为啥分类任务用交叉熵,不用MSE?直接反向传播原理公式,如果用MSE 你最后可能会出现梯度消失的现象还问了LN BN的细节准备的比较到位,所以都答出来了2️⃣第二面问的我好像是概率题,没写代码1、你一个硬币,均值多少次,可以丢出正反面问项目3️⃣第三面应该是答的最好的了,项目答的应该让面试官很满意,然后代码题的话1、第一个 就是 一个矩阵,从左往右 升,从上往下升,n时间复杂度,找出target我觉得太简单了,让面试官再出了一个2、又给了一道:动态规划,最长递增子序列✅知乎:AI中台 三面1️⃣第一面1、聊项目 模型细节,attention的作用,为啥要用FFN,还有LN中间说到一个点,我说为啥要在LN重新训练两个参数,我说是不然影响性能,但是其实应该是影响泛化能力2、代码题目:找出字符串的最长回文子串2️⃣第二面要我写attention的伪代码我写了一下 不过其实还要加上Mask 忘记加了还问了我 会用rebase操作吗,我说不会。问了交叉熵的细节,到底对预测对的产生loss 还是预测错的产生作用。代码题目不太记得3️⃣第三面项目负责人,项目聊的很开心代码题没写出来,不过也让我过了1、代码题目:给我一个字符串 让我判断是不是一个数学算式阿里 高德 ✅1️⃣第一面面试官挺直接的,问了项目,然后问我只做了分类是吗,我说的是的,他说你直说就是了。。。 尴尬1、概率题 给我一个函数 可以等概率生成0-5随机数字 f5() 要我依靠这个 生成一个f7()2、给我一个生成器 随机生成01 要我等概率生成一个生成器 做一个二分判别2️⃣第二面1、P9大佬,问到我一个问题,如果你需要100W数据 你怎么去跟你上司申请你要100W数据的标注资源。或者说 你现在手里有10W标注数据,你觉得你还需要再继续增加标注数据吗我觉得这个问题是我没想到的,因为我这边业务线训练数据都是比较充足2、代码题 给你一个数组,给我n时间复杂度 生成一个数组 这个数组的每个位置的字 都等于原先数组其他位置的乘积。 思路:空间换时间🍊如果想参加高质量项目辅导,提升面试能力,欢迎后台联系。
查看14道真题和解析
点赞 评论 收藏
分享
评论
23
105
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务