大模型面经每日总结

BP16 和 FP16 在存储结构、精度表现、数值范围以及适用场景方面有什么不同?

  • 训练时使用bf16更稳定,表示范围大,并且自带隐式正则化buffer;
  • 推理时使用fp16比bf16更好,因为fp16表示精度高。 https://www.zhihu.com/question/616600181/answer/3194881239

怎么解决训练使用float16导致溢出的问题?

  • 使用 缩放因子 trick
  • 混合精度训练

kv-cache的作用

  • 一种缓存技术,通过存储键值对的形式来复用计算结果,以达到提高性能和降低内存消耗

量化方法的分类

  • 按量化对象分:KV Cache量化、模型权重量化、激活值量化-按量化阶段分:
  • 量化感知训练(QAT)、量化感知微调(QAF)、训练后量化(PTQ)【大模型常用】

AWQ 量化和 KV Cache量化 有什么不同

  • AWQ 更侧重于在模型权重存储和计算中
  • KV Cache量化 更适用于长上下文推理和并发场景参考

https://blog.51cto.com/u_15912723/12361929

常见推理框架有哪些,有什么异同

  • Slang,TensorRT,vLLM,LMDeploy 等可以从适用场景、生态、易用性,功能性进行对比 https://www.bentoml.com/blog/benchmarking-llm-inference-backends https://medium.com/better-programming/frameworks-for-serving-llms-60b7f7b23407 https://waytoagi.feishu.cn/wiki/RUI3wNlzeiF0SZkk5pWcdVfCnGc

日拱一卒~

全部评论

相关推荐

从上一个帖子之后面了大概七八次大厂公司,基本都做了总结,现在发一下面经,但是基本都一面挂......搞不懂问题也答了,手撕也过了为什么全都一面挂。。。疑似KPI面,无手撕,聊项目,聊八股1.自我介绍2.你认为前端和交互相关的技术有哪些?3.event loop4.promise5.你的研发过程中有没有使用过一些技术,通过event loop实现的技术6.宏任务、微任务这种情况在实际开发中你认为有哪些应用场景7.手写一个Promise.then的话,是怎么具体实现的8.手写这个Promise的话是怎么去实现这个同步任务、异步任务、宏任务、微任务的这个执行顺序的9.Promise会创建宏任务吗,Promise的宏任务是在什么时间点创建的?10.聊聊页面鉴权11.Token放在请求头的哪一个具体位置12.Token存储在LocalStorage里面会不会有安全问题?别人使用越权登陆怎么办?13.大部分的网站的登录信息,你认为是存在localStorage里还是存在Cookie里面14.你们现在为什么做项目都喜欢把Token存在LocalStorage里面,是有什么开源项目或者是看到什么推荐这样存储的吗15.防抖和节流具体做了一个什么事情16.如果我做了两次请求,第一次因为服务器卡顿返回的特别慢,第二次请求很快返回,结果第一次请求覆盖了第二次请求,该怎么办?17.介绍一下虚拟滚动18.你如果是按需渲染的,那么你的列表总高度理论上是不知道的,你怎么去知道这个列表的总高度是多少?19.虚拟滚动的时候如果滚动比较快,可能会出现白屏,实时渲染可能会出现抖动,有什么方案可以去解决?20.最近大模型比较火,你对AI或大模型有什么理解呢?你会使用大模型在具体实际生活中去做些什么21.你是怎么学习的?22.你看过哪些开源项目呢反问:1.面试流程2.公司base 杭州3.项目业务基本都答上来了,两个不是很确定的问题也一口气说了一大堆,面试官全程笑呵呵,但是有反馈,不抱希望,感觉会凉。
点赞 评论 收藏
分享
评论
1
16
分享

创作者周榜

更多
牛客网
牛客企业服务