数据仓库 - 转转 - 一面凉经

面试流程

自我介绍

Python 中,如何在数据清洗过程中应对内存不够的情况

如何避免,在使用Pandas处理大规模数据时,经常会遇到“SettingWithCopyWarning”警告

在Hive中,当您使用动态分区功能进行数据插入时,可能会遇到“too many dynamic partitions”错误,如何处理

在Apache Spark中,宽依赖(Wide Dependency)和窄依赖(Narrow Dependency)是两种不同类型的依赖关系,对性能分别有什么影响

在使用Kafka作为消息队列时,消费者出现重复消费的问题是比较常见的,分析原因,怎么处理

在使用Kafka拦截器(Interceptors)时,需要注意什么,以确保其正确性和效率

reduce 的阶段,长时间卡在99%,分析原因,如何排查

Spark 运行任务,出现小文件的问题,如何处理

数据治理过程中,需要下线重复指标,如何验证下游不会受到影响

Jenkins 如何避免多分支冲突

数仓设计中,如何设计 ODS 和 DWD 层的字段颗粒度

从 MySQL 导入数据至 Hive,使用 Scoop 如何解决数据不一致问题

DQC 告警如何判断

如何权衡小文件处理过程中的时间 、 空间 、 资源消耗

数据治理中,代码之外,哪些地方可以优化

看板口径整合,数据一致性如何保障

成果中的指标变化,数据计算方式和来源具体讲解

数据变化是如何评估的

思维题:设计一个高并发的日志采集和分析系统,要求使用 Flume、HDFS、Kafka,分析并详细讲解技术选型,在这个场景中,针对数据丢失的情况,如何做预防,设计一些方法思路

反问环节

全部评论
官网投的吗
点赞 回复 分享
发布于 03-29 21:32 山东

相关推荐

08-22 16:24
门头沟学院 Java
2025.8.22 百度一面 时长1h20min你对java面向对象是怎么理解的,你了解的设计模式是怎么体现面向对象的特性的你对spring的ioc和aop是怎么理解的循环依赖实际遇到的问题怎么解决面试官解答:1注解。2可以从spring的生命周期入手,我觉得应该是用单例去实现消费逻辑。3实现spring提供的接口。你对juc怎么理解的,有用到一些juc工具包吗首先我说了一下对线程安全的理解,然后这里答到了那三个,面试官说还有个map的,脑抽了说成ThreadLocal追:说一下ThreadLocal你项目怎么用的追:然后回到了ConcurrentHashMap,这才意识他问的是这个了解索引吗。说一下实际项目中你是怎么建字段加索引的追:索引失效有哪些MVCC讲一下讲一下redo log,binglogredis数据结构,实际项目你用到了哪些追:zset可以实现延时队列吗中间件你知道哪些怎么理解rag挑一个最近的项目讲一下吧你觉得微服务比单体好在哪里docker了解吧,你们用的什么方法部署镜像算法:计数排序总体体验感无敌,面试官和自己有说有笑的。但是自己实在太紧张了,表达也很糟糕。算法很简单,但是自己写太快了,一直没发现有个地方错了,运行结果错了脑子就下线,debug也没d出来,最后还是面试官直接告诉我。然后还有代码规范性问题,一直强调,没明白什么意思。大概率一轮游,不过知道自己问题在哪里了,好好下去沉淀了
查看17道真题和解析
点赞 评论 收藏
分享
评论
2
13
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务