阶跃星辰 · 模型搭建、图文识别与数据管道

大模型基础设施工程师(数据管道)一面、二面面经

完整信息

44 条问法 · 33 道题

本篇目录
8.12一面 8.13二面 工资还挺高的实习生一天500-1000 (我是双非本) 一面 1、多进程、多线程 2、GIL机制 3、Python用到过那些库 4、Spark宽窄依赖、spark介绍一下 5、Pandas库里面的dataframe和spark的dataframe区别 6、Spark的执行算子,触发计算的算子 Count()、collect()、take()、first()、show()、reduce()、sum()、max()、min()、avg()、countDistinct() 7、Spark任务跑挂了是什么原因 数据倾斜(加盐打散)、内存溢出(调大分区数、调大executor的什么大小、增加executor数量) 8、hive底层是什么存储的 Hdfs 9、Hdfs有什么存储格式 文件类型 :textfile、orc、parquet 10、列存储和行存储区别 11、Hive支持update吗 12、Update、alter 13、你觉得hive的数据要发生改变,怎么改 面试官说可以用分区的形式, 14、分区表是什么 15、分区可以按照主题去分区吗? 一般不行,因为一些主题会发生改变,不稳定 16、数仓分层 ods-dwd的作用 17、来了一个新的数据会进入哪个层 Ods 18、性能调优有什么 列存储、分区、合并小文件、开启压缩; 提前过滤、禁止select*、小表用广播join、groupby代替distinct; 几个高频的热点,可以单独计算最后union 19、Openclaw用过哪些 20、Csdn写的什么 21、为什么上一次实习不去了 22、对公司了解吗 23、大模型文本文件怎么去重 24、大模型下怎么保证数据可以回查,没太听清 25、大模型的底层实现原理 26、中间件了解什么 Kafka Kakfa的主要作用 27、反问,我进入公司做什么 做一些模型搭建、部门任务主要是给ai去做一些图文识别什么的,还有一些数据管道pipeline 一面完15分钟通知过了,约二面 二面: 1、自我介绍 2、自学是怎么学的 3、有在集群中做过吗,公司一个人有几个集群 4、数据源存储在哪,数据之前是存储到哪里 Hdfs 5、代码是怎么提交的,有提交过job任务吗 6、介绍一个项目 7、主要的需求有什么 8、缺失值怎么处理 9、数仓分层作用 10、Pandas用过吗,输入是什么 11、实习主要的问题 12、你为什么实习要做数仓 13、用过哪些ai,平常怎么用ai 14、数据管道是什么 15、怎么优化的 16、在网站上爬取一些数据,然后去数据清洗,数仓,最后到模型训练中间怎么设计这个流程 面试官说:设置血缘关系 17、ray了解吗 18、Pyspark为什么比Java的慢 Pyspark的底层数据是存储再java里面,需要从java里面读取、在写入到java中 19、反问 面试官说要多用用python,不能只写sql 最后过了三个小时问进度,说挂了
本篇目录
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
  27. 27
  28. 28
  29. 29
  30. 30
  31. 31
  32. 32
  33. 33
  34. 34
  35. 35
  36. 36
  37. 37
  38. 38
  39. 39
  40. 40
  41. 41
  42. 42
    在网站上爬取一些数据,然后去数据清洗,数仓,最后到模型训练中间怎么设计这个流程
  43. 43
  44. 44

相关公司