Apache Parquet FILE Logical Type 如何为 AI 数据湖统一多模态对象
生成式 AI 正在改变数据湖里“数据”的含义,以前我们面对的数据都是数值、字符串、日期或嵌套结构;如今多模态训练、文档理解、语音分析等工作负载,要求数据湖同时管理图片、音频、视频、PDF 以及模型文件。这些对…
“This is the way”
“This is the way”
生成式 AI 正在改变数据湖里“数据”的含义,以前我们面对的数据都是数值、字符串、日期或嵌套结构;如今多模态训练、文档理解、语音分析等工作负载,要求数据湖同时管理图片、音频、视频、PDF 以及模型文件。这些对…
AI 时代,如果数据库不蹭点 AI 概念,已经都不好融资了,这使得大家都争先恐后地期望自己能够成为 AI 时代的数据底座。但问题是做 DB 的没搞过 AI,搞 AI 的又不搞 DB,这导致很多 DBer 其实并不感知 AI 到底需要什…
OB 无论是从公司规模还是产品复杂度上来说,肯定算是数一数二的数据库大厂,比绝大多数云厂商里面的数据库团队都专业的多。所以其项目管理的经验,肯定还是有学习的价值。 这里浅浅记录一下 OB 是如何管理整个数据…
24 年底,我刚写下了 从 StarRocks 离开,再出发,告别了自己人生的第一份工作。结果,今天又要再写一篇了。 今天上海的组员也难得出差到杭州,聚在一起吃了顿散伙饭。下午走出公司大门的时候,多少还是有些许不舍…
AI、AI、AI,每天上班总能听到,办公室的空气里到处弥漫着 AI 焦虑的气息。 老板们在焦虑,焦虑着自己的产品会在 AI 时代被抛弃,焦虑着自己会在这场 AI 军备竞赛里面落后腿。 打工人也在焦虑,焦虑自己会被 AI 替…
本人初次接触 Paimon,以下内容仅是自己的理解,如有错误,欢迎评论。 下面所有讨论的内容仅限 PK 表。 Paimon 通过 bucket 提升数据的读写并行度,每一个 bucket 是一棵独立的 LSM 树,也是最小的读写单元。 当表…
在千篇一律 arrow-cpp 系的 Parquet Reader 实现中,arrow-rs 上面的实现着实让人眼前一亮,这里简单记录下。 Parquet C++ Reader 早期由 Impala 团队开发,即 parquet-cpp,后合并到 arrow-cpp 中。Doris 引擎在早…
Iceberg 默认使用 Copy On Write 技术,也就是当你删除一行数据时,它会读取原有的文件,删除目标行,然后再重新写一遍,这样开销显然很大。后面 Iceberg 引入了 Merge On Read 技术,通过标记的方式,实现高效的数…
在学习 Iceberg 源码前,我们需要搞清楚 Iceberg 中的各种概念,这样源码看起来才能更有层次感。 所以这篇文章只做一件很纯粹的事情,就是理清 Iceberg 中的名称概念,不做其它阐述。 下面所有的命名不是我自己 YY …
OceanBase 作为一个大型的 C++ 项目,使用 Clion 能够明显提升开发效率,其很多功能是 VS Code 所不具备的。目前 OB 官网推荐使用 VS Code + ccls 插件来索引代码,但是其索引慢的离谱,而且跳转能力也一般,说实话…