<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Liao Jiayi</title><description>关于数据基础设施、AI 系统、机器人，以及技术背后的行业变化。</description><link>https://www.liaojiayi.com/</link><item><title>Paper Notes(2) - Updating..</title><link>https://www.liaojiayi.com/blog/papers2/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/papers2/</guid><description>记录一下自己读的Paper。</description><pubDate>Sat, 07 Feb 2026 00:00:00 GMT</pubDate></item><item><title>Paper Notes(1) - Done</title><link>https://www.liaojiayi.com/blog/papers/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/papers/</guid><description>记录一下自己读的Paper。</description><pubDate>Thu, 05 Feb 2026 00:00:00 GMT</pubDate></item><item><title>Reinforcement Learning Notes</title><link>https://www.liaojiayi.com/blog/rl/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/rl/</guid><description>RL 挺有意思的</description><pubDate>Mon, 02 Feb 2026 00:00:00 GMT</pubDate></item><item><title>SGLang Notes(主要是 Awesome-ML-SYS-Tutorial Notes)</title><link>https://www.liaojiayi.com/blog/sglang/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/sglang/</guid><description>sglang notes</description><pubDate>Wed, 28 Jan 2026 00:00:00 GMT</pubDate></item><item><title>(copy)MIT IAP 2025 / 6.S186</title><link>https://www.liaojiayi.com/blog/mit_robot/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/mit_robot/</guid><description>notes 记一下</description><pubDate>Mon, 26 Jan 2026 00:00:00 GMT</pubDate></item><item><title>LeRobot Notes(基本流程)</title><link>https://www.liaojiayi.com/blog/lerobot/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/lerobot/</guid><description>LeRobot 项目 notes</description><pubDate>Sat, 24 Jan 2026 00:00:00 GMT</pubDate></item><item><title>Image 和 Video 的处理 Pipeline</title><link>https://www.liaojiayi.com/blog/video-image-pipeline/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/video-image-pipeline/</guid><description>Image 和 Video 的处理 Pipeline</description><pubDate>Tue, 20 Jan 2026 00:00:00 GMT</pubDate></item><item><title>Robot LIBERO 数据集</title><link>https://www.liaojiayi.com/blog/robot-libero/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/robot-libero/</guid><description>notes from reading LIBERO dataset。</description><pubDate>Sun, 18 Jan 2026 00:00:00 GMT</pubDate></item><item><title>一个通用的 LLM 的评测框架解析</title><link>https://www.liaojiayi.com/blog/llm_eval/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/llm_eval/</guid><description>一个通用的 LLM 的评测框架解析</description><pubDate>Sun, 28 Dec 2025 00:00:00 GMT</pubDate></item><item><title>PyTorch Tensor 变换</title><link>https://www.liaojiayi.com/blog/tensor/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/tensor/</guid><description>PyTorch Tensor 变换</description><pubDate>Fri, 26 Dec 2025 00:00:00 GMT</pubDate></item><item><title>vLLM KV Cache 实现要点</title><link>https://www.liaojiayi.com/blog/vllm/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/vllm/</guid><description>vLLM 的 KVCache 机制是推理过程中必不可少的，但是随着序列建模的 context 不断增长，带来的 KV Cache 相关的架构迭代也非常频繁，比如 PD 分离、多种 Cache 存储选型等。</description><pubDate>Sat, 08 Nov 2025 00:00:00 GMT</pubDate></item><item><title>DeepSpeed ZeRO 主流程源码和流程解析</title><link>https://www.liaojiayi.com/blog/deepspeed/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/deepspeed/</guid><description>ZeRO：Zero Redundancy Optimizer（无冗余优化器），主要目标是为了降低 GPU 显存的冗余占用，通过分片的模式来提高训练任务并行效率或者提高资源利用率。</description><pubDate>Tue, 22 Jul 2025 00:00:00 GMT</pubDate></item><item><title>Frequently Used Tools</title><link>https://www.liaojiayi.com/blog/frequent-use/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/frequent-use/</guid><description>Frequently Used Tools</description><pubDate>Sat, 11 Jan 2025 00:00:00 GMT</pubDate></item><item><title>实时计算系列(4) - Failover in Flink</title><link>https://www.liaojiayi.com/blog/flink-jm-tm/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-jm-tm/</guid><description>本文介绍 Flink 中的 Failover 机制。</description><pubDate>Sun, 16 Oct 2022 00:00:00 GMT</pubDate></item><item><title>数据湖系列(2) - Iceberg 核心功能原理剖析</title><link>https://www.liaojiayi.com/blog/lake-iceberg/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/lake-iceberg/</guid><description>上一篇文章中讲解了关于 Hudi 的基本概念和功能原理，Hudi 利用主键索引的方法来实现了 Upsert 的语义。Apache Iceberg 也是一个广为应用的数据湖框架，虽然两个框架的设计初衷和思路不同，但如今随着需求逐步丰富，两者对于使用者来说，却是越来越趋于一致了。</description><pubDate>Sun, 29 May 2022 00:00:00 GMT</pubDate></item><item><title>数据湖系列(1) - Hudi 核心功能原理剖析</title><link>https://www.liaojiayi.com/blog/lake-hudi/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/lake-hudi/</guid><description>随着互联网业务的逐步成熟，数仓和模型训练的基本盘逐步稳固，越来越多的工程师从业务开发需求转移到了工程的架构升级，而常用的 Hudi 和 Iceberg 往往会成为替代 Hive/Hdfs 等架构升级的选型。</description><pubDate>Thu, 05 May 2022 00:00:00 GMT</pubDate></item><item><title>Feast 技术架构详解</title><link>https://www.liaojiayi.com/blog/feast/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/feast/</guid><description>本文详细介绍 Feast 的技术架构。</description><pubDate>Sun, 13 Mar 2022 00:00:00 GMT</pubDate></item><item><title>Ray Datasets - 模型训练前的&quot;最后一公里&quot;</title><link>https://www.liaojiayi.com/blog/ray-dataset/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/ray-dataset/</guid><description>Ray 1.8+ 版本中提出使用 Datasets 来解决模型训练的&quot;最后一公里&quot;问题。由于并未在 Ray 上做过多的实践，所以本文更多是将 Datasets 做了系统化的梳理。</description><pubDate>Thu, 10 Mar 2022 00:00:00 GMT</pubDate></item><item><title>Flink 的容错机制以及弱一致性快照</title><link>https://www.liaojiayi.com/blog/streaming-fault-tolerance/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/streaming-fault-tolerance/</guid><description>本文聊聊 Flink 中的容错机制及其存在的常见问题，以及在生产实践中遇到的弱一致性场景和解决方案。</description><pubDate>Sun, 06 Feb 2022 00:00:00 GMT</pubDate></item><item><title>Why not RocksDB in Streaming State?</title><link>https://www.liaojiayi.com/blog/why-not-rocksdb-in-streaming-state/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/why-not-rocksdb-in-streaming-state/</guid><description>本文以 Apache Flink 为例，聊聊为什么 RocksDB 不是流计算引擎中理想的状态存储。Flink 中使用 RocksDB 作为大状态的存储后端，但在实际线上大规模的生产应用中，我们发现 RocksDB 和流计算场景的组合，即使在参数调优及技术优化后，也始终达不到预期的理想状态。</description><pubDate>Sun, 16 Jan 2022 00:00:00 GMT</pubDate></item><item><title>Hazelcast Jet - Low-latency Stream Processing at the 99.99th Percentile</title><link>https://www.liaojiayi.com/blog/Hazelcast-jet/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/Hazelcast-jet/</guid><description>原文：Hazelcast Jet: Low-latency Stream Processing at the 99.99th Percentile，Hazelcast Jet 是一个流处理引擎，整篇论文通读下来，它的定位和当前广为应用的流计算引擎 Apache Flink 和 Spark Streaming 又有些不同。</description><pubDate>Wed, 12 Jan 2022 00:00:00 GMT</pubDate></item><item><title>如何自定义 Flink State 使用的 Serializer</title><link>https://www.liaojiayi.com/blog/state-serializer/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/state-serializer/</guid><description>自定义 Flink State 的序列化方式是一种高阶的使用技巧，在很多复杂场景下，通过自定义 Serializer 可以在兼容性、性能等方面获得一定的收益。</description><pubDate>Wed, 12 May 2021 00:00:00 GMT</pubDate></item><item><title>Flink RocksDB 内存管理</title><link>https://www.liaojiayi.com/blog/rocket-memory/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/rocket-memory/</guid><description>RocksDB 的内存管理在 Flink 1.10 版本之前是不受管控的，社区利用 RocksDB 已有的一些内存控制上的优化，在去年对 Flink 中 RocksDB 的使用做了一系列的改造。</description><pubDate>Sat, 17 Apr 2021 00:00:00 GMT</pubDate></item><item><title>如何决定事情的优先级</title><link>https://www.liaojiayi.com/blog/work-priority/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/work-priority/</guid><description>如果说专业技能决定了一件事情能不能&quot;做&quot;，那么职场软实力决定了一件事情能不能&quot;成&quot;。「职场系列」的内容源于我的真实经历及引发的思考，记录的是我关于职场软实力的思考和感悟。</description><pubDate>Wed, 17 Mar 2021 00:00:00 GMT</pubDate></item><item><title>(转) 创业公司生存的必需特质</title><link>https://www.liaojiayi.com/blog/growth/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/growth/</guid><description>文章转自 joining-hypergrowth-startups。在阅读这篇文章后，对于文章中大部分内容的描述都深感赞同，并结合自身的一些经历，切身体会过，这些特质对于个人、团队、甚至一家公司的影响有多大。</description><pubDate>Thu, 28 Jan 2021 00:00:00 GMT</pubDate></item><item><title>为什么我们需要数据湖？</title><link>https://www.liaojiayi.com/blog/why-need-datalake/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/why-need-datalake/</guid><description>近两年，为什么都开始谈论起 Data Lake 这个&quot;新名词&quot;了？其实还是用户需求驱动数据服务，大家开始关注 Data Lake 的根本原因是用户需求发生了质变，过去的数据仓库模式以及涉及到的相关组件没有办法满足日益进步的用户需求。</description><pubDate>Sun, 15 Nov 2020 00:00:00 GMT</pubDate></item><item><title>解决实时推荐场景下数据断流问题-单点恢复功能介绍</title><link>https://www.liaojiayi.com/blog/single-task-failover/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/single-task-failover/</guid><description>本文摘自我在字节跳动技术公众号上发布的文章。在字节跳动的实时推荐场景中，我们使用 Flink 将用户特征与用户行为进行实时拼接，拼接后的实例会更新后端推荐模型，对用户的实时推荐产生影响。</description><pubDate>Tue, 22 Sep 2020 00:00:00 GMT</pubDate></item><item><title>流式计算未来的发展趋势</title><link>https://www.liaojiayi.com/blog/stream-trend/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/stream-trend/</guid><description>受 SIGMOD 会议的论文 Beyond Analytics: The Evolution of Streaming Processing Systems 的启发，聊一下流式计算未来的趋势。</description><pubDate>Sun, 13 Sep 2020 00:00:00 GMT</pubDate></item><item><title>推荐系统实践 学习笔记</title><link>https://www.liaojiayi.com/blog/recommendations/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/recommendations/</guid><description>一本读了很长时间的书。</description><pubDate>Wed, 12 Aug 2020 00:00:00 GMT</pubDate></item><item><title>Flink 是如何统一批流引擎的？</title><link>https://www.liaojiayi.com/blog/flink-unify/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-unify/</guid><description>2015 年，Flink 的作者就写了 Apache Flink: Stream and Batch Processing in a Single Engine 这篇论文。本文以这篇论文为引导，详细讲讲 Flink 内部是如何设计并实现批流一体的架构。</description><pubDate>Sun, 02 Aug 2020 00:00:00 GMT</pubDate></item><item><title>苏世民-我的经验和教训 读书笔记</title><link>https://www.liaojiayi.com/blog/sushimin/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/sushimin/</guid><description>周末借着假期去了一趟广州，在这趟旅程中读完了这本书。这本书还是值得一看，有些类似传记类读物，但是在不同经历里，又讲述了主人公的思考和收获，还算是比较客观，读下来一定会有收获。</description><pubDate>Mon, 20 Jul 2020 00:00:00 GMT</pubDate></item><item><title>Flink - Network Buffer</title><link>https://www.liaojiayi.com/blog/flink-network-buffer/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-network-buffer/</guid><description>Flink 中 Network Buffer 相关知识。</description><pubDate>Fri, 12 Jun 2020 00:00:00 GMT</pubDate></item><item><title>Hudi</title><link>https://www.liaojiayi.com/blog/hudi/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/hudi/</guid><description>自己关于 Apache Hudi 的一些简单的了解。Hudi 是 Uber 主导开发的开源数据湖框架。所以大部分的出发点都来源于 Uber 自身场景，比如司机数据和乘客数据通过订单 Id 来做 Join 等。</description><pubDate>Thu, 14 May 2020 00:00:00 GMT</pubDate></item><item><title>Flink StateBackend (4) - RocksDBStateBackend</title><link>https://www.liaojiayi.com/blog/flink-statebackend-rocksdbstatebackend/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-statebackend-rocksdbstatebackend/</guid><description>RocksDBStateBackend 是 Flink 中用来存储大状态的 StateBackend。</description><pubDate>Fri, 20 Mar 2020 00:00:00 GMT</pubDate></item><item><title>Flink StateBackend (3) - FsStateBackend</title><link>https://www.liaojiayi.com/blog/flink-statebackend-fsstatebackend/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-statebackend-fsstatebackend/</guid><description>FsStateBackend 可能是大部分公司里最常用的一种 StateBackend 了。</description><pubDate>Wed, 04 Mar 2020 00:00:00 GMT</pubDate></item><item><title>Flink StateBackend (2) - DefaultOperatorStateBackend</title><link>https://www.liaojiayi.com/blog/flink-statebackend-operatorstatebackend/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-statebackend-operatorstatebackend/</guid><description>DefaultOperatorStateBackend 是 StateBackend 中最基础，也是相对比较简单的组件。</description><pubDate>Tue, 04 Feb 2020 00:00:00 GMT</pubDate></item><item><title>Flink StateBackend (1) - Overview</title><link>https://www.liaojiayi.com/blog/flink-statebackend-overview/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-statebackend-overview/</guid><description>如果要说 Flink 作为一个流式计算引擎，有什么很 nb 的地方，我觉得 State / StateBackend 算是一个。</description><pubDate>Fri, 31 Jan 2020 00:00:00 GMT</pubDate></item><item><title>Ray - A Distributed Framework for Emerging AI Applications</title><link>https://www.liaojiayi.com/blog/ray/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/ray/</guid><description>关于 Ray 的一些笔记和想法。2018 年开源的 Ray，从创始之初就被不少科技媒体所吹捧是 Spark 在未来的替代品。然而在 Ray 的 paper 中，明确指出了 Ray 是针对 Reinforcement Learning 的需求而设计。</description><pubDate>Fri, 03 Jan 2020 00:00:00 GMT</pubDate></item><item><title>Data Skew（数据倾斜）</title><link>https://www.liaojiayi.com/blog/blink-opt-1-count-distinct/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/blink-opt-1-count-distinct/</guid><description>流式处理中常常会遇到Data Skew，常见的解决思路就是将数据以加盐的方式再一次打散，更大程度的分散到各个流中，然后分两次聚合，完成指标统计。</description><pubDate>Wed, 01 Jan 2020 00:00:00 GMT</pubDate></item><item><title>Calcite Paper</title><link>https://www.liaojiayi.com/blog/calcite-paper/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/calcite-paper/</guid><description>最近在搭建一个SQL引擎，正好再次拜读了一下Calcite的paper(不得不吐槽一下calcite的相关资料确实有些少)。</description><pubDate>Wed, 01 Jan 2020 00:00:00 GMT</pubDate></item><item><title>实时计算系列(3) - 规则引擎和 Flink CEP</title><link>https://www.liaojiayi.com/blog/deep-dive-cep/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/deep-dive-cep/</guid><description>复杂事件处理(CEP)，在企业内部实践中，又常被称作规则引擎。</description><pubDate>Wed, 01 Jan 2020 00:00:00 GMT</pubDate></item><item><title>Flink StateBackend - DefaultOperatorStateBackend</title><link>https://www.liaojiayi.com/blog/flink-statebackend2/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-statebackend2/</guid><description>由于目前已实现的 StateBackend 只对 KeyedStateBackend 进行了重写，所有的 Operator State 都会采用 DefaultOperatorStateBackend 进行 snapshot。</description><pubDate>Mon, 02 Dec 2019 00:00:00 GMT</pubDate></item><item><title>Flink StateBackend - 概览</title><link>https://www.liaojiayi.com/blog/flink-statebackend/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-statebackend/</guid><description>此文讲述如何在 Flink 从 0 构建一个 State Backend。</description><pubDate>Sun, 01 Dec 2019 00:00:00 GMT</pubDate></item><item><title>Flink 和 HDFS 的交互</title><link>https://www.liaojiayi.com/blog/flink-hdfs/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-hdfs/</guid><description>了解 Flink 和 HDFS 之间的交互有助于我们理清 HDFS 可能会给 Flink 带来的问题。</description><pubDate>Mon, 21 Oct 2019 00:00:00 GMT</pubDate></item><item><title>Kryo (Class cannot be created (missing no-arg constructor))</title><link>https://www.liaojiayi.com/blog/kryo/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/kryo/</guid><description>Kryo 可以通过各种方式序列化没有继承 Serializable 的 Java 类，但是当反序列化有些对象时，如不支持无参构造函数的对象，会出现这样的错误。</description><pubDate>Sun, 22 Sep 2019 00:00:00 GMT</pubDate></item><item><title>Rpc In Flink</title><link>https://www.liaojiayi.com/blog/flink-rpc/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-rpc/</guid><description>Apache Flink 在 Dispatcher、JobMaster、ResourceManager、TaskExecutor 几大组件之间采用 akka 进行通信。</description><pubDate>Mon, 09 Sep 2019 00:00:00 GMT</pubDate></item><item><title>Flink CEP</title><link>https://www.liaojiayi.com/blog/flink-cep/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-cep/</guid><description>关于我之前写的 CEP 博客，可以点击这里。由于之前写的相对来说比较粗糙一些，正好最近也要在线上分享 CEP 源码的课程，那么我顺便就从源码的角度，把我对 CEP 的一些理解写在这里。</description><pubDate>Sun, 04 Aug 2019 00:00:00 GMT</pubDate></item><item><title>为什么不使用 RocksDB 做 StateBackend</title><link>https://www.liaojiayi.com/blog/rocksdb/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/rocksdb/</guid><description>RocksDB 是目前最流行的轻量级嵌入式 KV 数据库，Flink 也基于 RocksDB 开发了 RocksDBStateBackend 来作大数据量下的状态存储。</description><pubDate>Tue, 23 Jul 2019 00:00:00 GMT</pubDate></item><item><title>亚马逊领导力准则</title><link>https://www.liaojiayi.com/blog/amazon-principles/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/amazon-principles/</guid><description>这是我在极客时间买的第一个课程，在这里纯粹是当做笔记.</description><pubDate>Thu, 11 Jul 2019 00:00:00 GMT</pubDate></item><item><title>Flink网络栈中反压机制的优化</title><link>https://www.liaojiayi.com/blog/flink-network-stack-opt/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-network-stack-opt/</guid><description>之前总是听到别人说 Flink 本身的反压机制有多么优秀，直到自己真正在应用中碰巧踩到坑，仔细研究后才发现，这个反压机制貌似并不完美。</description><pubDate>Thu, 20 Jun 2019 00:00:00 GMT</pubDate></item><item><title>Disruptor</title><link>https://www.liaojiayi.com/blog/disruptor/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/disruptor/</guid><description>Disruptor是2011年由LMAX提出的一个无锁消息队列，在短短45分钟的视频分享中，有很多的信息可以分享和深究。</description><pubDate>Sun, 16 Jun 2019 00:00:00 GMT</pubDate></item><item><title>Linux性能优化实战笔记</title><link>https://www.liaojiayi.com/blog/geek-linux/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/geek-linux/</guid><description>之前被推荐了极客时间的这个课程，想想也是蛮需要的，在这里记录一下自己对每节的总结和思考。</description><pubDate>Mon, 27 May 2019 00:00:00 GMT</pubDate></item><item><title>Flink - StreamTask With Mailbox</title><link>https://www.liaojiayi.com/blog/streamtask/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/streamtask/</guid><description>前两天看到Flink的dev邮件列表里有一个对StreamTask的重构，今天研读了一下，觉得Flink的开发者们在处理问题上，确实是有点大道至简的感觉。</description><pubDate>Mon, 13 May 2019 00:00:00 GMT</pubDate></item><item><title>Spark Streaming在轻量任务下出现的GC问题</title><link>https://www.liaojiayi.com/blog/jvm-opt/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/jvm-opt/</guid><description>一次Spark故障排查。这个任务的处理过程很简单，从Kafka接收数据，经过打标签的Operator，最后写入Hive。</description><pubDate>Fri, 12 Apr 2019 00:00:00 GMT</pubDate></item><item><title>SparkSQL写入Hive动态分区的优化</title><link>https://www.liaojiayi.com/blog/spark-hive-dynamic/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/spark-hive-dynamic/</guid><description>实际业务中，我们通常会以时间作为分区来建立Hive表，然后在SparkSQL中以动态分区的形式插入，发现一个优化空间。</description><pubDate>Fri, 12 Apr 2019 00:00:00 GMT</pubDate></item><item><title>Influence Without Authority</title><link>https://www.liaojiayi.com/blog/note-influence-without-authority/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/note-influence-without-authority/</guid><description>Influence Without Authority</description><pubDate>Thu, 11 Apr 2019 00:00:00 GMT</pubDate></item><item><title>Database(1) - 谈谈HBase的Transaction</title><link>https://www.liaojiayi.com/blog/hbase-tx/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/hbase-tx/</guid><description>本文讨论 HBase 的 Transaction 机制。</description><pubDate>Tue, 02 Apr 2019 00:00:00 GMT</pubDate></item><item><title>聊聊Apache Flink中的Watermark</title><link>https://www.liaojiayi.com/blog/flink-watermark/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-watermark/</guid><description>本文介绍 Apache Flink 中的 Watermark 机制。</description><pubDate>Sat, 23 Mar 2019 00:00:00 GMT</pubDate></item><item><title>Flink Schedule Mode</title><link>https://www.liaojiayi.com/blog/Flink-Schedule-Mode/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/Flink-Schedule-Mode/</guid><description>Apache Flink中对流式数据和批数据的资源调度模式是不一样的。这周的周更博客，由于有事情耽搁，想的一些东西并没有时间做足够的整理，所以写的话题和内容有些简单，仅做了解。</description><pubDate>Mon, 18 Mar 2019 00:00:00 GMT</pubDate></item><item><title>Flink Meetup - 基于Flink的实时用户行为分析</title><link>https://www.liaojiayi.com/blog/flink-meetup/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-meetup/</guid><description>这是我去年在Flink Meetup北京站的一次分享。主要分享了GrowingIO在实时模块上，技术栈从Spark到Flink的过程中所做的努力和收获的经验。</description><pubDate>Sun, 10 Mar 2019 00:00:00 GMT</pubDate></item><item><title>Aerospike(3) - Evict机制</title><link>https://www.liaojiayi.com/blog/aerospike-evict/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/aerospike-evict/</guid><description>在实时的场景中，我们往往会对Aerospike/Redis等设置evict机制，来防止流量暴增带来的存储系统崩溃。</description><pubDate>Sun, 03 Mar 2019 00:00:00 GMT</pubDate></item><item><title>CEP In Flink (4) - 使用瓶颈</title><link>https://www.liaojiayi.com/blog/CEP-In-Flink-4/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/CEP-In-Flink-4/</guid><description>本文描述了Apache Flink CEP模块中使用的一些瓶颈。</description><pubDate>Wed, 27 Feb 2019 00:00:00 GMT</pubDate></item><item><title>CEP In Flink (3) - 匹配事件提取</title><link>https://www.liaojiayi.com/blog/CEP-In-Flink-3/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/CEP-In-Flink-3/</guid><description>本文描述了Apache Flink CEP模块中匹配事件的提取过程。</description><pubDate>Wed, 20 Feb 2019 00:00:00 GMT</pubDate></item><item><title>摄影图库分类及比较</title><link>https://www.liaojiayi.com/blog/photo-website/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/photo-website/</guid><description>本文描述了500px/东方IC/站酷海洛等图库平台的基本信息。</description><pubDate>Mon, 18 Feb 2019 00:00:00 GMT</pubDate></item><item><title>CEP In Flink (2) - CEP规则匹配</title><link>https://www.liaojiayi.com/blog/CEP-In-Flink-2/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/CEP-In-Flink-2/</guid><description>本文描述了Apache Flink中对CEP规则匹配的原理</description><pubDate>Thu, 14 Feb 2019 00:00:00 GMT</pubDate></item><item><title>Spark - 利用WeakReference来清理对象</title><link>https://www.liaojiayi.com/blog/Spark-WeakReference/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/Spark-WeakReference/</guid><description>最近在stackoverflow上看到有人好奇Spark是在什么时机对Accumulator或者Broadcast这样的变量进行回收的。自己在看源码的时候发现了这个有趣的地方。本文描述了在Spark ContextCleaner中利用WeakReference和referenceQueue来清理无效对象的机制和原理。</description><pubDate>Tue, 12 Feb 2019 00:00:00 GMT</pubDate></item><item><title>仙本那 - Scuba Junkie - 跨年 + 考证</title><link>https://www.liaojiayi.com/blog/scuba-junkie-1/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/scuba-junkie-1/</guid><description>一次很开心的旅行，写成游记分享给大家！本文记录了自己在Scuba Junkie潜水和考证的一个经历。</description><pubDate>Mon, 04 Feb 2019 00:00:00 GMT</pubDate></item><item><title>CEP In Flink (1) - CEP规则解析</title><link>https://www.liaojiayi.com/blog/CEP-In-Flink-1/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/CEP-In-Flink-1/</guid><description>本文描述了Apache Flink中对CEP规则解析的原理</description><pubDate>Fri, 18 Jan 2019 00:00:00 GMT</pubDate></item><item><title>潜水日志</title><link>https://www.liaojiayi.com/blog/deco/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/deco/</guid><description>只是想说，庆幸自己在刚潜水不久就犯了这个错误，而不是等到以后深度更大、环境更恶劣的时候出现。</description><pubDate>Tue, 01 Jan 2019 00:00:00 GMT</pubDate></item><item><title>【译】在物联网中使用Apache Flink的7个原因</title><link>https://www.liaojiayi.com/blog/flink-IoT/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-IoT/</guid><description>本文译自Data Artisans博客，讲解了在物联网中使用Apache Flink的7个原因。</description><pubDate>Sat, 24 Nov 2018 00:00:00 GMT</pubDate></item><item><title>【译】Flink - Savepoint vs Checkpoint</title><link>https://www.liaojiayi.com/blog/flink-savepoint-vs-checkpoint/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-savepoint-vs-checkpoint/</guid><description>本文译自Data Artisans博客，比较了Apache Flink中Savepoint和Checkpoint的异同点。</description><pubDate>Sun, 04 Nov 2018 00:00:00 GMT</pubDate></item><item><title>如何在无Checkpoint时初始化Flink程序的状态？</title><link>https://www.liaojiayi.com/blog/flink-checkpoint/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-checkpoint/</guid><description>本文针对Apache Flink中Checkpoint/Savepoint无法从0恢复的缺点，给出了三种解决方案。</description><pubDate>Thu, 25 Oct 2018 00:00:00 GMT</pubDate></item><item><title>java.lang.OutOfMemoryError: Map failed</title><link>https://www.liaojiayi.com/blog/MapFailed/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/MapFailed/</guid><description>本文记录了一次Map Failed导致的一次JVM OOM故障，给出了原因以及解决办法。</description><pubDate>Thu, 11 Oct 2018 00:00:00 GMT</pubDate></item><item><title>Oracle SQL - CEP语法梳理</title><link>https://www.liaojiayi.com/blog/oracle-cep/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/oracle-cep/</guid><description>实时处理中自然少不了CEP这个重量级功能。其实已经有不少成熟的框架实现了CEP，如Github siddhi和EsperTech，但他们使用了特有的语法来做到开发者的友好交互。那么，把CEP的功能加入到万能的SQL中，是不是很有意思呢？</description><pubDate>Sat, 25 Aug 2018 00:00:00 GMT</pubDate></item><item><title>SQL解析框架 - Calcite</title><link>https://www.liaojiayi.com/blog/calcite/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/calcite/</guid><description>最通用的SQL解析框架 - Calcite</description><pubDate>Fri, 20 Jul 2018 00:00:00 GMT</pubDate></item><item><title>Bitmap - 性能和原理研究</title><link>https://www.liaojiayi.com/blog/bitmap/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/bitmap/</guid><description>本文基于论文描述了多种bitmap的行程原理，以及现在应用最广泛的RoaringBitmap的源码解析和性能优化</description><pubDate>Fri, 06 Jul 2018 00:00:00 GMT</pubDate></item><item><title>Table In Flink</title><link>https://www.liaojiayi.com/blog/flink-1.9</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-1.9</guid><description>之前没有使用过 Table 相关的 API，在这稍微做下记录。</description><pubDate>Fri, 06 Jul 2018 00:00:00 GMT</pubDate></item><item><title>Aerospike(2) - 写机制</title><link>https://www.liaojiayi.com/blog/aerospike-write/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/aerospike-write/</guid><description>本文描述了Aerospike的写机制以及其中存在的问题</description><pubDate>Sun, 03 Jun 2018 00:00:00 GMT</pubDate></item><item><title>hs_err_pid.log - 详解</title><link>https://www.liaojiayi.com/blog/hs-err-pid-log/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/hs-err-pid-log/</guid><description>JVM 错误日志 hs_err_pid.log 详解，包括内存不足、Native memory allocation 失败等问题的原因和解决方案。</description><pubDate>Wed, 11 Apr 2018 00:00:00 GMT</pubDate></item><item><title>Aerospike(1) - Introduction</title><link>https://www.liaojiayi.com/blog/aerospike/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/aerospike/</guid><description>本文描述了Aerospike的应用场景,数据模型,索引等基本原理,并基于Aerospike的优缺点做出了选型建议</description><pubDate>Tue, 20 Mar 2018 00:00:00 GMT</pubDate></item><item><title>Flink - Exactly Once</title><link>https://www.liaojiayi.com/blog/flink-exactly-once/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/flink-exactly-once/</guid><description>本文介绍 Flink 中的 Exactly Once 语义。</description><pubDate>Tue, 20 Mar 2018 00:00:00 GMT</pubDate></item><item><title>排序算法</title><link>https://www.liaojiayi.com/blog/sort-algorithms-md/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/sort-algorithms-md/</guid><description>排序很基础，但是不同的排序算法所使用的思想不一样，还是很值得借鉴学习的。为了给自己巩固一下，手码一遍所有简单排序的代码。</description><pubDate>Fri, 23 Sep 2016 00:00:00 GMT</pubDate></item><item><title>编程基础</title><link>https://www.liaojiayi.com/blog/programming-basic/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/programming-basic/</guid><description>一些平时不常接触但是很重要的基础知识。</description><pubDate>Tue, 23 Aug 2016 00:00:00 GMT</pubDate></item><item><title>Leetcode</title><link>https://www.liaojiayi.com/blog/leetcode/</link><guid isPermaLink="true">https://www.liaojiayi.com/blog/leetcode/</guid><description>Leetcode 题目解答记录。</description><pubDate>Fri, 22 Jul 2016 00:00:00 GMT</pubDate></item></channel></rss>