• 实时计算系列(4) - Failover in Flink Liao Jiayi Liao Jiayi #Flink#Failover#Apache Flink

    本文介绍 Flink 中的 Failover 机制。

  • Flink 的容错机制以及弱一致性快照 Liao Jiayi Liao Jiayi #Flink#Apache Flink

    本文聊聊 Flink 中的容错机制及其存在的常见问题,以及在生产实践中遇到的弱一致性场景和解决方案。

  • Why not RocksDB in Streaming State? Liao Jiayi Liao Jiayi #Flink#RocksDB#Apache Flink

    本文以 Apache Flink 为例,聊聊为什么 RocksDB 不是流计算引擎中理想的状态存储。Flink 中使用 RocksDB 作为大状态的存储后端,但在实际线上大规模的生产应用中,我们发现 RocksDB 和流计算场景的组合,即使在参数调优及技术优化后,也始终达不到预期的理想状态。

  • Hazelcast Jet - Low-latency Stream Processing at the 99.99th Percentile Liao Jiayi Liao Jiayi #Flink#Apache Flink

    原文:Hazelcast Jet: Low-latency Stream Processing at the 99.99th Percentile,Hazelcast Jet 是一个流处理引擎,整篇论文通读下来,它的定位和当前广为应用的流计算引擎 Apache Flink 和 Spark Streaming 又有些不同。

  • 如何自定义 Flink State 使用的 Serializer Liao Jiayi Liao Jiayi #Flink#Apache Flink

    自定义 Flink State 的序列化方式是一种高阶的使用技巧,在很多复杂场景下,通过自定义 Serializer 可以在兼容性、性能等方面获得一定的收益。

  • Flink RocksDB 内存管理 Liao Jiayi Liao Jiayi #Apache Flink

    RocksDB 的内存管理在 Flink 1.10 版本之前是不受管控的,社区利用 RocksDB 已有的一些内存控制上的优化,在去年对 Flink 中 RocksDB 的使用做了一系列的改造。

  • 解决实时推荐场景下数据断流问题-单点恢复功能介绍 Liao Jiayi Liao Jiayi #Apache Flink

    本文摘自我在字节跳动技术公众号上发布的文章。在字节跳动的实时推荐场景中,我们使用 Flink 将用户特征与用户行为进行实时拼接,拼接后的实例会更新后端推荐模型,对用户的实时推荐产生影响。

  • 流式计算未来的发展趋势 Liao Jiayi Liao Jiayi #流式计算#streaming#Apache Flink

    受 SIGMOD 会议的论文 Beyond Analytics: The Evolution of Streaming Processing Systems 的启发,聊一下流式计算未来的趋势。

  • Flink 是如何统一批流引擎的? Liao Jiayi Liao Jiayi #Apache Flink

    2015 年,Flink 的作者就写了 Apache Flink: Stream and Batch Processing in a Single Engine 这篇论文。本文以这篇论文为引导,详细讲讲 Flink 内部是如何设计并实现批流一体的架构。

  • Flink - Network Buffer Liao Jiayi Liao Jiayi #Flink#network#Apache Flink

    Flink 中 Network Buffer 相关知识。

  • Flink StateBackend - DefaultOperatorStateBackend Liao Jiayi Liao Jiayi #Flink#Apache Flink

    由于目前已实现的 StateBackend 只对 KeyedStateBackend 进行了重写,所有的 Operator State 都会采用 DefaultOperatorStateBackend 进行 snapshot。

  • Flink StateBackend - 概览 Liao Jiayi Liao Jiayi #Flink#Apache Flink

    此文讲述如何在 Flink 从 0 构建一个 State Backend。

  • Flink 和 HDFS 的交互 Liao Jiayi Liao Jiayi #Flink#Apache Flink

    了解 Flink 和 HDFS 之间的交互有助于我们理清 HDFS 可能会给 Flink 带来的问题。

  • Rpc In Flink Liao Jiayi Liao Jiayi #Apache Flink

    Apache Flink 在 Dispatcher、JobMaster、ResourceManager、TaskExecutor 几大组件之间采用 akka 进行通信。

  • 为什么不使用 RocksDB 做 StateBackend Liao Jiayi Liao Jiayi #Database#Apache Flink

    RocksDB 是目前最流行的轻量级嵌入式 KV 数据库,Flink 也基于 RocksDB 开发了 RocksDBStateBackend 来作大数据量下的状态存储。

  • Flink网络栈中反压机制的优化 Liao Jiayi Liao Jiayi #Flink#Apache Flink

    之前总是听到别人说 Flink 本身的反压机制有多么优秀,直到自己真正在应用中碰巧踩到坑,仔细研究后才发现,这个反压机制貌似并不完美。

  • Flink - StreamTask With Mailbox Liao Jiayi Liao Jiayi #Flink#Apache Flink

    前两天看到Flink的dev邮件列表里有一个对StreamTask的重构,今天研读了一下,觉得Flink的开发者们在处理问题上,确实是有点大道至简的感觉。

  • 聊聊Apache Flink中的Watermark Liao Jiayi Liao Jiayi #Flink#Watermark#Apache Flink

    本文介绍 Apache Flink 中的 Watermark 机制。

  • Flink Schedule Mode Liao Jiayi Liao Jiayi #Flink#Apache Flink

    Apache Flink中对流式数据和批数据的资源调度模式是不一样的。这周的周更博客,由于有事情耽搁,想的一些东西并没有时间做足够的整理,所以写的话题和内容有些简单,仅做了解。

  • Flink Meetup - 基于Flink的实时用户行为分析 Liao Jiayi Liao Jiayi #Flink#meetup#Apache Flink

    这是我去年在Flink Meetup北京站的一次分享。主要分享了GrowingIO在实时模块上,技术栈从Spark到Flink的过程中所做的努力和收获的经验。

  • 【译】在物联网中使用Apache Flink的7个原因 Liao Jiayi Liao Jiayi #IoT#Flink#Apache Flink

    本文译自Data Artisans博客,讲解了在物联网中使用Apache Flink的7个原因。

  • 【译】Flink - Savepoint vs Checkpoint Liao Jiayi Liao Jiayi #Flink#Checkpoint#Apache Flink

    本文译自Data Artisans博客,比较了Apache Flink中Savepoint和Checkpoint的异同点。

  • 如何在无Checkpoint时初始化Flink程序的状态? Liao Jiayi Liao Jiayi #Flink#Checkpoint#Apache Flink

    本文针对Apache Flink中Checkpoint/Savepoint无法从0恢复的缺点,给出了三种解决方案。

  • Table In Flink Liao Jiayi Liao Jiayi #Flink#Apache Flink

    之前没有使用过 Table 相关的 API,在这稍微做下记录。

  • Flink - Exactly Once Liao Jiayi Liao Jiayi #Flink#Exactly-once#Apache Flink

    本文介绍 Flink 中的 Exactly Once 语义。