Forrest Hu's Blogs

技术、架构与生活随笔 · 共 445 篇文章

  1. ECC:给 AI 编程助手装一套"工程体系"

    affaan-m/ECC 自称 “The agent harness performance optimization system”。它不是一个新的 AI 编程工具,而是一套装在已有 agent harness(Claude Code、Codex、Cursor、OpenC...

  2. 实时训练

    (未完成) 简介(未完成)推荐/广告系统是在线学习的理想应用之一。推荐系统有很自然的标签——如果一位用户点击一个推荐,那么这个预测就是正确的。 并非所有推荐系统都需要在线预测。用户对房子、汽车、航班和酒店的偏好不太可能过一分钟就变了,因此对于这样的系统,持续学习并不太合...

  3. 《大数据经典论文解读》 三驾马车学习

    前言 前言 GFS论文 MapReduce Bigtable Bigtable 的整体架构 单机存储 分布式锁Chubby 从两阶段提交到 CAP 问题 Paxos 通过 Chubby ...

  4. Spark 内存管理及调优

    前言内存划分及用途 内存区域划分 堆内内存 对外内存spark.memory.offHeap.enabled 作用 内存空间总大小 spark.executor.memory ...

  5. Yarn学习

    前言YARN 在字节跳动的优化与实践Yarn 的整体架构Yarn 是 Hadoop2.x 版本提出的一种全新的资源管理架构,基于主从(Master-Slave)模式,主要由 ResourceManager(RM)和NodeManager(NM)两大部分组成。除此之外,还有 ...

  6. 从Spark部署模式开始讲源码分析

    前言既然是分布式系统,就绕不开部署模式。部署模式一篇文章读懂:Spark运行模式运行Spark的应用程序,其实仅仅需要两种角色,Driver和Executor。Driver负责将用户的应用程序划分为多个Job,分成多个Task,将Task提交到Executor中运行。Exe...

  7. 分布式链路追踪

    简介 数据收集分布式链路跟踪中的traceid和spanid代表什么?在分布式链路跟踪中有两个重要的概念:跟踪(trace)和 跨度( span)。从客户端发起请求抵达系统的边界开始,记录请求流经的每一个服务,直到向客户端返回响应为止,这整个过程就叫做一次Trace。由于...

  8. helm

    简介 Kustomize helm 原理 模板文件 Kubernetes 会是容器化崛起之路的终点线吗?它达到了人们对云原生时代技术基础设施的期望了吗?从易用角度来看,坦白说差距还非常大。云原生基础设施的其中一个重要目标,是接管掉业...

  9. 容器狂占内存资源怎么办?

    简介 Linux内存管理的机制与特点 OOM Killer Memory Cgroup swap Linux内存管理的问题与解决 公平性问题 内存回收时的内存使用量的保证(锁定)能力 ...

  10. 多角度理解一致性

    简介 从读写角度 线性一致性 顺序一致性 因果一致性 最终一致性 从其它维度 从“允许/不允许哪些操作顺序发生”角度 Quorum 机制 其它陈现麟:最早研究一致性的场景并不是分布式系统,而是多路处理器。...