Forrest Hu's Blogs
技术、架构与生活随笔 · 共 445 篇文章
-
ECC:给 AI 编程助手装一套"工程体系"
affaan-m/ECC 自称 “The agent harness performance optimization system”。它不是一个新的 AI 编程工具,而是一套装在已有 agent harness(Claude Code、Codex、Cursor、OpenC...
-
实时训练
(未完成) 简介(未完成)推荐/广告系统是在线学习的理想应用之一。推荐系统有很自然的标签——如果一位用户点击一个推荐,那么这个预测就是正确的。 并非所有推荐系统都需要在线预测。用户对房子、汽车、航班和酒店的偏好不太可能过一分钟就变了,因此对于这样的系统,持续学习并不太合...
-
《大数据经典论文解读》 三驾马车学习
前言 前言 GFS论文 MapReduce Bigtable Bigtable 的整体架构 单机存储 分布式锁Chubby 从两阶段提交到 CAP 问题 Paxos 通过 Chubby ...
-
Spark 内存管理及调优
前言内存划分及用途 内存区域划分 堆内内存 对外内存spark.memory.offHeap.enabled 作用 内存空间总大小 spark.executor.memory ...
-
Yarn学习
前言YARN 在字节跳动的优化与实践Yarn 的整体架构Yarn 是 Hadoop2.x 版本提出的一种全新的资源管理架构,基于主从(Master-Slave)模式,主要由 ResourceManager(RM)和NodeManager(NM)两大部分组成。除此之外,还有 ...
-
从Spark部署模式开始讲源码分析
前言既然是分布式系统,就绕不开部署模式。部署模式一篇文章读懂:Spark运行模式运行Spark的应用程序,其实仅仅需要两种角色,Driver和Executor。Driver负责将用户的应用程序划分为多个Job,分成多个Task,将Task提交到Executor中运行。Exe...
-
分布式链路追踪
简介 数据收集分布式链路跟踪中的traceid和spanid代表什么?在分布式链路跟踪中有两个重要的概念:跟踪(trace)和 跨度( span)。从客户端发起请求抵达系统的边界开始,记录请求流经的每一个服务,直到向客户端返回响应为止,这整个过程就叫做一次Trace。由于...
-
helm
简介 Kustomize helm 原理 模板文件 Kubernetes 会是容器化崛起之路的终点线吗?它达到了人们对云原生时代技术基础设施的期望了吗?从易用角度来看,坦白说差距还非常大。云原生基础设施的其中一个重要目标,是接管掉业...
-
容器狂占内存资源怎么办?
简介 Linux内存管理的机制与特点 OOM Killer Memory Cgroup swap Linux内存管理的问题与解决 公平性问题 内存回收时的内存使用量的保证(锁定)能力 ...
-
多角度理解一致性
简介 从读写角度 线性一致性 顺序一致性 因果一致性 最终一致性 从其它维度 从“允许/不允许哪些操作顺序发生”角度 Quorum 机制 其它陈现麟:最早研究一致性的场景并不是分布式系统,而是多路处理器。...