avatar
文章
271
标签
340
分类
78
关于笔者
主页
博文
  • 分类
  • 标签
  • 归档
友链
留言板
Roger-Lv's space
搜索
关于笔者
主页
博文
  • 分类
  • 标签
  • 归档
友链
留言板

Roger-Lv's space

LLM 推理的 AF 分离与 PD 分离—— disaggregation 全解
发表于2026-07-21|大模型系统
LLM 推理的 AF 分离与 PD 分离——disaggregation 全解 本文讲清现代 LLM 推理 serving 里的两类"分离(disaggregation)“技术:PD 分离(Prefill-Decode 分离) 和 AF 分离(Attention-FFN 分离)。两者都是把原本"混在一起跑"的工作流按资源/瓶颈差异拆开,独立调度、独立优化、必要时独立部署。读完你能回答面试官"为什么要把 prefill 和 decode 拆开”“KV cache 怎么跨节点搬”“attention 和 FFN 为什么能分离”“两者能不能叠加用”。 术语说明:PD 分离是业界共识术语(Splitwise/Mooncake/DistServe)。AF 分离术语相对不那么标准化,本文取Attention-FFN 分离/解耦的含义——把 Transformer 内的 attention 计算与 FFN(MLP) 计算解耦,做算子级或微批级重叠调度(DeepSeek Dual-Batch Overlap 思路)。若你语境里的 AF 另有含义(如 As...
Meta-Evolution Genesis Agent (MEGA)——A Spec-Driven Framework for Bootstrapping Cross-Domain Self-Evolving Agents
发表于2026-07-21|Agent
Meta-Evolution Genesis Agent (MEGA) Meta-Evolution Genesis Agent (MEGA) · 昵称 元神 A Spec-Driven Framework for Bootstrapping Cross-Domain Self-Evolving Agents 研究构想文档(research idea / position paper draft)。作者:lvzhongrenjie 日期:2026-07-21 关联:自进化智能体研究综述(~/Documents/实习/)、alcor-chaos 排障自进化 agent(已有,作为已验证的一个领域实例) 系统名 MEGA = Meta-Evolution Genesis Agent;Meta-Evolution 命名二阶贡献(进化进化器),Genesis 命名 bootstrap,Agent = M 本身。 0. 一句话 MEGA(元神)是一个 spec-driven 的跨域 meta 进化层:本身是一个 evolver(跑在 Claude Code/Codex 等任意 ...
vLLM 源码精读——高吞吐 LLM 推理引擎全景
发表于2026-07-20|大模型系统
vLLM 源码精读——高吞吐 LLM 推理引擎全景 本文基于 vLLM 源码 vllm/v1/(V1 引擎架构)。目标:让你在面试时能从"为什么传统 serving 显存利用率只有 20%“讲到"PagedAttention 的 block 怎么管”、从"prefill/decode 不再分阶段"讲到"continuous batching 的 token-budget 调度"、从"prefix caching + 拷贝写"讲到"V1 的 async scheduler + CUDA Graph + spec decode"。读完这篇,vLLM 这关基本通杀。 一、vLLM 要解决什么问题、为什么面试必问 传统 LLM serving(朴素 batch)有两个致命问题: KV cache 显存碎片化:为每个请求预分配一段连续 KV 显存,请求长短不一→产生大量内部碎片+外部碎片,实测显存利用率常低于 20%;且无法在请求间复用相同前缀。 批处理不连续:朴素做法是"...
Megatron Timers 源码精读——分布式训练性能打点
发表于2026-07-20|大模型系统
Megatron Timers 源码精读——分布式训练性能打点 本文精读 Megatron-Core 的 megatron/core/timers.py(约 300 行)。目标:让你面试时能讲清"训练里怎么打点测一段算子耗时、为什么必须 torch.cuda.synchronize()、为什么分布式打点要跨 rank 聚合、log_level/DummyTimer 的开销控制怎么做"。这是个"小而完整"的子系统,特别适合讲清"分布式时序测量的陷阱"。 一、为什么需要专门的 Timer 训练几百亿参数、几千卡,一句"前向多快"没法用 time.time() 包一下就答——它有四个坑: GPU 异步:PyTorch 的 CUDA op 是异步 launch,CPU 侧 time.time() 测的是"把 kernel 丢进队列"的时间,不是 GPU 真跑完的时间。必须 torch.cuda.synchronize() 强制等 GPU 空闲再取时间。 多 rank 不同步:上千张...
GPU Kernel、异步 Launch、Stream 与融合 Kernel 全解
发表于2026-07-20|GPU
GPU Kernel、异步 Launch、Stream 与融合 Kernel 全解 本文目标:把"GPU 在跑 kernel"这件事从原理讲到工程——kernel 是什么、CPU/GPU 怎么协作、为什么 launch 是异步、synchronize 和 stream 怎么用、为什么要融合 kernel、怎么写/怎么调。读完你能回答面试官"你说的 kernel 是什么"“为什么 PyTorch op 测时间要 sync”“stream 是干什么的”“为什么要融合算子”。 和前面几篇呼应:Megatron Timer 反复强调 cuda.synchronize(),本篇讲清它为什么是命门。 一、先澄清:此 kernel 非彼 kernel “kernel” 有两个常见含义,别混: 操作系统内核 GPU kernel 是什么 OS 的核心,常驻 ring0 管硬件 一段在 GPU 上并行执行的函数 谁跑 CPU GPU 上成千上万个线程 例子 Linux kernel、Windows kernel vector_a...
Megatron Timer Predictor——训练 Straggler 在线检测与定位系统
发表于2026-07-20|大模型系统
Megatron Timer Predictor——训练 Straggler 在线检测与定位系统 本文记录我设计并落地的 Megatron Timer Predictor(mt-detector):一个针对 Megatron-LM 大规模分布式训练中性能落后节点(Straggler)问题的检测与定位系统。它从 ClickHouse 读 Megatron Timer 已落盘的全 rank 时序指标,经"6 种聚类算法 + 跨算法投票"识别异常 rank,再针对流水线并行(PP)场景做通信异常检测 + 交叉验证定位网络拥塞节点,多进程并发把分析压到 30 秒内。 说明:项目名里 “Predictor/预测” 是个 misnomer——系统做的是当前态检测/分类(哪些 rank 现在慢),不做时序外推或"未来哪步会慢"的预测。下文"预测"一律按"检测/标记当前异常 rank"理解。 背景知识:Megatron Timer 怎么采时序、为什么跨 rank all-gather 取 max,见本人《M...
Claude Code Harness 设计精读——从源码看 Agent 运行时
发表于2026-07-20|Agent 系统
Claude Code Harness 设计精读——从源码看 Agent 运行时 本文基于 Claude Code 的 TypeScript 源码(src/)精读,讲清一个核心问题:“harness” 到底是什么、它由哪些子系统构成、它们怎么协作把"一次用户输入"变成"一串工具调用 + 最终回答"。 注:参考的某篇中文专栏文章无法访问,本文以源码为唯一事实来源,结构上覆盖 harness 的全部关键面。 一、什么是 harness——Agent 的"操作系统层" 在 Agent / LLM 工程语境里,harness 指包在模型之外的运行时——模型本身只会"输入文本→输出文本",但一个能干活的 Agent 需要: 维护对话历史和上下文窗口(长了要压缩) 把模型输出的 tool_use 解析出来、调度执行、把结果喂回模型 控制工具的并发/串行、权限、安全 在出错、超 token、被打断时正确恢复 管子代理、计划模式、hooks、内存、技能、任务 这些"模型不管的工程事"加起...
Megatron-LM 源码精读——大模型并行训练全景
发表于2026-07-19|大模型系统
Megatron-LM 源码精读——大模型并行训练全景 https://blog.csdn.net/Antai_ZHU/article/details/144409187 本文基于 NVIDIA Megatron-LM 源码(megatron/core/,即 Megatron-Core)。目标:让你在面试时能从"5D 并行 + rank 排布"讲到"ColumnParallelLinear 的 autograd 通信插入"、从"1F1B vs Interleaved"讲到"DDP 的 param/grad buffer 与 distributed optimizer"、从源码结构讲到工程取舍。读完这篇,Megatron 这关基本通杀。 一、Megatron 是什么、为什么面试要问 Megatron-LM 是 NVIDIA 开源的大模型分布式训练框架,论文从 2019(张量并行)一路到 2022(PP+SP)、2023(CP、MoE)。它的核心价值是把"怎么把一个 Transformer...
x86 体系结构基础——特权级、中断异常、内存与总线
发表于2026-07-18|体系结构
x86 体系结构基础——特权级、中断异常、内存与总线 本文目标:给机器学习系统工程师/虚拟化初学者打底——把 x86 上"软件如何与硬件协作"的全链路讲清。从特权级 ring0~ring3 出发,串到用户态/内核态切换、中断与异常、MMU 与页表、DMA、PCIe 总线、最后到 IOMMU。读完你能解释"为什么虚拟化需要 VT-x/EPT、为什么容器隔离要靠内核、为什么 GPU 能直接读写内存"。 一、全景:一次系统调用穿越了多少层 先给一张全景,后面逐层拆: 12345678910应用(用户态, ring3) │ write(fd, buf, n) ← 软中断/syscall 指令 ▼内核(内核态, ring0) ← 特权切换: 保存现场、查页表、设驱动 │ 驱动程序 ▼设备(网卡/GPU/磁盘, DMA) ← 通过 PCIe 总线直接读写内存 │ ← MMU 翻译 CPU 地址, IOMMU 翻译设备地址 ▼物理内存(DRAM) 这五件事——特权级...
操作系统接口——fork/exec/wait、mmap、ioctl、epoll 与共享内存
发表于2026-07-18|操作系统
操作系统接口——fork/exec/wait、mmap、ioctl、epoll 与共享内存 本文目标:把 Linux 系统编程最核心的几个接口讲透——进程生命周期(fork/exec/wait)、内存映射(mmap)、设备控制(ioctl)、I/O 多路复用(epoll)、以及共享内存。这些是理解容器、虚拟化、RDMA、高性能网络、ML 推理框架的底层地基。读完你能回答"为什么 fork 后 exec 是两步"“mmap 怎么实现零拷贝”“epoll 为什么比 select 快”“共享内存为什么是最快 IPC”。 一、全景:进程的一生 先把进程的全生命周期摆出来,几个接口各司其职: 123456789101112131415父进程 │ │ fork() ── 复制自己,产生子进程(复制页表,COW) ├──────────► 子进程 │ │ │ │ exec() ── 替换代码段,加载新程序(此时子进程"变身") │ ...
1…567…28
avatar
Roger-Lv
Send a flare and light the way.
文章
271
标签
340
分类
78
Follow Me
公告
Welcome!
最新文章
Linux 内核模块程序结构:五要素、宏展开,以及教程里常见的四个错误2026-09-11
RDMATracer 拆解:13 个 eBPF 探针如何补上 AI 集群的内核盲区2026-09-11
RDMA 全链路拆解:从 ibv_reg_mr 到硬件,再到 AI 训练平台的实战落点2026-09-11
Kthena 实战解析:让 Kubernetes 真正理解 Prefill、Decode 和 KV Cache2026-09-10
云多租户网络隔离全景:从 Hypervisor 到 VNI,一层层看懂租户是怎么被隔开的2026-09-03
分类
  • AI Infra16
  • AIInfra5
  • Agent27
  • Agent 安全2
  • Agent 系统1
  • Agent基础设施2
  • Agent工程1
  • CUDA1
标签
仿真集群 KServe LLM 八股 6.824 算法 容错 Python 线程池 资源共享 InfiniBand 长上下文管理 HuatuoGPT2 数据中心 Kube-OVN anaconda 推理部署 AMD 人工智能 Sandbox 消息队列 分布式系统 OpenSandbox WSL AutoGen 资源调度 Redis AI-Infra Volcano 深度学习 disaggregation C++ 数字化 命理 MicroVM 动态规划 KV Cache 多模态 deepresearch 显卡
归档
  • 九月 2026 8
  • 八月 2026 31
  • 七月 2026 31
  • 五月 2026 6
  • 四月 2026 2
  • 三月 2026 3
  • 二月 2026 2
  • 一月 2026 5
网站信息
文章数目 :
271
本站访客数 :
本站总浏览量 :
最后更新时间 :
©2024 - 2026 By Roger-Lv
搜索
数据加载中