Archives
All the articles I've archived.
-
OSDI 2022 - Orca: A Distributed Serving System for Transformer-Based Generative Models
OSDI 2022 Orca 论文阅读笔记,梳理迭代级调度、选择性批处理与生成式模型分布式推理服务的系统设计。
-
ICCV 2025 - AdaLLaVA: Learning to Inference Adaptively for Multimodal Large Language Models
由威斯康星大学麦迪逊分校(University of Wisconsin-Madison)、普渡大学(Purdue University)、香港大学(The …
-
ISOCC 2020 - Efficient TSV Fault Detection Scheme For High Bandwidth Memory Using Pattern Analysis
高带宽内存(High Bandwidth Memory,HBM)的通道可以通过 128 个数据硅通孔(Through-Silicon Via,TSV)和 16…
-
SOSP 2025 - ByteRobust: Robust LLM Training Infrastructure at ByteDance
由香港大学和字节seed联合发布的LLM Traing的可靠性研究,详细介绍了用于支持大规模 GPU 集群稳定运行的管理系统 ByteRobust…
-
API Agent: Embedding, MCP, Skills
Updated:基于 Gemini API Cookbook 的 Agent 实操笔记,梳理 Embedding、Function Calling、MCP、Skills 与编排层关系。
-
CMU-15213-MallocLab
CMU 15-213 课程 Malloc Lab 实验记录,从隐式空闲链表到显式空闲链表实现动态内存分配器,最终得分 85/100。
-
CMU-15213-ShellLab
CMU 15-213 课程 Shell Lab 实验记录,实现带作业控制的 Unix Shell,涉及进程控制、信号处理与并发。
-
Ascend C 算子开发 Part5 PyTorch 算子调用与阶段总结
Ascend C 算子开发第五部分,介绍 PTA 适配框架(torch-npu)与 PyTorch 算子集成方式,并对全系列进行阶段性总结。
-
OSDI 2018 - Ray: A Distributed Framework for Emerging AI Applications
OSDI 2018 论文阅读笔记:Ray — 面向新兴 AI 应用的分布式计算框架。
-
OSDI 2024 - ServerlessLLM: Low-Latency Serverless Inference for Large Language Models
OSDI 2024 论文阅读笔记:ServerlessLLM — 面向大语言模型的低延迟 Serverless 推理系统。
-
CMU-15213-CacheLab
CMU 15-213 课程 Cache Lab 实验记录,实现缓存模拟器与矩阵转置优化,深入理解缓存命中率与分块策略。
-
Ascend C 算子开发 Part4 算子调用与测试
Ascend C 算子开发第四部分,讲解自定义算子的两种调用方式及对应测试方法。
-
Ascend C 算子开发 Part3 算子交付件与算子工程
Ascend C 算子开发第三部分,介绍 HOST/DEVICE 交付件结构、编译工作流与算子工程组织方式。
-
CMU-15213-ArchitectureLab
CMU 15-213 课程 Architecture Lab 实验记录,基于 Y86-64 指令集实现流水线处理器的设计与优化。
-
Ascend C 算子开发 Part2 Tiling 计算与调试
Ascend C 算子开发第二部分,深入讲解 Tiling 计算模式、数据切分策略与算子调试方法。
-
CMU-15213-AttackLab
CMU 15-213 课程 Attack Lab 实验记录,涉及缓冲区溢出攻击、ROP 等系统安全技术。
-
CMU-15213-BombLab
CMU 15-213 课程 Bomb Lab 实验笔记,通过反汇编与 GDB 调试破解六个关卡。
-
Ascend C 算子开发 Part1 基本概念
华为 Ascend C 算子开发系列第一部分,介绍 CANN 架构、Ascend C 编程模型及基本概念。
-
SOSP 2024 - Colloid: Tiered Memory Management: Access Latency is the Key!
SOSP 2024 论文阅读笔记:Colloid — 分层内存管理中基于访问延迟的热页面负载均衡机制。
-
使用OneDrive的三年经验与不得不知的警告
三年 OneDrive 使用经验总结与重要警告,包括文件同步陷阱、数据丢失风险及最佳实践。
-
进化算法 - EA 与 GA
研究生课程学习笔记:进化算法(EA)与遗传算法(GA)的核心概念,覆盖表示法、亲本选择、重组变异与生存选择,并以 TSP 问题为例实践。
-
arXiv 2024 - Characterization of Large Language Model Development in the Datacenter
arXiv 2024 论文阅读笔记,概括数据中心内大语言模型开发负载、故障、资源利用与调度优化机会。
-
群体智能 Part 1 - PSO
群体人工智能研究笔记第一部分:粒子群优化算法 (PSO) 的原理、数学模型与应用。
-
算法数论基础
算法竞赛中常用的数论基础知识总结,包括快速幂、GCD、素数筛、欧拉函数等核心算法。
-
MindSpore 专题:第一章、安装
MindSpore 入门系列第一章,记录 Ubuntu 虚拟机环境、VMware Tools 修复与 MindSpore 安装过程。
-
MindSpore 专题:第二章、快速尝试
MindSpore 入门系列第二章,围绕 MNIST 示例记录数据处理、模型构建、损失函数与训练流程的初次尝试。
-
MindSpore 专题:第三章、张量
MindSpore 入门系列第三章,整理 Tensor 的基本概念、创建方式、属性与常见张量操作。
-
MindSpore 专题:第四章、数据集
MindSpore 入门系列第四章,以 MNIST 为例记录 mindspore.dataset 的加载、转换与批处理用法。
-
MindSpore 专题:第五章、网络构建
MindSpore 入门系列第五章,介绍使用 nn.Cell、网络层和 Tensor 操作构建神经网络模型。
-
MindSpore 专题:第六章、函数式自动微分
MindSpore 入门系列第六章,从神经网络训练直觉出发,记录函数式自动微分、梯度计算与反向传播概念。
-
MindSpore 专题:第七章、模型训练
MindSpore 入门系列第七章,记录数据集构建、模型定义、损失函数、优化器以及训练评估流程。
-
MindSpore 专题:番外、Transformer 模型
MindSpore 入门系列番外篇,整理 Transformer、注意力机制、多头注意力与位置编码的基础结构。
-
树上最短回文问题
算法题解笔记,讨论树上路径回文判定问题,并从字符串回文、哈希、二分与马拉车算法引出解法思路。