Zing 论坛

正文

大语言模型系统研究全景:从训练到部署的系统性论文资源库

一份精心整理的大语言模型系统相关学术论文、教程和项目资源列表,涵盖预训练、后训练、推理服务、多模态系统、Agent系统等关键领域,是LLM系统研究者的必读指南。

大语言模型系统分布式训练模型并行推理优化LLM Serving多模态系统Agent系统机器学习系统GPU集群优化MoE训练
发布时间 2026/06/21 12:43最近活动 2026/06/21 12:48预计阅读 2 分钟
大语言模型系统研究全景:从训练到部署的系统性论文资源库
1

章节 01

【导读】大语言模型系统研究全景资源库介绍

由AmberLJC维护的GitHub资源库LLMSys-PaperList,持续更新大语言模型系统相关学术论文、教程和项目资源,涵盖预训练、后训练、推理服务、多模态系统、Agent系统等关键领域,是LLM系统研究者的必读指南,系统性梳理2019年至今该领域的演进脉络。

2

章节 02

背景:LLM系统研究的重要性与资源库意义

随着ChatGPT、Claude等大语言模型爆发式发展,AI领域面临底层系统架构的苛刻要求,从分布式训练并行策略优化到推理服务延迟与吞吐量平衡,再到多模态数据处理效率,均需系统级创新。LLMSys-PaperList作为学术文献地图,为该领域研究者提供系统性梳理。

3

章节 03

资源库概览:覆盖LLM系统全生命周期的核心领域

资源库按技术栈和应用场景划分核心领域:

  1. 预训练系统:如Megatron-LM模型并行方案、字节跳动MegaScale万卡训练实践;
  2. 后训练与RLHF系统:高效微调策略、奖励模型训练及PPO分布式实现;
  3. 推理服务系统:显存管理、KV缓存优化、动态批处理、边缘设备运行;
  4. Agent系统:工具调用优化、多轮对话状态管理、外部系统安全交互;
  5. 多模态系统:GPT-4V/Gemini相关数据加载、特征提取、跨模态注意力计算挑战。
4

章节 04

关键技术演进:2024-2026年LLM系统的突破与前沿

2024年:字节跳动MegaScale万卡训练、DeepSeek-V3 MoE训练优化、阿里巴巴HPN数据中心网络架构; 2025年:ByteScale 12000+GPU训练2048K上下文模型、TileLink编程原语、Flex Attention注意力优化; 2026年:AXLearn异构基础设施模块化训练、Arena动态调度与自适应并行协同设计。

5

章节 05

实用价值:不同人群如何从资源库获益

系统研究者:获取完整文献地图,快速定位经典与顶会前沿成果; 工程实践者:学习工业界实践经验(故障恢复、负载均衡、网络优化等); 学习者:通过MLSys课程等资源获得系统学习路径。

6

章节 06

结语:LLM系统研究的时代机遇与资源库的持续意义

LLM系统研究处于快速发展期,新硬件、算法与系统创新层出不穷。该资源库不仅整理已有成果,更作为持续更新的知识枢纽,为研究者、工程师、学习者提供探索LLM系统前沿的可靠指南。