PyTorch团队首发技术路线图，近百页文档披露2024下半年发展方向

2024-07-15 阅读 7 收藏 0 评论 0 限时评论得现金

零小柒

粉丝 0 文章 6432 收藏 0

训练

PyTorch原生支持的并行模式主要包括以下几种：

– 完全分片数据并行（full sharded data parallel，FSDP）

– 混合分片数据并行（hybrid sharding data parallel，HSDP）

– 张量并行（tensor parallel，TP）

– 流水线并行（pipeline parallel，PP）

– 序列并行（sequence parallel，SP）

– 上下文并行（context parallel，CP）

PyTorch希望在TorchTitan中将各种并行方式进一步模块化，让开发者可以自由组合，根据需要实现N维并行。

PyTorch团队首发技术路线图，近百页文档披露2024下半年发展方向

文档中特别提到，对MoE和多模态这两种新兴的架构需要添加支持，比如专家并行、路由算法的优化。

除了TorchTitan本身的更新，分布式团队还需要与编译器团队进一步紧密合作，更好地与torch.compile模块集成，为大规模分布式场景带来额外的性能提升。

微调与推理

微调：联合torchtune，将FSDP2 LoRA/QLoRA方案投入使用，以及支持模型状态字典的NF4量化

推理：PP和DP已经成为分布式API的核心，下一步需要关注torchtitan的分布式推理，支持大模型PP+异步TP方式，将给出案例展示

文档中还提到，会将HuggingFace的推理API从PiPPy迁移到PyTorch（由HuggingFace完成）。

torchtune、TorchRec、TorchVision

torchtune

torchtune的推出旨在帮助用户更方便微调LLM，这也是官方给出的Llama模型微调的方案。

torchtune定义的「微调」范围非常广，主要可以概括为三类场景：

– 对特定领域数据集或者下游任务的模型适应

– 奖励和偏好建模，比如RLHF、DPO等

– 包含蒸馏与量化的训练过程

下半年的更新将支持为agent工作流进行的微调，同时着重关注微调性能的提升。

团队会与compile、core、distributed等模块进行合作，提供高效率微调，并在PyTorch生态内建立有代表性的微调性能基准。

由于torchtune也是一个较新的开源库，因此与开源社区的互动也必不可少。

文档提出发布博客文章和教程、举办技术讲座等方式，提升用户的理解；并会定义量化指标，衡量torchturn在LLM生态中的贡献份额。

除了开源社区，torchtune还会与至少一个合作伙伴集成，参与到它们的社区中，以促进torchtune的使用。

TorchVision

TorchVision作为CV领域内的绝对主宰者，技术也相对成熟，因此路线图中提出的更新很少。

团队将继续在预处理方向努力，在图像编码/解码空间中支持更多格式（如WebP、HEIC）和平台（如CUDA），并提升jpeg格式在GPU上的编码/解码性能。

TorchRec

TorchRec旨在提供大规模推荐系统中常用的稀疏性和并行性原语，将秋季推出第一个稳定版本TorchRec 1.0。

Edge

目前，开源库ExecuTorch已经推出了Alpha版本，主要依赖torch.compile和torch.export，用于支持移动设备和边缘设备（如AR/VR、可穿戴设备）上的模型分析、调试和推理。

下半年，Edge团队将推出xecuTorch的Beta版本，同时为Meta的Llama系列模型和其他开源模型提供PyTorch生态内的解决方案。

关键目标中主要涵盖两个方向。一是为设备上AI提供基础功能和可靠基础设施，包括：

– 确保C++和Python的API稳定性

– 实现一系列核心功能：支持模型压缩、代理缓存位置管理、数据和程序分离

二是为这个新生的代码库保驾护航，培育开源社区内的影响力，同时与Arm、Apple 和Qualcomm等公司保持良好合作关系。

其中社区影响力的目标甚至被量化到，要求代码在GitHub上得到3k标星，500次克隆（fork）。有兴趣的吃瓜群众可以去持续关注一下，看看团队能不能在年底完成这个OKR。

数据加载

基于Apache Arrow格式的HuggingFace datasets库凭借无内存限制的高速加载/存储，近几年异军突起，似乎抢走了PyTorch相关功能的风头。

数据加载的文档中开篇就提出了雄心壮志，要让TorchData库再次伟大，重新确立PyTorch在数据加载方面的主宰地位。

要达到这个目标，就需要让相关功能变得灵活、可扩展、高性能、高内存效率，同时实现傻瓜式操作，支持各种规模的多模态训练。

具体的更新目标包括以下几个方面：

– DataLoader的功能开发和接口都将贯彻GitHub优先的原则，DataPipes和DataLoader v2则将被逐步被弃用、删除

– 确保TorchTune、TorchTitan、HuggingFace、TorchData之间的清晰边界和良好互通性，支持多数据集、多模态数据加载

– HuggingFace使用StatefulDataLoader的API，确保兼容性，及时更新样例和测试用例

编译器核心及部署

PyTorch的编译器核心功能经过多年发展已经趋于完善，目前亟待弥补的只是对LLM和GenAI领域的更深度集成和更多优化支持。

路线图提出，要将torch.compile()函数带到LLM和GenAI的使用周期的各个方面（推理、微调、预训练），让重要模型在发行时就搭载原生的PyTorch编译。

为了实现这个目标，文档提出了很多具体措施，比如与torchtune与TorchTitan团队合作，提升编译性能，并在下半年发布至少两个高知名度模型的原生PyTorch编译版本。

此外，编译器可能添加可视化功能，在non-eager训练模式下生成表达前向计算/后向传播过程的模型图。

用户支持方面也有诸多规划，比如提升系统的监控性和可观察性，帮助户自行调试编译问题。关键目标还包括建立用户支持团队，针对几个关键领域（数据类、上下文管理等），解决开发者在GitHub等平台上发布的问题。

文章来源于“新智元”，作者“新智元”

美国启动「曼哈顿计划2.0」，AI进入奥本海默时刻？60亿砸向无人机，已有800个AI项目

关联网址

关联标签

#AI #大模型

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

后，在评论区留言并审核通过后，即可获得现金奖励，奖励规则可见：查看奖励规则

暂无评论...

10 款教育 AI 工具用例

2824 用户在看

AI写作网站自动的生成文章可以用吗？

134 用户在看

2023年你必须知道的顶级国产AI工具有哪些？全面解析！

74 用户在看

“如何选择最佳AI写作工具？这些秘诀一定要知道！”

63 用户在看

PyTorch团队首发技术路线图，近百页文档披露2024下半年发展方向

训练

微调与推理

torchtune

TorchVision

TorchRec

美国启动「曼哈顿计划2.0」，AI进入奥本海默时刻？60亿砸向无人机，已有800个AI项目

PPIO CEO姚欣：AI行业或将迎来一次泡沫破灭，但不要悲观

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

搜索

近期热门

10 款教育 AI 工具用例

2824 用户在看

AI写作网站自动的生成文章可以用吗？

134 用户在看

2023年你必须知道的顶级国产AI工具有哪些？全面解析！

74 用户在看

“如何选择最佳AI写作工具？这些秘诀一定要知道！”

63 用户在看

PyTorch团队首发技术路线图，近百页文档披露2024下半年发展方向

训练

微调与推理

torchtune

TorchVision

TorchRec

美国启动「曼哈顿计划2.0」，AI进入奥本海默时刻？60亿砸向无人机，已有800个AI项目

PPIO CEO姚欣：AI行业或将迎来一次泡沫破灭，但不要悲观

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿