TT-Metal v0.58.0-rc20 版本技术解析与功能增强

2025-07-10 21:27:44作者：蔡怀权

TT-Metal 是一个高性能计算框架，专注于为AI和机器学习工作负载提供高效的硬件加速支持。最新发布的v0.58.0-rc20版本带来了多项重要改进和功能增强，特别是在多设备支持、算子优化和性能提升方面。

核心功能增强

本次版本在多设备支持方面做出了显著改进。框架现在能够正确处理多个N150设备的初始化问题，解决了设备ID跟踪在测试运行间的清理问题。对于WH/BH架构，实现了原地Halo多播功能，这为分布式计算场景提供了更高效的数据传输机制。

在算子支持方面，框架扩展了对多种数据类型的支持。新增了int类型对零比较操作的支持，为uint16类型添加了加法操作支持，并实现了int类型对关系运算的支持。这些扩展使得框架能够处理更广泛的计算场景。

性能优化与调试工具

性能优化是本版本的重点之一。开发团队更新了性能容限设置，针对特定硬件配置调整了性能预期。特别值得注意的是，框架现在能够生成每个核心的操作到操作时间CSV文件，为性能分析提供了更细粒度的数据。

调试工具也得到了增强。新增了捕获DRAM写入的观察器功能，可以帮助开发者识别潜在的性能瓶颈。同时，框架现在支持强制将性能分析结果推送到Tracy工具，便于进行更深入的性能分析。

模型支持与稳定性

在模型支持方面，本次版本为YOLOv8x添加了跟踪支持，并实现了VAE中间块和上采样块的功能。针对ResNet50模型，专门开发了稳定性测试脚本，确保模型在框架上的可靠运行。

对于大型语言模型的支持也有显著提升。框架优化了Llama SDPA解码过程，通过使用16x32分块和移除copy_blocks操作来提高性能。同时增加了对Mistral-7B模型的支持，虽然这一功能在后续版本中被暂时回退以进行进一步优化。

分布式计算改进

分布式计算能力是本版本的另一个亮点。框架增加了对6U系统2D环面拓扑的初始化支持，并改进了reduce scatter操作中围绕集群轴计算接收器/发送器ID的代码。这些改进使得框架在分布式环境中的表现更加稳定和高效。

针对all_gather_concat操作，框架现在支持RM输入，并为其输出添加了隐式tilize功能。同时修复了AllGatherAsyncMinimal中的段错误问题，提高了分布式操作的可靠性。

测试与验证

为了确保框架质量，开发团队进行了大量测试工作。新增了6U特定的全网格带宽测试，并创建了system_health测试二进制文件用于6U/T3K平台验证。针对黑盒测试，调整了超时设置以适应不同硬件配置。

测试覆盖率方面，框架现在包含了更多算子测试，如更新了SDXL conv2d测试和ttnn.group_norm测试。同时修复了导致错误输出的argmax演示问题，确保示例代码的可靠性。

本次TT-Metal v0.58.0-rc20版本的发布，展现了框架在性能、功能和稳定性方面的持续进步，为AI和高性能计算应用提供了更加强大的支持基础。

tt-metal

ttnn - a python API and OP library. TT-Metalium - a low level kernel programming model.

项目地址：https://gitcode.com/gh_mirrors/tt/tt-metal

登录后查看全文

项目优选

收起

kernel

deepin linux kernel

docs

OpenHarmony documentation | OpenHarmony开发者文档

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

Java

leetcode

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

喝着茶写代码！最易用的自托管一站式代码托管平台，包含Git托管，代码审查，团队协作，软件包和CI/CD。

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

336

178