CoreMLTools 8.2版本发布:全面提升PyTorch模型转换能力与性能优化
项目简介
CoreMLTools是苹果公司推出的一个开源工具库,主要用于将各种机器学习框架训练好的模型转换为苹果生态系统支持的Core ML模型格式。这个工具对于希望在iOS、macOS等苹果设备上部署机器学习模型的开发者来说至关重要。通过CoreMLTools,开发者可以轻松地将TensorFlow、PyTorch等主流框架训练的模型转换为苹果设备原生支持的格式,从而获得更好的性能和能效表现。
版本亮点
1. 增强的PyTorch模型转换支持
在8.2版本中,CoreMLTools显著提升了对于torch.export生成模型的转换支持:
-
操作符覆盖率达到83%:新版本已经支持了绝大多数常见的PyTorch操作符,这意味着开发者现在可以将更多类型的PyTorch模型转换为Core ML格式。这个覆盖率已经接近成熟的torch.jit.trace转换器的水平。
-
新增模型支持:特别值得一提的是,现在可以成功转换torchaudio的wav2vec模型。wav2vec是一种流行的语音处理模型,广泛应用于语音识别、语音合成等领域。这一支持为语音相关的移动应用开发提供了新的可能性。
2. 性能优化:注意力机制改进
新版本引入了一个名为"common::scaled_dot_product_attention_sliced_q"的transformers图处理通道,专门优化了长序列情况下的scaled dot-product attention(SDPA)计算性能:
-
实测性能提升:以Depth-Anything模型为例,当序列长度达到1814时,经过优化的模型在苹果神经引擎(ANE)上运行速度提升了34%,同时内存使用量减少了45%。这对于处理长文本或高分辨率图像的模型特别有价值。
-
技术原理:这种优化主要通过将大的注意力矩阵计算分解为更小的切片来实现,既减少了内存压力,又提高了计算效率。这种技术在处理自然语言处理(NLP)或计算机视觉(CV)中的长序列任务时尤其有效。
3. 新增支持的操作符
8.2版本扩展了对PyTorch操作符的支持范围:
-
native_group_norm:这是一种分组归一化操作,在某些特定的神经网络架构中被广泛使用,特别是在图像生成和风格转换模型中。
-
bool类型的triu:支持布尔类型的上三角矩阵操作,这在某些特定的掩码操作或注意力机制中很有用。
4. 重要错误修复
-
torch.linspace行为修正:修复了之前版本中torch.linspace操作的不正确行为,确保生成的线性间隔数值序列更加准确。
-
power 2 - sqrt融合问题:修正了当power操作的指数是张量时,错误的power 2与sqrt融合问题。这种融合优化在之前的版本中可能导致计算结果不准确。
技术影响与开发者价值
CoreMLTools 8.2版本的这些改进对于移动端和边缘设备上的机器学习应用开发具有重要意义:
-
模型兼容性提升:更高的操作符覆盖率意味着开发者可以转换更多类型的PyTorch模型,减少了模型移植过程中的障碍。
-
性能优化:特别是对注意力机制的优化,使得在资源受限的设备上运行大型transformer模型成为可能,为移动端的NLP和CV应用开辟了新的可能性。
-
社区贡献:这个版本特别感谢了开源社区的贡献者,体现了苹果对开源生态的重视和支持。
升级建议
对于已经在使用CoreMLTools的开发者,建议尽快升级到8.2版本,特别是:
- 正在使用PyTorch模型并希望部署到苹果设备的开发者
- 需要处理长序列任务的NLP或CV应用开发者
- 使用wav2vec等语音模型的开发者
新版本不仅提供了更好的兼容性,还能带来显著的性能提升和内存优化,这对于移动端应用尤为重要。
未来展望
随着PyTorch 2.0的普及和torch.export成为标准导出方式,CoreMLTools对torch.export的支持将持续增强。开发者可以期待未来版本中更完整的操作符覆盖率和更智能的优化策略,使得在苹果设备上部署复杂的机器学习模型变得更加简单高效。
HunyuanImage-3.0
HunyuanImage-3.0 统一多模态理解与生成,基于自回归框架,实现文本生成图像,性能媲美或超越领先闭源模型00- DDeepSeek-V3.2-ExpDeepSeek-V3.2-Exp是DeepSeek推出的实验性模型,基于V3.1-Terminus架构,创新引入DeepSeek Sparse Attention稀疏注意力机制,在保持模型输出质量的同时,大幅提升长文本场景下的训练与推理效率。该模型在MMLU-Pro、GPQA-Diamond等多领域公开基准测试中表现与V3.1-Terminus相当,支持HuggingFace、SGLang、vLLM等多种本地运行方式,开源内核设计便于研究,采用MIT许可证。【此简介由AI生成】Python00
GitCode-文心大模型-智源研究院AI应用开发大赛
GitCode&文心大模型&智源研究院强强联合,发起的AI应用开发大赛;总奖池8W,单人最高可得价值3W奖励。快来参加吧~0370Hunyuan3D-Part
腾讯混元3D-Part00ops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。C++0102AI内容魔方
AI内容专区,汇集全球AI开源项目,集结模块、可组合的内容,致力于分享、交流。02Spark-Chemistry-X1-13B
科大讯飞星火化学-X1-13B (iFLYTEK Spark Chemistry-X1-13B) 是一款专为化学领域优化的大语言模型。它由星火-X1 (Spark-X1) 基础模型微调而来,在化学知识问答、分子性质预测、化学名称转换和科学推理方面展现出强大的能力,同时保持了强大的通用语言理解与生成能力。Python00GOT-OCR-2.0-hf
阶跃星辰StepFun推出的GOT-OCR-2.0-hf是一款强大的多语言OCR开源模型,支持从普通文档到复杂场景的文字识别。它能精准处理表格、图表、数学公式、几何图形甚至乐谱等特殊内容,输出结果可通过第三方工具渲染成多种格式。模型支持1024×1024高分辨率输入,具备多页批量处理、动态分块识别和交互式区域选择等创新功能,用户可通过坐标或颜色指定识别区域。基于Apache 2.0协议开源,提供Hugging Face演示和完整代码,适用于学术研究到工业应用的广泛场景,为OCR领域带来突破性解决方案。00- HHowToCook程序员在家做饭方法指南。Programmer's guide about how to cook at home (Chinese only).Dockerfile09
- PpathwayPathway is an open framework for high-throughput and low-latency real-time data processing.Python00
项目优选









