Fast DDS共享内存通信中数据突然不可接收的关键问题分析

2025-07-01 18:22:27作者：羿妍玫Ivan

问题背景

在Fast DDS 3.2.0版本中，使用共享内存传输(SHM)时发现了一个严重问题：当参与通信的进程数量增加到10个时，数据接收会出现异常，表现为部分数据突然无法被接收。这个问题在双进程通信场景下不会出现，但随着进程数量增加，问题出现的概率显著上升。

问题现象

具体表现为：

在10个进程相互通信的场景下，问题会在半分钟内出现
当关闭FASTDDS_STATISTICS功能时，问题消失
数据接收异常表现为远程参与者被错误判断为不活跃状态

根本原因分析

经过深入分析，发现问题主要由两个关键代码逻辑引起：

1. 子消息头解析过早返回

在共享内存通信处理过程中，以下代码段存在缺陷：

if (!readSubmessageHeader(submessage, &submsgh)) {
    return;
}

这段代码在解析子消息头失败时直接返回，导致后续关键的参与者活跃性确认代码participant_->assert_remote_participant_liveliness(source_guid_prefix_)无法执行。这使得系统错误地认为远程参与者已经变为不活跃状态，最终导致数据无法被正常接收。

2. 统计消息缓冲区处理不当

另一个关键问题出现在统计消息缓冲区的处理逻辑中：

auto it_end = remove_statistics_buffer(buffers.back(), total_bytes) ? std::prev(buffers.end()) : buffers.end();

这段代码虽然删除了统计消息，但消息中的长度字段仍保持原始长度值，导致CDR消息解析失败。正是这个解析失败使得代码执行流程进入了第一个问题描述的情况。

解决方案

该问题已在Fast DDS 3.2.1版本中得到修复。修复的核心思路是：在处理共享内存缓冲区时，优先移除统计缓冲区，然后再进行缓冲区分配。这种处理顺序确保了消息解析的正确性，避免了因统计消息导致的解析失败和后续的参与者活跃性误判问题。

技术启示

消息边界处理：在网络通信和进程间通信中，消息边界处理必须非常谨慎，过早的返回可能导致关键状态维护逻辑被跳过
统计功能影响：统计功能虽然对系统监控很重要，但其实现方式可能影响核心通信逻辑，需要特别注意隔离
并发场景测试：这类问题往往在并发度提高时才显现，说明在分布式系统开发中，高并发场景测试必不可少

总结

这个案例展示了分布式系统中一个典型的问题模式：看似无关的功能扩展(如统计功能)可能影响核心通信逻辑。开发者在设计系统时，需要特别注意核心通信路径的健壮性，并对各种边界条件进行充分测试。Fast DDS团队通过优先处理统计缓冲区的策略，优雅地解决了这个问题，为类似场景提供了有价值的参考。

Fast-DDS

The most complete DDS - Proven: Plenty of success cases. Looking for commercial support? Contact info@eprosima.com

项目地址：https://gitcode.com/gh_mirrors/fa/Fast-DDS

登录后查看全文

项目优选

收起

本项目是CANN提供的transformer类大模型算子库，实现网络在NPU上加速计算。

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

471

473

pytorch

Ascend Extension for PyTorch

本项目是CANN提供的神经网络类计算算子库，实现网络在NPU上加速计算。

CANN 学习中心仓，支持在线互动运行、边学边练，提供教程、示例与优化方案，一站式助力昇腾开发者快速上手。

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent，它能够将大语言模型的强大能力，通过你日常使用的各类通讯应用，直接延伸至你的指尖。

本仓库是 Flutter SDK 与 Flutter Engine 的 OpenHarmony 适配版本，由 CPF-Flutter 团队维护。开发者可使用熟悉的 Flutter 技术栈开发 OpenHarmony 应用，3.35.7 及以后的适配版本可基于本仓库源码构建支持 OpenHarmony 的 Flutter Engine。

Dart

1.04 K

272