Jsoup项目中的XML格式化优化：解决特定标签换行问题

2025-05-21 17:37:04作者：蔡丛锟

jsoup: the Java HTML parser, built for HTML editing, cleaning, scraping, and XSS safety.

项目地址：https://gitcode.com/gh_mirrors/js/jsoup

在电子书制作领域，EPUB格式对XHTML文件的格式要求非常严格。近期Jsoup项目针对XML文档的格式化输出进行了重要改进，特别是解决了特定标签后自动换行的问题。

问题背景

在EPUB文件的XHTML文档中，元数据标签如<dc:language>通常需要保持紧凑格式。然而Jsoup默认的格式化输出会在这些标签后添加换行和缩进，导致某些阅读器无法正确解析。例如：

<dc:language>
   ja
</dc:language>

这种格式虽然美观，但不符合部分阅读器的严格要求。

技术解决方案

Jsoup维护团队对XML格式化逻辑进行了重构，主要包含两个关键改进：

智能标签类型推断：对于XML中的未知标签，现在默认将其视为行内元素(inline)，不再自动添加换行。只有当标签包含子元素时，才会被识别为块级元素(block)。
自定义标签控制：新增了通过代码精确控制标签格式化行为的能力。开发者可以显式指定标签类型：

// 将metadata标签设为块级
Element meta = doc.expectFirst("metadata");
meta.tag().set(Tag.Block);

实际效果

经过优化后，XML输出变得更加灵活可控：

默认情况下，简单文本标签保持紧凑：

<dc:language>ja</dc:language>

当需要结构化显示时，块级标签自动缩进：

<metadata>
 <dc:identifier>id</dc:identifier>
 <dc:title>书名</dc:title>
</metadata>

技术意义

这项改进对电子书开发者尤为重要：

解决了EPUB阅读器的兼容性问题
提供了更精细的格式控制能力
保持了XML文档的可读性和规范性
不影响已有HTML文档的处理逻辑

开发者现在可以更轻松地生成符合各种阅读器要求的EPUB文件，而无需手动进行字符串替换等临时解决方案。

最佳实践建议

对于EPUB开发：

使用XML解析模式处理OPF文件
对关键元数据标签保持默认的紧凑格式
对包含子元素的复杂结构启用块级格式化

这项改进将在Jsoup的下个主要版本中发布，为XML文档处理提供更专业的支持。

jsoup: the Java HTML parser, built for HTML editing, cleaning, scraping, and XSS safety.

项目地址：https://gitcode.com/gh_mirrors/js/jsoup

登录后查看全文

项目优选

收起

本项目是CANN提供的神经网络类计算算子库，实现网络在NPU上加速计算。

ops-transformer

本项目是CANN提供的transformer类大模型算子库，实现网络在NPU上加速计算。

Ascend Extension for PyTorch

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

cann-learning-hub

CANN 学习中心仓，支持在线互动运行、边学边练，提供教程、示例与优化方案，一站式助力昇腾开发者快速上手。

Jupyter Notebook

Oohos_react_native

React Native鸿蒙化仓库

Claude Code 的开源替代方案。连接任意大模型，编辑代码，运行命令，自动验证 — 全自动执行。用 Rust 构建，极致性能。｜ An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get Started

deepin linux kernel