首页
/ 基于Apache Doris构建统一数据仓库:打破保险行业数据孤岛实践

基于Apache Doris构建统一数据仓库:打破保险行业数据孤岛实践

2025-06-27 16:15:10作者:贡沫苏Truman

引言

数据孤岛问题是企业数字化转型过程中普遍面临的挑战,尤其对于保险行业这类数据密集型业务而言更为突出。本文将分享一家大型保险公司如何利用Apache Doris构建新一代客户数据平台(CDP),成功解决原有架构中的数据孤岛问题,实现数据处理效率的显著提升。

数据孤岛问题的形成与挑战

数据孤岛的形成往往伴随着企业业务的发展壮大。该保险公司已服务超过5亿客户,签订570亿份保险合同,其数据特点表现为:

  1. 数据来源多样化:网站、移动应用、H5页面及终端设备等多渠道数据
  2. 数据处理复杂化:离线数据和实时数据需要不同的处理流程
  3. 数据存储分散化:不同数据类型存储在不同系统中

在CDP 1.0架构中,公司采用了Spark+Impala+HBase+NebulaGraph的多组件方案,导致:

  • 离线标签、实时标签和图数据分散存储
  • 数据集成需要大量冗余存储和传输
  • 系统维护成本高昂
  • 集群规模被迫扩大

Apache Doris统一架构解决方案

CDP 2.0采用Apache Doris作为统一的数据仓库解决方案,架构优势体现在:

1. 统一的数据摄入能力

  • 离线数据:采用Stream Load方式,30线程测试显示每秒可处理超过30万次upsert操作
  • 实时数据:结合Flink-Doris-Connector和Stream Load实现高效摄入
  • 联邦查询:利用Multi-Catalog功能实现跨数据源查询

2. 客户分析工作流优化

核心分析流程包括:

  1. 客户信息整理
  2. 客户标签附加
  3. 客户分组分析

关键技术实现细节

OneID统一客户识别

在多业务线场景下,同一客户可能在不同系统中使用不同标识注册。通过Apache Doris实现:

  1. 将所有业务线的用户注册信息汇总到大宽表
  2. 使用Doris内置函数识别关联信息
  3. 为每个客户分配唯一OneID

标签服务体系优化

系统管理着:

  • 5亿客户数据
  • 500+源表
  • 2000+标签

离线标签处理

采用INSERT INTO SELECT结合部分列更新技术,显著降低内存消耗:

set enable_unique_key_partial_update=true;
insert into tb_label_result(one_id, labelxx) 
select one_id, label_value as labelxx
from .....

实时标签处理

同样采用部分列更新策略:

curl --location-trusted -u root: -H "partial_columns:true" -H "column_separator:," -H "columns:id,balance,last_access_time" -T /tmp/test.csv http://127.0.0.1:48037/api/db1/user_profile/_stream_load

高并发点查询优化

针对5000+ QPS的查询压力,采用三重优化:

  1. Prepared Statement预编译
  2. 精细参数调优
  3. 行缓存补充列存储

BE参数配置示例:

disable_storage_row_cache = false                      
storage_page_cache_limit=40%

表参数配置示例:

enable_unique_key_merge_on_write = true
store_row_column = true
light_schema_change = true

标签计算优化

针对多表关联场景(通常涉及10+表),采用colocation group策略提升性能。

客户分组分析

分组流程:

  1. Doris接收服务SQL
  2. 执行计算
  3. 通过SELECT INTO OUTFILE将结果写入S3

性能对比:

  • Impala:50秒
  • Doris:10秒(提升4倍)

逆向分析能力:

  • 使用BITMAP函数快速定位客户所属分组
  • BITMAP_OR、BITMAP_INTERSECT和BITMAP_XOR实现交叉分析

总结与展望

从CDP 1.0到2.0的升级带来了显著收益:

  1. 架构简化:单一系统替代多组件
  2. 效率提升:数据处理速度提高4倍
  3. 成本降低:减少冗余存储和传输

未来CDP 3.0规划:

  • 结合实时和离线标签进行更灵活的分组分析
  • 探索更多实时分析场景

Apache Doris作为统一数据仓库解决方案,在打破数据孤岛、提升分析效率方面展现了强大能力,特别适合保险行业这类数据规模大、分析需求复杂的场景。

登录后查看全文
热门项目推荐

项目优选

收起
docsdocs
暂无描述
Markdown
827
5.48 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
494
515
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
783
1.57 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
800
1.14 K
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
970
2.28 K
kernelkernel
deepin linux kernel
C
32
16
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
480
312
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.01 K
766
cannbot-skillscannbot-skills
CANNBot 是面向 CANN 开发的用于提升开发效率的系列智能体,本仓库为其提供可复用的 Skills 模块。
Markdown
1.26 K
808
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
647
284