数据治理
构建DuckDB 数据治理平台:算子引擎、安全机制与流水线设计
一、写在前面
在数据治理的日常工作中,我们经常需要处理各种非结构化数据——从 PDF 中提取的文本、爬虫抓取的网页内容、API 返回的 JSON 数据。这些数据往往包含空值、重复、格式混乱等问题,需要一个高效、灵活的数据清洗方案。
传统做法是写 Python...
duckdb 数据治理新工具
今天无意了解到duckdb,可以方便读取本地csv、pandas DataFrame、json等数据然后直接使用sql进行处理,体验了一番,确实不错
安装
数据质量监控命名规范
📐 一、标准化命名规范(4段式结构)
数据采集是否算作业务过程
“数据采集(爬虫)”是否算作业务过程,取决于你治理的边界和对象。
根据你的初衷(治理入库后的业务系统数据),我的建议是:不建议将“爬虫采集”列入核心业务域,但需要将其作为“数据源头”进行元数据管理。
以下是针对你这种情况的逻辑梳理和架构建议:
1. 为...
企业数据资产识别与管理操作指南
定位说明:本指南是对《01 元数据管理》《02 治理规则管理》《03 数据质量管理》《数据质量监控》的整合应用,聚焦 “哪些是数据资产 → 如何识别 → 如何管理 → 如何使用” 四步闭环,让业务、开发、数据团队对“数据资产”形成统一认知与操作标准。
1. 什么...
数据质量监控落地实施方案
一、使用场景
组件角色数据特点业务库(Mysql、Tidb)源头实时产生BinlogCDC -> Kafka传输层每条Binlog事件以JSON形式入Kafka(含before/after/op)Kafka消费 -> Doris入仓将Kafka中的变更...
spring-boot实现多数据源管理
技术栈:spring-boot + mybatis-plus + dynamic-datasource
实现动态添加数据源,并可执行query操作
pom.xml