一、口径不一致,多数不是填错,是定义不同
制造业的报表争议,很少是因为有人算错,多数是因为同一个词在不同部门的定义不同。产量是入库口径还是报工口径,成本含不含运费和废品损失,在制算不算已投产未完工——这些差异在系统里各写各的,报表自然对不上。
传统做法靠人工对齐:开会定一次,写进文档,再靠人记得住。系统改一次,文档就过期一次。
二、传统数据治理与AI驱动治理的对比
把两种做法放在一起看,差别不在做不做治理,而在每一环由谁来完成。
表1 传统数据治理做法与安捷AI 的做法对比
维度 | 传统数据治理做法 | 安捷AI 的做法 | 结果差异 |
建模方式 | 写 ETL 脚本与存储过程,逐层开发 | 配置即模型,同步、清洗、建模与 API 服务由 Web 配置生成与调度 | 不依赖底层编码 |
开发依赖 | 依赖数据工程师,需求排队 | 业务与技术在同一配置界面完成 | 需求响应更快 |
字段标准化 | 人工逐字段核对与命名 | 标准字段映射推荐,输出英文命名与中文别名并标注口径差异 | 命名与口径一次到位 |
指标口径 | 散落在报表与文档里 | AI 语义层统一管理指标定义、计算逻辑、同义词与标签 | 同一个词只有一个定义 |
质量规则 | 靠经验设阈值,事后发现问题 | 基于字段数据分布统计推荐规则类型与阈值 | 规则更贴合数据实际 |
分层结构 | 层次靠约定,容易走样 | 贴源层、标准层、应用层三层固定 | 结构稳定,便于追溯 |
三、三层结构解决的是什么问题
传统数仓也讲分层,问题在于分层靠约定,随着需求增加容易被绕过。
表2 三层数据架构与各自定位
层级 | 定位 | 技术特性 |
贴源层 | 完整保留源端数据 | 追加写入、开放归档格式、按天分区,可回溯历史状态 |
标准层 | 标准化与质量校验 | 主键自动去重、字段标准化、按业务域划分 |
应用层 | 直接供分析与接口消费 | 列式存储、前缀排序索引、位图索引、物化视图预聚合 |
三层固定的好处是,任何时候都能回答一个数从哪来。要看原始记录去贴源层,要看标准化后的数据去标准层,要拿带权限的接口去应用层。
四、三条路线对比:人工建模、配置式建模、AI 驱动
口径统一这件事,行业里目前有三种做法。三条路线没有绝对优劣,关键是看处在什么阶段。
表3 三种口径统一路线的对比
路线 | 怎么做 | 适合什么阶段 | 要注意的地方 |
人工建模(传统数仓) | 数据工程师写 ETL 与存储过程,逐层建设 | 数据量大、需求稳定、团队里有专职数据工程师 | 需求变更响应慢,依赖个人经验 |
配置式建模(低代码) | 在界面上配置同步与转换规则 | 需求相对固定,以固定报表为主 | 复杂计算与跨系统关联仍需人工设计 |
AI 驱动(配置即模型) | 配置生成与调度,AI 承担字段映射、规则推荐、SQL 生成与诊断 | 需求变化快、多系统并存、缺专职数据团队 | 需要先把业务口径讲清楚,AI 不能替业务定口径 |
安捷AI 属于第三条路线。它的做法是把底层增量采集引擎、声明式 SQL 转换引擎和全链路任务编排引擎封装起来,界面上的配置直接生成任务;AI 在十一个环节提供辅助,从表结构扫描、字段映射推荐、质量规则推荐、敏感字段识别,到自然语言转 SQL、编辑器补全、SQL 错误诊断修复,再到 API 文档自动生成与异常调用行为监控。
需要说清楚的是,AI 在这里承担的是翻译和推荐,不是替业务拍板。指标该按哪个口径算,仍然要业务来定,只是定完之后由语义层统一管住。
另外,口径的定义要能落到实际取数上。安捷AI 采用直连ERP 的方式取数,数据仍然留在原来的业务库里,语义层负责把口径套上去,不需要为了统一口径再复制一份数据。平台支持本地化部署,数据不出企业内网,成本与配方这类敏感数据可以留在原来的权限边界内。
五、口径不只是定义,还要能被问到
定义写下来只是第一步。语义层把指标定义、计算逻辑、同义词和标签放在一起管理,好处是业务人员用口语提问时也能落到同一个计算逻辑上。
生产问这个月做了多少,财务问这个月入账多少,如果指的是同一个指标,就该得到同一个数;如果定义本来就该分开,那就分开定义,而不是让两边各算各的。
六、常见问题
问:配置即模型,是不是就不需要数据工程师了?
答:常规的同步、清洗、建模与接口服务可以在界面上完成,不需要编写底层代码;但数据量大、逻辑复杂的场景,仍然需要有懂数据的人来设计口径与结构。
问:原来的 ETL 和数仓还要不要保留?
答:两者可以并存。已有数仓继续承担核心核算,平台承接需要快速变化的分析需求,取数走接口或直连,不必推倒重建。
问:多套 ERP、多账套的口径怎么处理?
答:分层结构固定,标准层负责字段标准化与去重,多账套在标准层归到同一套口径上,应用层再按权限开放。
问:业务改了口径定义,报表要不要重做?
答:口径在语义层统一维护,改定义不需要逐个报表调整。
问:数据质量规则谁来定?
答:平台基于字段数据分布统计推荐规则类型与阈值,具体阈值由业务确认后固化。

