大规模存算系统 DataLacus

大规模存算系统(DataLacus)是北京东方金信科技股份有限公司基于对象存储打造的存算分离、流批一体的企业级湖仓数据底座,原生支持 x86/K8s 与信创国产化双环境,为企业构建高效、开放的云原生数据底座。

产品概述
大规模存算系统(DataLacus)是基于对象存储打造的企业级湖仓数据底座,存算分离、可独立扩展。数据接入支持实时同步、批量导入与应用直写三种方式。 计算层构建于 Kubernetes 之上,采用「实时 + 离线」双引擎协同,配合统一调度与工作流编排。 查询层提供联邦查询能力,并由自研 MPP 引擎加速。元数据由控制台统一封装,对用户透明管理。控制台作为全栈统一管理入口,以可视化方式覆盖数据接入、任务调度、元数据查看、监控告警等环节,显著降低运维复杂度。产品适用于企业级大数据平台、数据中台与实时数仓等场景。
场景
主要功能
集群与资源管理
统一展示集群、命名空间与资源配额概览,实时监测各组件健康状态;支持 MinIO 桶管理与存储容量水位监控,全面掌握整体运行态势,合理规划容量。
元数据管理
以目录树方式浏览库、表、分区、字段与快照信息,内置建表向导,支持 DDL 与 Schema 演进;自动生成数据血缘图,清晰呈现表间上下游依赖,便于数据梳理与影响分析。
数据开发
提供 SQL 工作台,支持 Flink/Spark 作业开发与全生命周期管理,覆盖提交、启停、savepoint、重启与日志查看,让开发者在同一界面完成从编写到运维的闭环。
数据接入
统一管理数据源,支持 CDC 整库与单表同步、Schema Evolution 策略配置及批量导入,满足实时与离线的多样化数据入湖需求,降低数据接入门。
数据运维
对 Iceberg 提供 compaction、快照过期、孤儿文件清理等维护编排,对 Paimon 提供 compaction 管理;并支持表生命周期管理、历史数据回溯及热温冷数据分层归档与回迁,保障湖仓长期稳定高效。
查询服务
提供即席查询与联邦查询能力,统一访问多源湖仓表;内置查询审计与慢查询分析,帮助定位性能瓶颈,保障查询体验与数据安全合规。
权限与安全
基于用户/角色实现 RBAC 权限管控,支持数据级细粒度授权、审计日志与敏感字段脱敏,从访问控制到操作留痕全方位保障数据安全。
监控告警
对集群、作业、存储与查询进行指标采集与可视化大屏展示,支持告警规则配置与 SLA 报表,实现平台运行状态的实时感知与主动预警。
数据质量
支持质量规则配置与校验任务调度,自动生成质量报告,持续监控数据的准确性、完整性与一致性,及时发现并处理数据问题。
核心优势
统一存储底座
以对象存储承载湖仓数据,Iceberg 与 Paimon 统一底座,一份数据多引擎共享,减少重复存储与数据搬迁。
存算分离
存储与计算物理隔离、独立扩展,计算集群按需启停,对象存储按容量线性扩展,显著降低大规模数据场景的闲置资源成本。
流批一体
实时链路(CDC+Paimon)与离线链路(Spark+Iceberg)协同,实时离线双通道入湖,一套平台覆盖实时数仓与离线批处理。
双环境兼容
支持标准云原生与信创国产化双环境交付,通过多架构镜像预拉取与信创专项验证,满足政企、金融客户自主可控合规要求。
应用场景
数据底座
实时数仓
离线计算
联邦分析
数据治理
作为企业统一的湖仓存储底座,存算分离、按需扩展,为数据中台、大数据平台与上层智能应用提供统一数据供给。
基于 Flink CDC 实现关系库分钟级整库同步入湖,配合 Paimon 主键表与 Schema Evolution,支撑实时数仓与实时指标计算。
以 Spark + Iceberg 进行批量 ETL,支持分区、分桶、排序优化,内置 compaction、快照过期与孤儿清理等自动化维护。
通过 Trino 提供无状态联邦即席查询,统一访问多源湖仓表,并由自研 MPP 引擎提供查询加速与物化视图能力。
借助 OpenMetadata 与 OpenLineage 实现元数据治理、血缘追踪与质量可观测,让数据全链路可查、可溯、可控。
客户案例