碧海存储以分布式元数据引擎、多协议原生互通、低P99延迟和EB级弹性扩展能力,为数据湖仓、AI数据湖、智能制造、医疗影像等场景提供高性能统一存储底座。
数据湖仓的演进:从批处理到AI实时分析
大数据时代,Hadoop以HDFS+MapReduce构建了第一代数据湖:存储与计算耦合在同一集群,数据就近处理。这种模式解决了海量数据的存储问题,但存在两个明显局限——分析仅支持定时批处理,无法满足实时交互式查询分析需求;扩容时存储和计算必须同步增长,无法按需独立扩展,资源浪费明显。
数据湖仓(Data Lakehouse)带来了两个关键变化:一是存算分离,存储和计算各自独立扩展,存储层以对象存储为底座,计算层按需弹性伸缩;二是从"批处理"转向"实时分析",MPP架构下数百个计算节点并发扫描数据,对存储的并发吞吐和访问延迟带来了全新挑战。对象存储凭借近乎无限的横向扩展能力,成为数据湖仓的主流存储底座。
AI大模型训练进一步将数据湖仓推向AI数据湖阶段:百亿级文件、数十PB数据规模成为常态,GPU集群要求存储在高并发随机读写的同时保持低延迟,数据需要同时供给实时分析引擎和AI训练任务。存储不再是简单的"数据容器",而是整个数据平台的性能底座。

百亿级海量文件是长期行业痛点
数据湖仓与AI数据湖的普及,将对象存储推向了一个前所未有的规模——单一命名空间下百亿级文件。AI训练样本、特征数据、传感器流水、日志归档多以海量小文件形式沉淀,单桶对象数从百万级迅速攀升至十亿、百亿级。这一量级并非个例,而是数据驱动型业务的常态。
真正的挑战不在容量,而在于文件数量。文件越多,元数据管理越复杂——每新增一个对象,系统都要维护其键名、大小、权限、版本、分片位置等元信息。传统对象存储多采用"本地文件系统+内存缓存"的元数据架构:元数据落盘于单节点本地文件系统,访问时依赖内存缓存加速。当对象数达到亿级,元数据体量远超内存容量,缓存命中率急剧下降,列举(List)和检索(Head/Get)操作被迫回退到磁盘扫描,延迟从毫秒级退化到秒级甚至更长。
对用户而言,最直接的体验是性能随数据增长持续下滑:系统上线初期响应敏捷,随着对象数量累积,列举、检索、读写延迟逐步走高;到亿级、十亿级规模时出现严重衰减,业务系统响应明显变慢,甚至触发超时与重试,影响上层分析与训练任务的稳定性。

为什么P99延迟是核心指标
传统存储评估关注平均延迟和IOPS,但在数据湖仓和AI场景中,P99延迟(第99百分位延迟)才是决定业务系统性能体验的核心参数。
原因在于MPP架构的"木桶效应"。一个OLAP查询会被拆分为数百个子任务并行执行,最慢的子任务决定整个查询的响应时间。假设100个节点并发查询,平均延迟 5ms,但P99延迟为50ms——意味着每100个请求中有1个慢10倍。在数百个并发子任务中,几乎每次查询都会命中至少1个慢请求,用户感受到的响应时间不是5ms,而是50ms。
对于AI训练,问题更加严峻。分布式训练采用同步AllReduce机制,所有GPU节点在每个iteration完成后同步等待。如果存储P99延迟过高,一个节点的数据加载卡顿会导致整个集群的GPU空转,算力资源白白浪费。
MinIO的技术瓶颈
MinIO是国内外广泛使用的开源对象存储,以轻量和易部署著称,但在大规模生产环境中暴露出明显的技术瓶颈。
元数据扩展瓶颈:MinIO元数据存储在磁盘文件系统上,通过内存缓存加速访问。文件规模达到亿级时,元数据缓存占用大量内存,且缓存命中率下降导致频繁磁盘扫描,百亿级文件场景下列表和检索性能急剧衰减。
P99 延迟抖动:MinIO开源版本基于Go语言,在高并发压力下GC回收可能导致尾延迟不可控。
无多协议互通:MinIO仅支持S3协议,不具备NFS/POSIX文件访问能力。数据湖仓场景中,BI分析、AI训练、传统应用依赖不同协议,MinIO须额外部署文件网关方能适配,引入额外延迟与运维负担。
开源版功能持续缩减:MinIO采用AGPLv3协议,企业级功能(Catalog、Firewall、KMS、Cache、Observability 等)已限定为商业版专有。企业二次开发面临AGPLv3合规要求或需购买商业License。


碧海存储的技术突破
霄云信息科技自主研发碧海存储,以技术创新和全新底层架构解决上述挑战:
百亿级元数据引擎:碧海存储采用分布式元数据架构,元数据分散在多个节点管理,不依赖单节点内存。即使桶内对象达到百亿级别,元数据检索和读写性能保持稳定,无明显衰减。
文件与对象原生互通:兼容S3对象接口与NFS/FTP/SMB/POSIX文件接口,同一份数据零拷贝、零格式转换,通过多种协议直接访问。数据湖仓场景中,StarRocks通过S3读取数据,AI训练框架通过POSIX加载样本,传统应用通过NFS访问文件——一份数据,多种协议,无需拷贝。
低P99延迟:碧海存储通过精细化锁粒度、元数据预取、高性能并发I/O引擎等技术,有效控制尾延迟。小文件聚合优化消除了磁盘碎片并减少了磁盘I/O次数。在同等部署环境下,碧海存储的P99延迟表现显著优于MinIO、Ceph等方案,满足实时分析和AI训练对延迟稳定性的严苛要求。
弹性扩展与冷热分层:支持EB级平滑横向扩展,扩容时数据自动重平衡,业务无感知。冷热数据自动分层策略将热数据保留在高性能NVMe介质,冷数据下沉至大容量 HDD,平衡性能与成本。
生态合作与行业应用
生态合作:StarRocks深度适配
StarRocks是优秀的开源计算引擎,在国内外得到广泛应用。为处理AI时代海量数据,StarRocks采用了存算分离架构。碧海存储作为高性能存储系统,已与 StarRocks完成深度适配,在众多客户场景中作为StarRocks存算分离新架构的存储基座。得益于碧海存储系统的低延迟能力,不仅支持了接近秒级的实时数据摄取新鲜度,同时其高并发读取能力也保证了高并发场景下的查询延迟稳定性。
行业应用
AI数据湖:AI训练的数据采集、预处理、样本加载环节产生海量小文件,对存储的并发写入和元数据性能要求极高。碧海存储提供高并发小文件写入能力,延迟控制在5ms以内,并通过多协议互通支持数据在对象存储和文件系统间无缝流转。配合霄云银河AI全闪存储,可构建从数据采集到训练推理的统一存储底座。
智能制造:生产数据湖仓需承载产线设备数据采集、质量检测图片存储、生产日志分析等混合负载。碧海存储以高并发写入和实时分析能力,支撑产线数据的实时采集与查询。
医疗影像数据中心:医疗PACS影像、病理切片等非结构化数据持续增长,单家三甲医院数据量可达PB级。碧海存储以多协议互通和高并发读取能力,高效承载海量医学影像,优化影像调阅体验。

总结
从存算一体的批处理,到存算分离的实时分析,再到AI数据湖,存储的核心诉求已从大容量转向高性能。在这一趋势下,P99延迟成为衡量存储能否胜任实时分析与 AI 训练的关键指标。MinIO受限于元数据扩展瓶颈和GC延迟抖动,在百亿级文件规模下暴露出结构性瓶颈。碧海存储以分布式元数据引擎、多协议原生互通、低P99延迟和EB级弹性扩展能力,为数据湖仓、AI数据湖、智能制造、医疗影像等场景提供高性能统一存储底座。
声明: 此文观点不代表本站立场;转载须要保留原文链接;版权疑问请联系我们。


































