01 7月, 2026
随着人工智能向持续运行模式转变,其性能不仅取决于系统运行速度,还取决于系统如何有效地保留、访问和重用其产生的数据。
在许多企业中,人工智能投资与结果直接挂钩,例如改善决策、加速产品开发和提供更个性化的用户体验。
思考一下公司是如何在云平台和服务上开发产品的。竞争优势并非源于单一的洞察力,而是源于多年来与客户互动、测试、失败、反馈和改进过程中积累的知识。公司保留和应用的机构知识越多,改进速度就越快。
人工智能系统也开始以同样的方式运行。早期的挑战在于训练模型。随着部署的成熟,其价值越来越取决于它们能否有效地保留、访问和重用先前交互和输出中积累的数据。这项工作起初感觉还能应付,但随着部署的成熟,期望值也在不断提高。系统仅仅分析已经发生的事情已经远远不够了。他们需要不断学习,随着新数据的涌入,不断完善推荐方案并调整现有经验。模型固然重要,但系统能否记住已有的信息并在需要时调用,同样至关重要。
客户行为、以往的产出和不断变化的模式都需要持续存在并保持可访问性,这将改变对话的内容。模型性能仍然很重要,但这不再是全部问题。更重要的问题是,随着系统的演变,它本身能否维持这种环境。
多年来,人工智能的讨论主要集中在模型和计算上。各组织投资购买GPU,聘请数据科学家,并专注于培训。存储为整个过程提供支持,保存数据集,并且主要在后台运行。
现在这些系统已经广泛部署,但其他问题也随之出现了。模型持续运行,工作重点也从创造智能转向扩展智能。这通常被描述为智能体人工智能——这类系统不仅响应请求,而且还能将上下文信息传递下去,并在已完成的工作基础上继续发展。
它们生成输出,从存储的数据中提取信息,并在先前交互的基础上进行构建。看似单个请求,实际上只是检索上下文、完善响应并将新信息反馈到系统中的持续循环中的一个步骤。
系统改进越来越取决于数据在工作流程中的保留、访问和重用效率。在超大规模环境(即这些系统运行的大规模、全球分布式云基础设施)中,对象存储成为累积数据的记录系统。它基于硬盘大规模构建,提供了持久、经济的基础,使人工智能系统能够保存上下文,随着时间的推移扩展上下文并不断改进。
一旦系统开始以这种方式运行,存储的作用就开始发生变化。在产品开发过程中,客户反馈、先前的成果、测试数据和早期互动不断为下一步的改进提供信息。同样的模式在各个行业中都会出现,只要人工智能系统依赖于数据的保留和重用,就会出现这种情况。
长期以来,对象存储一直被视为数据不再使用后的最终归宿。当工作负载呈阶段性变化时,这种模式是有效的。但是,不断学习和进化的AI系统并没有明确的终点。
每一次互动都会留下痕迹。产出不断积累,当它们被保留下来时,就成为系统工作环境的一部分。这些成果不会消失,而是与之前的一切成果一起继续存在,并塑造着未来的发展。随着这些系统随着时间的推移而不断发展,对象存储扮演着更加核心的角色——它不仅是存储库,而且是累积数据得以持久存在、保持可访问性并能重新融入到活跃工作流程中以指导未来结果的层。
数据继续在其他层级之间流动。它被加载到内存中,被提取到处理层中,并实时使用——通常在单个工作流程中不止一次使用。但它最终总会在某个地方继续存在下去。它必须保持易用性、耐用性和可再次使用的状态。
这一角色越来越落到对象存储身上,在超大规模云中,对象存储是基于硬盘构建的。事实上,超过 90% 的云数据中心容量都位于硬盘驱动器上,这不仅反映了数据的存放位置,也反映了数据大规模存储的位置。¹ 存储是 AI 保留上下文的方式。从规模上看,它不再是背景考虑因素,而是成为定义系统功能的一部分。
在训练阶段,数据问题很简单:我们是否有足够的数据来构建一个有用的模型?
在这样的系统中,一个不同的问题开始出现:系统能否在正确的时间获取正确的数据,并且经常在运行过程中反复获取?
这就不再是理论问题了。你会看到系统不断地从存储的数据中提取信息,随着更多上下文的添加,不断改进输出结果。表面上看似单一的查询,实际上往往是一系列后台查找,每一次查找都取决于已经保留的信息。随着这些系统的成熟,数据扮演了新的角色。处于非使用状态的存储数据并非闲置数据。这是系统已知信息的一部分——先前的输出、交互和信号会影响接下来发生的事情。积累起来的背景信息开始变得和模型本身一样重要。大规模人工智能工作负载持续产生海量数据,但其中大部分数据仍被视为瞬态数据——使用一次后即被丢弃——而不是被保留下来作为系统可以赖以构建的基础。
这就出现了一个新的限制。随着数据成为长期资产,挑战不再仅仅是能够存储多少数据,而是随着系统不断扩展,能够保持多少数据可访问、持久和可重用。
市场已经开始适应这一现实。IDC预测对象存储容量将以25.6%的复合年增长率增长,这反映出市场对持久化、大规模可访问数据的需求日益增长。²
理论上,人工智能系统的设计目标是提高效率。实际上,随着规模的扩大,这种效率越来越难以维持。计算技术不断进步,模型功能日益强大且复杂。随着部署的成熟,这些系统保留和依赖的数据量增长得更快。
各个组织越来越擅长检索和使用信息,在合适的时机将合适的数据导入工作流程。但与此同时,他们想要保留的物品数量却在不断增加。随着系统的成熟,历史业务数据、先前的输出、客户互动和积累的组织知识都会变得更有价值。人工智能系统的输出质量越来越能反映其能够获取的信息的深度和广度。
当性能不足时,人们的本能反应仍然是增加计算能力。但这并不总是能解决根本问题。除了处理数据之外,更难的问题是保持对积累的数据的访问,这些数据为系统提供上下文,并确保随着系统的演变,这些数据可以被保留、检索和重用。
这种不平衡现象也开始在基础设施规划中显现出来。随着人工智能系统保留和重用更多数据,数据层在架构决策中扮演着越来越重要的角色,这些决策决定了这些系统能够多有效地扩展。
最终,系统的限制不再是运行速度,而是能够将多少历史信息作为可用状态传承下去。
企业现在做出的基础设施决策将决定其人工智能系统究竟能发展到什么程度。
其中很多都被描述为软件定义,系统行为的很大一部分是由数据的分布和访问方式决定的。但随着部署规模的扩大,另一个现实也变得越来越难以忽视——这些系统能够发展到什么程度,最终取决于底层的硬件。
人工智能基础设施跨越多个层面运行。记忆证实了现在正在发生的事情。在对延迟要求很高的场合,闪存可以实现高速访问。在两者之下,基于硬盘大规模构建的对象存储提供了持久的基础,使数据能够长期可用。
随着系统变得越来越连续,这种区别也变得更加明显。性能层负责处理即时数据,而对象存储则确保已发生的数据仍然可用。由于这些系统不断生成和重复使用大量非结构化数据,因此仅靠性能层级是无法维持的。随着密度、耐用性和规模从背景考虑因素变为核心限制因素,硬盘仍然至关重要。
软件决定了系统的运行方式。硬件决定了它能知道什么。
在任何人工智能投资过程中,总会遇到同一个问题:如何在不超越其底层基础设施的情况下,使系统持续发展?存储密度可以解答这个问题。企业人工智能的真正制约因素是连续性,而不是计算能力。在不扩大基础设施规模的情况下存储更多数据的能力,直接影响着系统的可扩展程度。
规模扩大后,这种影响会叠加。在一个 1 EB(艾字节) 规模的部署中,Seagate 的 Mozaic (魔彩盒)™ 4+ 平台 相较于标准 30TB 部署,可将基础设施效率提升约 47%,同时减少数据中心占地面积和能源消耗。3
基础设施决策和业务决策最终殊途同归。能够记住所学到的知识,并能高效地检索和在数百万次交互中重复利用这些知识的系统,其价值将会不断增长。基于将数据视为瞬态的基础设施而构建的系统最终会达到瓶颈。不是因为模型本身有问题,而是因为模型的基础无法承受其重量。
存储是人工智能积累知识的方式——而且在规模化应用后,保留的上下文决定了系统能够从自身过去学习多少知识,如何适应变化并为企业带来价值。
了解由 HDD 驱动的多层存储架构如何支持大规模对象存储。
参考资料
技术和云营销副总裁