首页/行业动态/Scality 发布 AI Infere
行业动态 · Insights

Scality 发布 AI Inference Factory:把推理「搬回」企业自有基础设施,押注数据主权与成本可控

2026 年 10 月 8 日 · Business Insider(GlobeNewswire)

部署 · 部署落地 2026 年 10 月 8 日 来源:Business Insider(GlobeNewswire)

10月8日,数据基础设施软件商 Scality 发布 AI Inference Factory,一套面向企业自有基础设施的开源代码软件栈,用于部署和运营 AI 推理,让企业、政府机构与新型云服务商无需自行拼装、集成和维护整套软件即可获得云 AI 服务的替代方案。该栈整合了经验证的开源权重模型、将预填充与解码分离的推理服务层、承担认证/计量/路由/调度的控制平面,以及 Scality AI 数据基础设施(ADI)。据 GlobeNewswire 新闻稿,其核心价值在于应对企业生产级 AI 的三大痛点——token 按量计费导致的成本不可预测、模型版本与量化不受控、敏感数据的主权风险。Scality 披露,ADI 可将 KV 缓存扩展到 GPU 高带宽显存之外,测试中 Gemma-3 27B 模型加载仅 1.9 秒、较本地 NVMe 快近 10 倍,14K token 上下文恢复的 warm 首 token 时间仅 166 毫秒。IDC 存储与数据管理副总裁 Nataliya Yezhkova 亦表示,本地推理正成为越来越多企业级与公共部门工作负载的可信选项。

万有知兴点评

Scality 把「本地化推理」从口号做成一套可整体交付的开源栈,正面回应了企业 AI 从实验走向生产时最真实的三个焦虑——成本、可控性、数据主权,这是私有化部署路线的重要注脚。

  • 1.对企业落地意味着:按 token 计费的云 AI 用越勤越贵、账单难预测,是许多企业不敢规模化投入的根本原因;Scality 用「自有基础设施 + 统一交付栈」把推理成本转成可控的固定投入,并把模型生命周期与数据主权牢牢握在企业手里。对制造、能源等数据敏感、数据量大的行业,本地化推理正在成为云服务之外越来越现实的选项,企业应重新评估「上云还是私有化」的成本结构。
  • 2.可借鉴的启示:Scality 的核心技术卖点——把 KV 缓存扩展到 GPU 显存之外、用高性能对象存储换取 GPU 利用率提升,说明私有化 AI 的瓶颈不仅在模型,更在「如何让有限的 GPU 高效地服务长上下文与智能体负载」。企业在规划私有化部署时,不应只盯 GPU 算力,还要同步设计好高性能存储与缓存层,否则花大钱买卡却跑不出应有的吞吐。
  • 3.更深一层:IDC 高管的背书与「本地推理进入可信选项」的判断,反映出产业界对「云与本地混合、关键负载留在本地」这一趋势的共识正在形成。这给国内企业级 AI 服务商一个重要启示:纯云或纯私有化的极端路线都不如「关键敏感负载本地、弹性负载上云」的混合架构更有市场,能同时交付本地部署能力与统一运维者,将更受中大型客户青睐。

原文:Business Insider(GlobeNewswire) ↗

点评为万有知兴原创观点,转载需注明出处。

看完别人怎么落地,不如看看自己该从哪开始

2 分钟测出你的企业 AI 落地成熟度。

免费做落地测评