
当前全球超过60%的生成式AI服务依托公有云架构部署,2024年以来已发生至少12起由云厂商控制平面故障引发的头部AI服务中断事件,涉及OpenAI、Anthropic、DeepSeek等多家大模型厂商,单次故障最长影响时长超过4小时,直接暴露了当前AI产业云化部署的潜在可靠性短板。

今年7月的一次北美公有云故障至今仍被不少AI从业者提起:故障发生的3小时内,ChatGPT Plus用户无法发起新的对话请求,Claude 3 API的调用成功率跌至17%,数十款依托大模型能力的SaaS产品直接陷入瘫痪。事后的故障复盘显示,这次影响数千万用户的事故根源并非算力节点宕机,而是云厂商的控制平面出现了配置错误。
近两年来生成式AI产业的爆发式增长,直接带动了公有云算力需求的飙升。对于绝大多数AI厂商而言,自建数据中心动辄数十亿元的投入门槛过高,超过90%的AI创企选择将全量训练、推理业务托管在公有云平台上。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录