共计 1186 个字符,预计需要花费 3 分钟才能阅读完成。
过去几个月,AI 行业悄然发生了一场深刻的变革 。从 Anthropic 突然切断第三方代理接入, 到小米、腾讯相继推出全新的 Token 计费方案, 一系列看似独立的事件背后, 共同指向一个核心趋势: 算力经济学的基本逻辑, 正在被智能体 (Agent) 时代彻底改写。
📌 订阅制的崩塌与算力黑洞
4 月初,Anthropic 正式切断了第三方客户端挂载 Claude Pro/Max 订阅账号的通道 , 这一举动在开发者社区引发强烈反响。几乎同时, 小米 AI 团队的罗福莉通过推文批判了当前智能体行业的算力分配乱象。两家公司的动作看似独立, 却共同揭示了一个行业真相: 大模型正在从“互联网免费午餐”的幻觉中退场, 回归其作为稀缺能源的物理本质。
传统的 SaaS 订阅制建立在“用大多数人的闲置补贴极少数重度用户”的逻辑上。但在智能体时代, 这一逻辑已经失效。以 OpenClaw 为代表的编程代理, 在执行复杂任务时需要进行高频的环境感知和工具调用, 单次任务消耗的 token 可能轻松突破百万级别。按照 Claude Opus 的 API 价格计算, 几个小时的深度编程就可能消耗上百美元的价值——而一份几十美元的订阅费, 显然无法覆盖这样的成本。
这直接导致了订阅制的崩塌。不仅 Anthropic,Google、OpenAI 等企业也采取了类似措施限制第三方接入。国内方面, 智谱、阿里、腾讯等企业的 Coding Plan 服务在 3 月份陆续宣布大幅涨价, 此前如火如荼的低价获客活动草草收场。行业正在集体进行商业化止损, 防止算力黑洞吞噬订阅体系。
🔍 计费模式的演进: 从模糊到精确
- Token Plan 的兴起: 小米和腾讯近期推出的新方案, 明确告知用户周期内可用的 token 数量, 像手机流量包一样实行配额制。这种计费方式是目前兼顾算力紧缺与商业利益的可行解法。
💡 技术层面的反思: 低效堆砌的虚假繁荣
SGLang 核心贡献者赵晨阳将这种现象称为“用消防水龙头浇花”。他发现现有 Agent 框架的缓存命中率惨不忍睹, 为了在复杂任务中不遗忘信息,Agent 往往在每一轮对话中都重新发送全量上下文, 这让为推理引擎设计的提示词缓存机制几乎无效。
这种依靠低效堆砌换来的繁荣必然是虚假的。罗福莉在推文中指出:“痛苦最终会转化为工程纪律。”只有 Token 贵到人们不能挥霍的程度, 开发者才会有动力去思考如何用更少的 Token 完成更多的任务。
📊 行业影响与未来展望
算力供不应求已成为全球 AI 用户必须面对的现实。国内受芯片限制, 算力是“省着花”的存量资源; 国外受电力基建制约, 算力是有上限的增量资源。在这种环境下,“精准配给制”理所应当地出现。
Google 的 Gemini API 增加付费优先级, 小米和腾讯推出 Token Plan, 本质上都是通过价格手段进行资源的最优配置。按 token 使用量计费, 旨在让更具价值的 token 分配给能创造出更多价值的人。