推理与性能产业与竞争治理与合规

智能越便宜,账单越贵:医院和保险公司已经打起来了

美国的医院与商业保险公司,正拿着同一套算法工具彼此消耗。医院让算法重新过一遍病历,把普通住院包装成更复杂的病例,向保险公司多收钱;保险公司也用算法倒查同样的病历,从中挑刺寻找拒赔理由。每一次来回拉扯的边际成本降到了近乎为零,双方围绕单个病例能反复交手好几个回合。美国蓝十字蓝盾协会把这笔账算了清楚:短短两年时间里,单是那些在该协会看来诊疗过程毫无实质变化的病例,就让其旗下的商业健康险计划多付了 9.42 亿美元。

推动这场角力升级的,恰恰是便宜本身。以前查看一份病历、撰写一份拒赔说明需要耗费人工工时,所以一般两三个回合以后,双方就会打住;现在每一轮交锋的边际成本几乎可以忽略不计,博弈轮次就水涨船高。智能越便宜,账单反而越贵。医疗领域的互搏只是最直观的样本,同样的动力也在别处运转。

模型降价并非凭空想象,而是有扎实数据支撑。长期追踪模型计算成本的机构 Epoch 系统测量了多个主流模型在五个基准测试中的调用价格。他们在 2026 年 9 月的报告中给出明确的趋势:在不降低性能的情况下,大模型的 token 调用价格每个季度平均下降约 47%。在新技术刚突破时,单季降幅甚至达到 66%;即使技术扩散两年后,同等性能的单季降幅依然能维持在 32% 左右。

每个季度腰斩近半的数据固然属实,但总账单的持续走高也同样确凿。开发者在控制台里见到的 API 牌价,充其量只是整套系统账目中最薄的一层切片。穿透牌价往深处看,消费端享受着巨额隐性补贴,企业端面临调用量膨胀,公共测试平添了大笔开支,行业内部还在互相发起算法对抗,每一处都在把实际总账推向高位。而在整套体系的最外圈,甚至还高悬着一笔连精算模型都开不出标价的风险敞口。

基础模型单位 token 成本每季度大幅下降,系统层的总智能支出却在多重机制推动下持续上涨。

公开牌价是任何人都可以查看的,也最让人产生支出可控的错觉。要想搞清楚钱到底去了哪里,不妨从离开发者最近的个人订阅补贴开始看起。

第一本账:补贴:价格按在均衡价之下

许多技术团队习惯以每月 200 美元的个人订阅为成本锚点,认为只要支付这笔固定会员费就能锁定系统的全部使用开销。芯片与前沿技术研究机构 SemiAnalysis 在 2026 年 6 月做了一组实测。他们购买市面上顶配规格的个人订阅账号,在受控环境下持续运行长流程的高难度编程任务,直到耗尽每周配额,随后对照公开的 API 牌价,将消耗的 token 重新折算成理论账单。

算出来的差距相当惊人。按 SemiAnalysis 的估算(未经厂商确认),在最充分利用率下,一个月 200 美元的 ChatGPT Pro 账号,最高能顶 14000 美元的 API 牌价算力;同样的每月 200 美元的 Claude Max 20x 账号,折算出的理论价值也有约 8000 美元。对重度使用者而言,厂商给的 API 牌价补贴倍数可达 40 至 70 倍,远超此前行业猜想的约 10 倍。

商业模式分析学者 Gennaro Cuofano 认为,厂商在订阅上倒贴的这部分差价,本质上是在为未来做一笔战略采购预算。对顶尖实验室来说,目前最稀缺的生产资料是资深工程专家如何在真实业务里让智能体去解决复杂问题的交互轨迹——这些正是训练下一代模型极其宝贵的语料。另一方面,固定订阅本身也是一张押注计算成本快速通缩的看涨期权,提前锁定了用户的工作流习惯。只要底层推理成本继续下探,未来的实际交付成本就会逐步收缩,这项业务自然会慢慢实现盈利。

这种以换取高质量信号为目的的超额补贴,必然带有明确的有效期。2026 年 9 月下旬 OpenAI 发布 GPT-6 Sol 和 Luna 时,官方 API 定价约为上一代的一半,Sol 的输入和输出分别降至 2 美元/百万 token 和 10 美元/百万 token,各项基准表现大致相当。各家实验室最顶尖的能力正逐步进入需要严格审批的封闭安全计划,不再直接塞进低价个人套餐。通过个人订阅享受几十倍补贴的窗口期正在逐步关闭。实验室可以在消费端花钱买高质量数据,但一旦转入企业生产环境,面对的却是另一套容不得亏损的商业结算。

第二本账:企业用量:唯一牌价即实价的层

在企业采购和私有化部署的场景里,不存在无限额的免费午餐。根据SemiAnalysis的行业调研估算,Anthropic大约75%到85%的营收来自按量付费的商业合同。企业客户每调用一次API,就要为每一次调用付钱。

为什么企业在每百万 token 官方定价每个季度都在断崖式下跌的情况下,技术预算反而越来越失控呢?模型分发平台 OpenRouter 的分析师 Peter Walker 曾分享过一组供应链数据。过去在简单的单轮问答模式下,一次请求只耗费几百到上千 token。可一旦工程落地改成让智能体自主规划、调用工具并反复自我修正,跑完一个任务消耗的 token 可达传统对话的千倍。该平台的统计显示,从 2026 年 2 月起,平台处理的智能体 token 消耗量足足增长了 14 倍,其中大约 70% 都来自命中缓存的提示词。

为什么降价没有带来总成本下降?原因很简单:即便底层价格每季对折,只要企业为支撑自动化而把调用量放一千倍,用量的乘数效应就能完全抵消降价红利。为支持复杂智能体协作,框架层在状态维护和上下文组装上的额外损耗,又会令实际用量再增一倍。

对于用量难以预测、预算不断失控的企业来说,这促使它们转向新的付费方式。根据媒体 The Information 的独家报道,OpenAI 开始面向一部分企业大客户试行按完成任务结账,OpenAI 官方对此保持沉默未予置评。而在垂直企业软件领域,自动化服务商Sierra,以及被Salesforce以36亿美元收购的客服平台Fin,也已经率先转向只对无需人工介入、完全由算法独立解决的工作任务进行收费。AI编程公司Cognition甚至向企业客户承诺,如果系统没有按约定交付对应成果,客户最高可以拿到1000万美元的信用额度退款。

这种计费模式的变迁,暗示了 AI 服务的买卖双方都在重新定义价值。在过去基于 token 计量的按字数付费的时代,企业掏钱买的不是廉价的文字,而是看得见摸得着的确定性交付。

企业愿意给智能体付费,至少还能用业务成果衡量。但当模型能力触及公共安全和监管时,安全评测的账单就会在暗中以更惊人的幅度暴涨。

第三本账:政府:为测试能力付费

评估这些前沿模型是否会带来破坏性的风险,是各国政府监管部门必须跨越的一道门槛。在美国,专门负责国家安全风险评估的部门是国家安全局的人工智能安全中心(AISC)。

根据华盛顿太阳报记者Jeff Stein在2026年9月24日的报道,两位熟悉机密情报估算的匿名内部人士透露,该中心仅在2026年用于评估和测试前沿大模型的开销就达到了数十亿美元。其中最大的一笔开支是购买最先进的计算能力,其次是支付给行业技术专家的薪水。这笔支出曝光后,五角大楼发言人以安全保密为由拒绝置评,表示国防部不会公开讨论这些工具的技术架构和资源分配。

据美国一些立法者计算,如果真要建立一个全国性的前沿模型常态化监管测试体系,联邦政府每年仅用于测试验证的支出,就可能达到数百亿美元。这远远超出了美国国会预算办公室(CBO)在审查《人工智能安全与创新法案》(H.R. 9363,拟设立专门的人工智能风险中心)时的官方财务评估。当时 CBO 认为年均运行成本仅为约 2000 万美元。另一个筹划全国追踪系统的提案,五年总预算也仅 3600 万美元。这些机密情报估算中的高强度测试花销,比当年政策制定者的案头估算足足高了两到三个数量级。

相比之下,民用方面的安全评测机构要困难很多。负责美国民用前沿模型的测试主力是美国人工智能标准与创新中心(CAISI,前身为美国人工智能安全研究所),它在 2026 财年的实际运营预算也只有大约 1500 万美元。相比之下,大洋彼岸的英国人工智能安全研究所每年有 6600 万英镑的稳定拨款,并且可以优先使用价值超过 15 亿英镑的公共算力资源,还配备上百名全职技术专家。

大模型安全测试之所以越来越贵,主要是因为监管机构和商业实验室都在争夺同一个紧张的算力市场。根据华盛顿太阳报引用第三方整理的信息,按照The Information汇总的数据,Anthropic在过去11个月内签订了约5170亿美元的算力合同和意向书,足以说明顶尖算力的采购成本有多高。前沿模型具有明显的涌现特征,要测出一个高度自主的系统会不会在网络攻防或生物安全上越界,测试方需要构建一个同等规模的算力集群来进行高强度的渗透。每当模型能力跨越一个新的台阶,验证它不会造成破坏的测试成本几乎等同于从零开始重新搭建一个同等规模的计算平台。

在测试成本不断攀升的背后,另一个关键问题是:谁应该来承担这些费用?AI Verification and Evaluation Research Institute 研究员 Nat Purser 提出,可考虑引入一种法定测试规费(levy),由模型开发商按比例分担独立评测所需的算力与人力成本。华盛顿太阳报也报道,Anthropic 和 OpenAI 在私下沟通中都表态,可能愿意承担一定比例的监管测试费用。主流厂商目前也在筹备一个自律组织叫 SAFA,即前沿人工智能标准局,希望通过制定统一标准来降低测试成本。

政府投入巨额资金进行评测,本质上是为防止系统性失控而支付的一笔公共防御成本。但在商业利益直接冲突的真实行业里,当博弈双方都手握极其廉价的智能工具时,整体开销并未缩减,反而被拖入一场谁也退不出的算力消耗战。

第四本账:医疗:武器化

如果我们将文章开头提到的9.42亿美元账单完全展开,可以清晰地看到这场对抗的全貌。密歇根州的大型医疗网络McLaren Health Care首席财务官Dave Mazurkiewicz谈到医院为何要采购算法工具时,直言不讳地说: “All the insurers are using A.I. to scan our charts to look for claims to deny. For the same reason, we’re looking at the same charts today.” 几乎在同一时间,从商业保险公司的角度出发,彼得森健康技术研究所执行董事Caroline Pearson也给出了几乎一模一样的描述。当记者问她,为什么医院和保险机构会为了一个争议病例反复拉锯很多轮次的时候,她的回答只有三个词:“because it’s cheap”。

正因为每次谈判的成本实在太低,这场对抗才陷入难以停止的循环。美国蓝十字蓝盾协会(BCBSA)在 2026 年 9 月 24 日发布了一份数据分析,首次公布了这场算法对抗的真实账单。数据显示,在 2023 年到 2025 年的两年间,BCBSA 旗下的商业健康险计划,仅仅因为医院普遍使用算法辅助编码软件来提高账单复杂度,就多支付了 9.42 亿美元的报销款。

该协会的高管Luke Chalker解释,这9.42亿的超额支出仅计算那些收费编码被算法调高但协会认为治疗本身没有改变的病例。在这笔 9.42 亿美元的超额支出里,有 6.53 亿美元直接来自算法从病历文本中提取和补充的次要诊断。每个被算法判断为过复杂的病例,平均让保险公司多支付了约11000美元。

纽约时报在报道里描述了具体做法:医院通过算法重新审阅病人出院小结,在系统中自动追加诸如贫血、低钠血症等次要诊断代码,将原本普通的住院包装成复杂的病例,平均每个病例多收接近 12000 美元,且没有进行任何医疗处置。以主要肠道手术类别为例,算法介入后,最高复杂等级病例的比例从 10.2% 跃升至 22.7%,仅这一类手术就为分析带来了约 6100 万美元的成本上升。Luke Chalker 还给出了一个令人信服的例子,即数据显示多家医院上报的贫血诊断数量猛增,但核对全系统的用药和处置记录,患者实际接受输血治疗的人次并没有相应增加。

围绕这类病历争议的算法工具,已经形成了一个成熟的商业变现闭环。McLaren Health Care 的首席财务官在单方陈述中提到,在上线 SmarterDx 的病历审查软件后,医院每个月能从保险公司多争取到约 100 万美元的收入,而软件开发商则按额外追回金额的一定比例抽取佣金。

这场博弈的总账单背后是一道简单的乘法:交手多少轮,乘上每轮花费多少。过去全凭人工调阅纸质病历、起草拒赔通知,每轮都耗时耗力,双方交手两三个回合往往就会各自收手妥协。如今生成式工具让起草严谨抗辩和排查拒赔漏洞变得几乎零成本,单轮开销降到了谷底,博弈轮数便一路往上走。医疗AI平台Abridge的创始人兼心脏科医生Shiv Rao就曾感叹,眼下实质上是算法在与算法搏杀,智能体在同智能体对垒。单次交互的边际成本归零了,整个系统最终堆叠出来的对抗总账单反而大幅膨胀。

自动化工具压低了单次账单与理赔审核的摩擦成本,却促使医疗机构与保险方之间的博弈轮数和总费用显著上升。

这种技术倒逼通胀的情况并不少见。曾在美国政府担任医疗卫生高级职位的David Brailer博士在Health Affairs网站上发文指出,当年电子病历(EHR)的普及虽然提升了信息可读性,但也降低了对过度编码的门槛。如今生成式技术的涌入同样预计将推高医疗通胀。算法最先学会并吃透的,是那些结构化数据充分、核算回款立竿见影的理赔战场;而在真正关乎疾病治疗和控制成本这类周期长、难见短期成效的核心环节里,技术的渗透却很慢。这从精算师的角度也能看到:普华永道(PwC)在对全美27家健康保险计划的总精算师进行调查后也发现,近70%的受访者把智能文档和自动编码工具列为推高来年医疗成本的前三大原因,本年度医疗成本的上升趋势处于近二十年来的高位。(《健康事务》网站发文)

医疗账单的失控并非一个孤立现象,它仅仅是目前我们拥有精确美元统计数据的一个领域。在网络攻防、金融反欺诈、内容风控这些存在对抗关系的场景中,低成本智能都在把双方推向算力消耗战的泥潭。

医疗领域的账单虽贵,至少还在财务报表上有明确的赔付金额。但在更复杂的真实商业场景里,最危险的一笔潜在开销甚至都没有标价。

第五层:悬空的账

而在整个智能总账的最外围,还有一笔金额更大、却完全没有价格的系统性成本,笼罩在所有部署前沿模型的企业头顶。

据 CSIS 转述,国际再保险经纪机构 Lockton Re 在 2026 年 2 月出具的一份评估指出: “It is clear that CGL insurers do not currently model, underwrite, or price AI risks, so there is likely a growing gap between what insurers intend to cover and what they actually cover based on the policy language.” 也就是说,主流商业综合责任险的承保方目前并没有对自主算法故障或业务中断建立专门的精算模型和定价体系。(行业专项评估)

华盛顿智库战略与国际研究中心(CSIS)在随后的专题报告中给出了一个行业预判:由于自主智能体带来的潜在风险波及面过宽、事故因果定责极度困难,主流商业保险机构很可能在下一轮年度续保时,将涉及自主算法的操作部分乃至全部责任整体剔除在赔付范围之外。这一推测目前尚属行业预判,并未形成板上钉钉的定论。它的分量可以从一个对照里看出来:网络安全保险花了将近二十年才摸索出一套粗糙的承保模型,至今底层验证能力依然欠缺;一旦传统商业险把 AI 责任直接除外,企业在失去保险兜底护栏之后,全面铺开智能系统所面临的财务风险将难以承受。

塔夫茨大学的学者Josephine Wolff强调过,过去的历史损失数据不足以用来建模最前沿系统最重要的未来风险。再保险机构Gallagher Re在2026年6月的研报中指出,Anthropic等顶尖实验室在发布Mythos等尖端模型时采用了严格的封闭准入机制,导致外部保险公司根本没法做穿透式安全测试。面对客观上无法进入测试的系统,承保人只能采取被动防守姿态,正如研报中所总结的:“price uncertainty rather than risk”。这种量化不出的不确定性,往往只能换来令人咋舌的天价保费乃至干脆拒保。虽然业内已经开始尝试将保费和模型评测标准挂钩,但在外部审计架构真正成熟落地之前,许多深度接入自主智能体的业务组实际上处于没有任何商业保险兜底的裸奔状态。

从个人订阅里享受的隐性补贴,到企业实际落地时的用量膨胀,再到政府承担的测试开支,行业间的算法对抗成本,以及悬空的风险兜底,智能系统的真实总账远比代码里几行轻描淡写的 API 调用盘根错节得多。

收束:你自己的五层账单

回到工程实践的架构视角。在系统设计中压缩提示词长度、选用价格更低的模型,可以在某些场景下节省开支。但若仅依赖这类技术优化来衡量整个部门的技术投入,就常会忽略整体。

若真想把智能系统的“总账”算清楚,就得升级那张只看API单价的预算表。沿着上文的分析,我们把几类账本逐层打开,技术管理者在立项和周期核算时,就有五件事要逐项核查:

  1. 补贴层(时效核算):我们正享受的低价/大配额,是不是厂商为收集数据信号给出的阶段性补贴?如果供应商把核心能力打包到受限制的专有计划,现有的单位经济模型还能不能撑住?
  2. 用量层(结算方式):token 单价腰斩的同时,智能体带来的千倍调用膨胀与框架损耗,有没有已经把降价红利吃光?我们是不是该倒逼上游供应商,从按底层字符计价转向按完成任务结账?
  3. 测试层(合规与验证):随着系统承接的核心业务越来越多,用来防幻觉、保可控、做自动化红队测试的验证算力,有没有在研发预算里设专门科目?
  4. 对抗层(外部性):我们的业务处在审核、风控、招投标这种具有明显双边博弈属性的场景里吗?系统用极低的边际成本生成内容或做决策,会不会诱发对手也用算法来打,从而把博弈轮次和维护费用一起推高?
  5. 悬空层(风险尾部):我们用的模型有没有外部审计透明度?如果商业保险续保时把 AI 责任直接剔除,我们有没有足够风险准备金来扛潜在的责任损失?

控制 API 牌价只解决了浮在表面最浅显的一道题目。唯有顺着补贴流向、用量放大、验证开销、对抗螺旋与悬空风险把这五层账翻得明明白白,才能在调用单价继续跳水的同时,把整个系统的综合总账真正稳在可控的区间之内。

鸭哥每日手记

日更的深度AI新闻和分析