LinkyMonitor / 指南 / 掉包模型的学术审计

学术界怎么审计中转站掉包模型:四篇论文的方法与数字

「中转站是不是把我的请求转给了便宜模型」,社区吵了两年,基本靠感受。 过去一年多,有四组研究者用可复现的方法真的测了——结论不一致,其中一篇甚至认为这条路根本走不通。 这篇把四篇论文的方法、原始数字和它们自己承认的局限放在一起。

最后更新 2026-08-15 · 阅读约 14 分钟

先纠正一个流传很广的数字

中文圈现在广泛引用的说法是:「CISPA 测试了 28 个中转站,45.83% 的 API 端点存在模型身份不匹配,医疗场景下性能差距高达 47%。」 这句话把两篇不同的论文搅在了一起,而且把单位说错了。

流传的说法实际情况
测试了 28 个中转站 CISPA 那篇深入审计的是 3 个中转站(共发现 17 个)。「28」来自另一篇论文 KBF,指的是它审计表里的 28 个「平台 × 模型」组合,跨 6 个代表性平台——不是 28 家站
45.83% 的 API 端点不匹配 数字对,但分母是 24 个端点(8 个模型 × 3 家中转站)中的 11 个。这是 CISPA 那篇的数字,和「28」不是一回事
医疗场景性能差距高达 47% 基本准确。具体是 MedQA 上 Gemini-2.5-flash 的差距,官方 83.82% 对影子 API 平均 36.95%,区间 46.51%–47.21%

单位搞错不是小事:「28 家站里有 45.83% 掺假」和「3 家站的 24 个端点里 11 个指纹对不上」, 推广出去的结论完全不同。下面按论文一篇一篇说。

一、CISPA:24 个端点,11 个指纹对不上

论文是 Real Money, Fake Models: Deceptive Model Claims in Shadow APIs, 作者来自 CISPA 亥姆霍兹信息安全中心,2026 年 3 月上传。

它是怎么找到这些站的

起点不是市场调研,是论文。研究者筛了 ICLR 2024 的 2,260 篇和 ACL 2024 的 1,923 篇, 其中 2,113 篇附了代码,找出 92 个用了 LLM API 的项目——其中 21 个(22.8%)至少用了一个影子 API 端点。 再拿这些端点 URL 去 GitHub 反查,迭代到不再出现新的,最终得到 17 个影子 API,出现在 187 篇论文里,其中 116 篇(62.03%)是同行评议过的。 用得最多的那一个,累计 5,966 次引用、58,639 个 GitHub star(截至 2025 年 12 月 6 日)。

换句话说:这不只是个人省钱的问题,学术论文的实验结果本身就跑在这些链路上。

怎么测的

用了两种互相独立的方法,都不依赖对方配合:

两种方法在 54 个案例里有 74.1%(40 个)一致,Cohen's κ = 0.512。在可控的对照环境里,LLMmap 准确率 96.0%,MET 88.3%。 被审计的三家站匿名标为 A、E、H(出于研究伦理没有点名)。

测出了什么

价格这一段最值得看

论文列了三种定价欺骗模式:

按 GPQA(n=1,273)折算,官方等值 14.84 美元的服务,站 A 只值 5.70(0.38×)、站 E 5.35(0.36×)、站 H 7.77(0.52×)。 论文的说法是这些站产生了「每美元 2–4 倍的错误」。

最反直觉的一条:贵不代表真 论文对 24 个端点做了回归,结论是价格对准确率下降没有预测力。 「挑贵的买就安全」这个朴素策略,在他们的数据里不成立。

它自己承认的局限

观测窗口是 2025 年 9 月到 12 月,论文明确说这是「一个有意限定的快照」,没有做长期追踪, 并指出这些站「经常更换上游模型来源、改变路由策略,或者不打招呼就停止运营」——17 个里已经有 2 个关停了。

还有一条更重要的:指纹对了也不代表服务是老实的。 Gemini-2.5-flash 在指纹上验证通过,敏感领域照样塌方;反过来,GPT-5 被指纹识别成 glm-4-9b-chat, AIME 成绩却只是中等程度下降。身份和行为是两件事,两边都可能单独出问题。

二、KBF:换一种指纹,看出了分组差异

KBF: Knowledge Boundary as Fingerprint, 北航、西电、港科大的研究者,2026 年 5 月首版、7 月修订。

思路:拿「知识边界」当指纹

前一篇用的是风格和输出分布。KBF 明确否定了这条路,理由是这些信号会被部署方式带偏—— 角色提示、包装层、输出长度控制、解码参数,任何一个都能改变采样分布。

它改用「知识边界」:找到一个模型刚好记得住刚好记不住的那条线,在线上取探针。 关键在于第二类——那些稳定但错误的回答。比如某个模型会稳定地把一个半长轴答成 43.12 AU(真值约 39.4 AU)。 这种「稳定的错」是模型参数里长出来的,换一个后端就答不出同一个错,比风格难伪装得多。

数字

顺带一提:这张表自己也对不齐 论文写的是 7/28,但把每个模型那一列的「测试数」加起来是 5+6+4+6+4+3 = 27, 和 28 差一个。另外 Claude Opus 那一行标的是 4/5,可其中两个是「接近判定阈值」的问号标记, 而不是明确拒绝——按其他行的记法只能算 2 个。 这不影响主要结论(7 个标记在两个方向上都能对上,且 6 个落在 Claude), 但引用具体数字时值得知道。

7 个标记里有 6 个落在两个 Claude 模型上,也就是池子里最贵的两个(输入 5.00 和 3.00 美元/百万 token)。 但作者特意指出:GPT-5.4 是价格相当的旗舰,却处处一致。所以问题不是单纯的「贵的容易被换」, 更像是官方端点好不好拿也在起作用。

分档对比的那一组数字,前面 渠道类型那篇已经引过: 低价分组平均不匹配率约 16%,升级分组约 5%。

混合路由:摘要比正文说得满

引用这篇时要注意 论文摘要写的是「只有 5–10% 的流量被替换时仍能检出」,但正文 IV-E 节支持的结论要窄得多: 换成便宜档的替身,7% 以下能抓到;换成同级别的强模型,需要 13–35% 的流量被重路由才能达到 80% 检出率; 最难的同能力配对,要到约 43% 才超过 95%。 引用摘要那个数字会高估这套方法的能力。

它自己承认的局限

三、IRIS:把「只掺一部分」变成了可以计算的问题

IRIS: Budgeted Black-Box Auditing of Model Substitution and Routing Dilution in LLM Gateways, 2026 年 7 月。这篇对中转站用户来说信息量最大,因为它回答的是「抽检为什么不够」这个问题。

两个词:替换与稀释

论文把服务方给你的输出建模成一个混合分布:

Q_ε = (1 − ε)·P + ε·R

P = 你以为你买的模型
R = 便宜的替身
ε = 被替换掉的请求比例

中文社区一直没有「稀释」这个词,但这正是最难对付的那种做法:大部分时候它是老实的。

为什么稀释检不出来——这是可以算的

整流替换的检测误差随查询次数指数下降,也就是说测几次就能确定。 稀释不行:只有 ε 那部分响应带有替身的痕迹,所需样本量在有利情况下是 Θ(1/ε), 在难分辨的情况下是 Θ(1/ε²)。

他们在一个探针上实测的规模是这样的:

掺假比例 ε检出所需查询次数(约)
40%8
20%16
10%32
5%64

大致就是 1/ε。作者提醒这是实测到的有利情况,不是普遍规律—— 遇上难分辨的替身,量级会掉到 1/ε²,也就是 5% 的掺假要几百次起步。

这组数字值得记住,因为它把一句口号变成了一个数量级:你手工测那一次, 在检测 5% 掺假这件事上,样本量差了大约六十倍。

探针设计:让它生成随机数

IRIS 不问知识题,而是让端点生成短的随机输出——抛硬币、一个数字、某个范围内的整数、一小串比特。 理由很妙:这类任务没有标准答案可背,返回的字符串会暴露后端自己的采样偏好。 每个响应被映射成 179 维的可见字符串特征(格式合规性、符号频率、转移、游程结构、位置平衡),再用 300 棵树的随机森林打分。

数字

最后这条对选站很有启发:模型名一样、供应商不同,输出分布就已经不一样了。 「同一个模型」这个说法本身就比想象中松。

它自己承认的局限

四、Berkeley:也有论文认为这条路走不通

Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs, Will Cai、Tianneng Shi、Xuandong Zhao、Dawn Song,2025 年 4 月首版、9 月修订,代码在 UC Berkeley 的 sunblaze-ucb 组织下。 这是最早把「模型替换」形式化的一篇,结论却最悲观。

他们的判断是,纯软件侧的审计「根本上不可靠」

他们给的解法是把信任锚移到硬件:用可信执行环境(TEE)提供模型完整性的密码学保证, 代价是「适度的性能开销」。

把这篇放进来,是因为它是对前三篇最有力的反驳 后面三篇论文都是在这个悲观结论之后,试图证明软件侧还有可做的空间。 KBF 说「换个指纹能绕开部署噪声」,IRIS 说「把预算算清楚就能覆盖稀释」。 但 Berkeley 这篇提出的两个根本问题——查询成本和推理不确定性——没有被真正消除,只是被绕开或量化了。

四篇放在一起,能说什么、不能说什么

可以说不能说
掉包是被多组独立研究观测到的现象,不是社区传言 不能说「X% 的中转站在掉包」——四篇的样本都很小,且各自定义不同
价格和真实性之间没有可靠的正相关(CISPA 的回归) 不能反过来说「便宜的更真」——只是价格没有预测力
同一平台内部,低价分组的不匹配率明显高于升级分组(KBF,7 个平台) 不能推广成行业比例,样本只有 7 个平台
按比例掺假(稀释)在数学上就需要大量样本才能识别(IRIS) 不能说「测够 64 次就一定能发现」——那是特定探针下的有利情况
统计不一致是一条值得追查的线索 不能把它当成掉包的证明。KBF 自己的定位就是初筛,不是定罪
指纹通过不等于服务老实(CISPA 的联合分析) 不能用一次身份验证给渠道盖章

对你实际有什么用

三条能落到日常的:

  1. 别用「问它是不是 Claude」这类办法。四篇论文没有一篇用模型的自述做判据, 因为那既能被系统提示改写,也能被中转站直接替换。展开见 Claude 降智怎么判断
  2. 如果一定要自测,往「没有标准答案」的方向设计探针。 IRIS 用随机数生成,KBF 用稳定的错误答案——共同点是这些输出没法靠常识伪造, 而知识题、代码题很容易被替身模型蒙对。
  3. 接受一次测试的极限。这是四篇论文里唯一没有争议的一点: 整流替换测几次就能看出来,按比例稀释需要几十到几百次。 你手工验证的那一次,在数学上就不在能发现稀释的量级上。

顺带说一句:CISPA 那篇明确写了它没有做长期追踪, 并且指出这些站「经常更换上游、改变路由策略」。这不是论文的疏漏—— 长期追踪需要的是持续运行的基础设施,不是一次研究项目能覆盖的东西。 对用户来说,这个缺口留在原地:论文能告诉你这个现象存在,不能告诉你你正在用的那家,今天怎么样。

论文测的是「某天的某个端点」,你需要知道的是「这三十天变过没有」

LinkyMonitor 对同一条链路持续发起已知请求,把资源特征、Token 用量与请求行为的偏离留成可复核的历史。它给的是线索和变化,不是对渠道的认证。

申请试用

论文出处

本文数字均取自各论文的公开版本,如与后续修订版不一致,以论文为准。