LinkyMonitor / 指南 / 掉包模型的学术审计
学术界怎么审计中转站掉包模型:四篇论文的方法与数字
「中转站是不是把我的请求转给了便宜模型」,社区吵了两年,基本靠感受。 过去一年多,有四组研究者用可复现的方法真的测了——结论不一致,其中一篇甚至认为这条路根本走不通。 这篇把四篇论文的方法、原始数字和它们自己承认的局限放在一起。
先纠正一个流传很广的数字
中文圈现在广泛引用的说法是:「CISPA 测试了 28 个中转站,45.83% 的 API 端点存在模型身份不匹配,医疗场景下性能差距高达 47%。」 这句话把两篇不同的论文搅在了一起,而且把单位说错了。
| 流传的说法 | 实际情况 |
|---|---|
| 测试了 28 个中转站 | CISPA 那篇深入审计的是 3 个中转站(共发现 17 个)。「28」来自另一篇论文 KBF,指的是它审计表里的 28 个「平台 × 模型」组合,跨 6 个代表性平台——不是 28 家站 |
| 45.83% 的 API 端点不匹配 | 数字对,但分母是 24 个端点(8 个模型 × 3 家中转站)中的 11 个。这是 CISPA 那篇的数字,和「28」不是一回事 |
| 医疗场景性能差距高达 47% | 基本准确。具体是 MedQA 上 Gemini-2.5-flash 的差距,官方 83.82% 对影子 API 平均 36.95%,区间 46.51%–47.21% |
单位搞错不是小事:「28 家站里有 45.83% 掺假」和「3 家站的 24 个端点里 11 个指纹对不上」, 推广出去的结论完全不同。下面按论文一篇一篇说。
一、CISPA:24 个端点,11 个指纹对不上
论文是 Real Money, Fake Models: Deceptive Model Claims in Shadow APIs, 作者来自 CISPA 亥姆霍兹信息安全中心,2026 年 3 月上传。
它是怎么找到这些站的
起点不是市场调研,是论文。研究者筛了 ICLR 2024 的 2,260 篇和 ACL 2024 的 1,923 篇, 其中 2,113 篇附了代码,找出 92 个用了 LLM API 的项目——其中 21 个(22.8%)至少用了一个影子 API 端点。 再拿这些端点 URL 去 GitHub 反查,迭代到不再出现新的,最终得到 17 个影子 API,出现在 187 篇论文里,其中 116 篇(62.03%)是同行评议过的。 用得最多的那一个,累计 5,966 次引用、58,639 个 GitHub star(截至 2025 年 12 月 6 日)。
换句话说:这不只是个人省钱的问题,学术论文的实验结果本身就跑在这些链路上。
怎么测的
用了两种互相独立的方法,都不依赖对方配合:
- LLMmap:主动指纹。发一组精心构造的输入,把回答嵌入向量空间,和参考库比余弦距离。
- MET(Model Equality Testing):双样本假设检验,α=0.05 下拒绝原假设就说明两边输出在统计上可区分。
两种方法在 54 个案例里有 74.1%(40 个)一致,Cohen's κ = 0.512。在可控的对照环境里,LLMmap 准确率 96.0%,MET 88.3%。 被审计的三家站匿名标为 A、E、H(出于研究伦理没有点名)。
测出了什么
- 身份:24 个端点中 11 个(45.83%)指纹验证失败,另有 3 个(12.50%)余弦距离显著偏离。
- 敏感领域塌方:MedQA(美国医师执照考试题)上 Gemini-2.5-flash,官方 83.82%,影子 API 平均 36.95%。 LegalBench 上差距 40.10%–42.73%。AIME 2025 上,站 A 的 Gemini-2.5-pro 掉了 40.00%,DeepSeek-Reasoner 掉了 38.89%。
- 但不是全线塌方:站 E 在科学类基准上平均只差 2.64%,在 GPQA 上甚至比官方 GPT-5-mini 高出 1.18%。
- 安全行为是双向漂移的:不是一律更差。Gemini-2.5-flash 在 FlipAttack 下,官方 0.90、影子约 0.67–0.68, 影子反而更「安全」;而 GPT-5-mini 在 Base64 攻击下,站 A 是 0.05、官方 0.01。
价格这一段最值得看
论文列了三种定价欺骗模式:
- 信息溢价:站 A 按官方 7.10×/7.25× 的价格卖 Gemini-2.0-flash,而指纹显示它是 Gemini-2.5-flash。
- 折扣替换:站 A 的 GPT-5 定价是官方的 1.00×(平价),指纹却显示后端是 GLM-4-9B。
- 转售加价:站 H 的 GPT-5 收 1.09×,后端是降级的。
按 GPQA(n=1,273)折算,官方等值 14.84 美元的服务,站 A 只值 5.70(0.38×)、站 E 5.35(0.36×)、站 H 7.77(0.52×)。 论文的说法是这些站产生了「每美元 2–4 倍的错误」。
它自己承认的局限
观测窗口是 2025 年 9 月到 12 月,论文明确说这是「一个有意限定的快照」,没有做长期追踪, 并指出这些站「经常更换上游模型来源、改变路由策略,或者不打招呼就停止运营」——17 个里已经有 2 个关停了。
还有一条更重要的:指纹对了也不代表服务是老实的。 Gemini-2.5-flash 在指纹上验证通过,敏感领域照样塌方;反过来,GPT-5 被指纹识别成 glm-4-9b-chat, AIME 成绩却只是中等程度下降。身份和行为是两件事,两边都可能单独出问题。
二、KBF:换一种指纹,看出了分组差异
KBF: Knowledge Boundary as Fingerprint, 北航、西电、港科大的研究者,2026 年 5 月首版、7 月修订。
思路:拿「知识边界」当指纹
前一篇用的是风格和输出分布。KBF 明确否定了这条路,理由是这些信号会被部署方式带偏—— 角色提示、包装层、输出长度控制、解码参数,任何一个都能改变采样分布。
它改用「知识边界」:找到一个模型刚好记得住和刚好记不住的那条线,在线上取探针。 关键在于第二类——那些稳定但错误的回答。比如某个模型会稳定地把一个半长轴答成 43.12 AU(真值约 39.4 AU)。 这种「稳定的错」是模型参数里长出来的,换一个后端就答不出同一个错,比风格难伪装得多。
数字
- 基础验证:16 个生产端点(8 个模型族、3 个价格档,全部经 OpenRouter 并锁定供应商)。 从 16×16 配对矩阵里取出 155 组「有经济动机」的替换(即目标比声称的更便宜,或同档),全部在 p<0.05 下被标记, 而 16 组「自己对自己」的对照零误报。
- 成本极低:完整跑一遍 16 个模型的审计花 0.39 美元,最贵的单个模型(Claude Opus 4.6)0.24 美元。 一次性的探针生成约 22 美元,28 个端点的实地审计约 10 美元。
- 实地审计:总共审计 11 个平台(匿名为 Platform 1–11),公开的表里列出其中 6 个代表性平台, 28 个「平台 × 模型」组合中 7 个被标记(25%)。 按模型拆开:Claude Opus 4.6 → 5 个里 4 个;Claude Sonnet 4.6 → 6 个里 2 个;GLM-4.7 → 4 个里 1 个。 而 GPT-5.4(0/6)、DeepSeek-V3.2(0/4)、Gemini 3 Flash(0/3)全部干净。
7 个标记里有 6 个落在两个 Claude 模型上,也就是池子里最贵的两个(输入 5.00 和 3.00 美元/百万 token)。 但作者特意指出:GPT-5.4 是价格相当的旗舰,却处处一致。所以问题不是单纯的「贵的容易被换」, 更像是官方端点好不好拿也在起作用。
分档对比的那一组数字,前面 渠道类型那篇已经引过: 低价分组平均不匹配率约 16%,升级分组约 5%。
混合路由:摘要比正文说得满
它自己承认的局限
- 只是初筛,不是证据。作者原话是:被拒绝只意味着「在所审计接口上、在所选探针集上统计不一致」, 要指控违约,还需要服务方日志或重复审计。
- 误报率的标定其实很薄。16 组对照 0 误报听起来完美,但样本太小——单侧 95% 置信上界是 17.1%。 作者自己说,这「还不是高风险场景所需要的几百次标定」。
- 探针共享领域和模板,结果可能在块内相关;扩展到 80 次的稳健性测试里出现了 2 次误报(2.50%)。
- 探针一旦公开就会被识别,防御是运营层面的——保持探针「数量多、可更新、看起来普通」,并定期轮换。
三、IRIS:把「只掺一部分」变成了可以计算的问题
IRIS: Budgeted Black-Box Auditing of Model Substitution and Routing Dilution in LLM Gateways, 2026 年 7 月。这篇对中转站用户来说信息量最大,因为它回答的是「抽检为什么不够」这个问题。
两个词:替换与稀释
论文把服务方给你的输出建模成一个混合分布:
Q_ε = (1 − ε)·P + ε·R
P = 你以为你买的模型
R = 便宜的替身
ε = 被替换掉的请求比例
- ε = 0:老实服务。
- ε = 1:替换(substitution)——每一个请求都被换掉。
- 0 < ε < 1:稀释(dilution)——只有一部分请求被换,其余照实服务。
中文社区一直没有「稀释」这个词,但这正是最难对付的那种做法:大部分时候它是老实的。
为什么稀释检不出来——这是可以算的
整流替换的检测误差随查询次数指数下降,也就是说测几次就能确定。 稀释不行:只有 ε 那部分响应带有替身的痕迹,所需样本量在有利情况下是 Θ(1/ε), 在难分辨的情况下是 Θ(1/ε²)。
他们在一个探针上实测的规模是这样的:
| 掺假比例 ε | 检出所需查询次数(约) |
|---|---|
| 40% | 8 |
| 20% | 16 |
| 10% | 32 |
| 5% | 64 |
大致就是 1/ε。作者提醒这是实测到的有利情况,不是普遍规律—— 遇上难分辨的替身,量级会掉到 1/ε²,也就是 5% 的掺假要几百次起步。
这组数字值得记住,因为它把一句口号变成了一个数量级:你手工测那一次, 在检测 5% 掺假这件事上,样本量差了大约六十倍。
探针设计:让它生成随机数
IRIS 不问知识题,而是让端点生成短的随机输出——抛硬币、一个数字、某个范围内的整数、一小串比特。 理由很妙:这类任务没有标准答案可背,返回的字符串会暴露后端自己的采样偏好。 每个响应被映射成 179 维的可见字符串特征(格式合规性、符号频率、转移、游程结构、位置平衡),再用 300 棵树的随机森林打分。
数字
- 模拟稀释审计(m=80、ε=0.3):272 组够格的配对里检出 218 组,平均检出功效 0.85,合并误报率 0.017。 另有 54 组因为「太像」被排除——同族近亲(Qwen3 内部、GPT-4 系、Gemini–Gemma)本来就难分。
- ε 的估计误差约 0.04。
- 实地审计:把同一个开放权重模型固定住,跨 OpenRouter 的不同供应商比对, 15 组配对里有 14 组被判定为可区分。作者归因于真实的量化和算子实现差异,不是人为注入的。
最后这条对选站很有启发:模型名一样、供应商不同,输出分布就已经不一样了。 「同一个模型」这个说法本身就比想象中松。
它自己承认的局限
- 温度为 0 的贪心解码下,这套方法的信息量归零——「重复的单次采样不提供任何证据」。
- ε 的准确估计只对「已登记」的替身成立,否则只能给一个下界。
- 低区分度的配对(这里是 272 组里的 54 组)在合理成本下无法审计。
- 论文引用 GhostPrint 指出:一个弱模型可以被专门微调来伪造指纹。
四、Berkeley:也有论文认为这条路走不通
Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs, Will Cai、Tianneng Shi、Xuandong Zhao、Dawn Song,2025 年 4 月首版、9 月修订,代码在 UC Berkeley 的 sunblaze-ucb 组织下。 这是最早把「模型替换」形式化的一篇,结论却最悲观。
他们的判断是,纯软件侧的审计「根本上不可靠」:
- 基于输出文本的统计检验查询开销大,而且抓不住细微的替换;
- 基于对数概率的方法,被生产环境固有的推理不确定性破坏。
他们给的解法是把信任锚移到硬件:用可信执行环境(TEE)提供模型完整性的密码学保证, 代价是「适度的性能开销」。
四篇放在一起,能说什么、不能说什么
| 可以说 | 不能说 |
|---|---|
| 掉包是被多组独立研究观测到的现象,不是社区传言 | 不能说「X% 的中转站在掉包」——四篇的样本都很小,且各自定义不同 |
| 价格和真实性之间没有可靠的正相关(CISPA 的回归) | 不能反过来说「便宜的更真」——只是价格没有预测力 |
| 同一平台内部,低价分组的不匹配率明显高于升级分组(KBF,7 个平台) | 不能推广成行业比例,样本只有 7 个平台 |
| 按比例掺假(稀释)在数学上就需要大量样本才能识别(IRIS) | 不能说「测够 64 次就一定能发现」——那是特定探针下的有利情况 |
| 统计不一致是一条值得追查的线索 | 不能把它当成掉包的证明。KBF 自己的定位就是初筛,不是定罪 |
| 指纹通过不等于服务老实(CISPA 的联合分析) | 不能用一次身份验证给渠道盖章 |
对你实际有什么用
三条能落到日常的:
- 别用「问它是不是 Claude」这类办法。四篇论文没有一篇用模型的自述做判据, 因为那既能被系统提示改写,也能被中转站直接替换。展开见 Claude 降智怎么判断。
- 如果一定要自测,往「没有标准答案」的方向设计探针。 IRIS 用随机数生成,KBF 用稳定的错误答案——共同点是这些输出没法靠常识伪造, 而知识题、代码题很容易被替身模型蒙对。
- 接受一次测试的极限。这是四篇论文里唯一没有争议的一点: 整流替换测几次就能看出来,按比例稀释需要几十到几百次。 你手工验证的那一次,在数学上就不在能发现稀释的量级上。
顺带说一句:CISPA 那篇明确写了它没有做长期追踪, 并且指出这些站「经常更换上游、改变路由策略」。这不是论文的疏漏—— 长期追踪需要的是持续运行的基础设施,不是一次研究项目能覆盖的东西。 对用户来说,这个缺口留在原地:论文能告诉你这个现象存在,不能告诉你你正在用的那家,今天怎么样。
LinkyMonitor 对同一条链路持续发起已知请求,把资源特征、Token 用量与请求行为的偏离留成可复核的历史。它给的是线索和变化,不是对渠道的认证。
论文出处
- Real Money, Fake Models: Deceptive Model Claims in Shadow APIs — Yage Zhang, Yukun Jiang, Zeyuan Chen, Michael Backes, Xinyue Shen, Yang Zhang(CISPA),arXiv:2603.01919,2026-03-02(v2 03-05)
- KBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing — Yijia Fang(北航), Yiqing Feng(西电), Bingyu Li(北航), Mingxun Zhou(港科大),arXiv:2605.29524,2026-05-28(v2 07-25)
- Which Model Is Actually Serving You? IRIS: Budgeted Black-Box Auditing of Model Substitution and Routing Dilution in LLM Gateways — Yuewei Zhang, Zhi-Hai Zhang, Hanzhang Qin,arXiv:2607.20860,2026-07-23
- Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs — Will Cai, Tianneng Shi, Xuandong Zhao, Dawn Song,arXiv:2504.04715,2025-04-07(v2 2025-09-29)