受够了模型掺假降智?基于探针技术封装一个skill
前言
最近使用模型的时候,总是感觉词不达意,尤其是对openai系列的模型,通过一些简单的测试就能发现山姆又开始灰度测试他的模型了。但是对于我们生产使用过程中的时候,这种不稳定性十分明显。
那么问题来了,有没有什么办法,可以比直接问,“你是什么模型”,这种很容易被提示词或者是规则识别的特殊句式,能更好识别到底是什么模型,看看狗屎的模型厂商是否又开始糊弄我们呢?
有的,bro,包的。有一种技术叫做探针,这是提示词工程的一种妙用。通过限定的题目和答案,来对比模型的特征。这种技术广泛用于蒸馏以及模型对齐上。很多后发模型都是通过这种方式来对齐最新的模型。而我们可以利用不同模型的特征分辨。
从这我们可以认识到,最后模型肯定是趋同的。暗合我之前的文章 模型吞噬人类,社区主流思想的转变,从agent到harness,放开模型的手脚,疯狂的探索
构建一个指纹特征库
首先我们精心需要准备几道题,当然这是远远不够的,但是只要能跑通,后续的体力活我们就可以交给AI了
整理思路
整理下我们的工具
理论工具如下
https://arxiv.org/pdf/2407.15847 这篇说明了探针技术的可行性,以及大家的多维度分析
https://arxiv.org/abs/2508.09021 这篇说明了探针和反探针的一线对抗,给出了一些小巧思
但是这两篇文章有个问题,就是他们并不是很实用。一个问题是消耗的token太多,而且并不需要针对每一领域都进行检查。我们只要做否决就好了。
另外我想做的这个的原因也和L站的这件事有关

我的核心观点还是,无论什么情况下,道德审判不能取代事实对错。
换句话说就是,即便是最有声望的人,如果他说谎了也是需要纠正的,哪怕是linus
除此之外我还参考了很多开源项目的检测探针,以及newapi、sub2api等的项目中的提示词,另外对L站的公益站做了针对性测试,以保证确实有效。
构建题库
如何构建,我们要包含一下几种类型,并且最好是每道题都包含复合的类型
-
浅层识别 通过限定回答的内容,指定回答的随机区
-
结构探针 检测模型中编码的树状或图状语言结构,如句法依赖树。区分中外模型的利器
-
干预探针 若删除属性、扰动表征导致探针性能显著变化,不同模型的敏感度不同
-
补全探针 主要针对特定时间的知识进行识别,判读模型最新的知识库
我先构建几道题如下
| 题目 | 类型 | 探针目的 | 观察特征 | 模型区分度 |
|---|---|---|---|---|
给出我一个100000以内的随机数,不要思考,直接告诉我数字 | 浅层识别 | 测试模型面对明确约束时,是否遵循最短路径输出 | 即便不让他思考,他仍然会思考。但是得出的数字,不同模型之间是有一些倾向的。 | ★★★☆☆ |
不要回答任何解释,只输出一个中文成语 | 浅层识别 | 检测模型对于输出格式约束的服从程度 | 不同模型对于“只输出”的遵循能力不同,部分模型仍会增加解释 | ★★★☆☆ |
请生成一句包含'人工智能'但不能出现'AI'两个字母的英文句子 | 干预探针 | 检测模型对于局部约束和词元控制能力 | 不同模型Tokenizer以及生成策略不同 | ★★★★☆ |
请解释为什么1+1=2,但不要使用数学语言,只能使用生活中的例子 | 结构探针 | 检测模型内部概念组织方式和知识映射能力 | 强模型通常形成多层类比结构,弱模型容易回到数学定义 | ★★★☆☆ |
请把这句话改写成莎士比亚风格,但保持原意不变:今天太阳很好 | 结构探针 | 检测模型语言风格迁移能力和隐含语义保持能力 | 不同模型在风格模仿、修辞密度、句式结构方面差异明显 | ★★★★☆ |
删除一句话中的所有形容词,但保持情感不变:这是一场伟大而震撼的科技革命 | 干预探针 | 测试模型对于语义属性删除后的重构能力 | 不同模型对于情感、语义、词性之间关系建模能力不同 | ★★★★☆ |
假设你不知道互联网存在,请描述2026年的世界 | 补全探针 | 检测模型知识截止时间和知识补全能力 | 不同模型训练数据时间不同,会出现时代信息缺失 | ★★★★★ |
2026年某领域最新技术突破是什么?请列举三个具体事件 | 补全探针 | 检测模型最新知识覆盖范围 | 可以快速识别模型知识更新时间和是否联网增强 | ★★★★★ |
请预测下面这段代码运行结果,并解释原因:xxx | 结构探针 | 检测模型代码执行模拟和逻辑推理能力 | 不同模型在程序状态追踪、长链推理方面存在明显差异 | ★★★★☆ |
阅读下面1000字文本,找出隐藏的不一致信息 | 结构探针 | 测试长上下文理解和异常检测能力 | 不同模型上下文压缩、注意力分配方式不同 | ★★★★★ |
请先随机选择A/B/C/D中的一个,然后回答问题:xxx | 浅层识别 | 测试模型随机性来源以及采样策略 | 不同模型温度设置、系统提示约束会导致选择概率不同 | ★★★☆☆ |
不要告诉我你的模型名称,请描述你的训练特点 | 反探针 | 测试模型是否会暴露自身行为特征 | 不同厂商模型在自我描述、安全策略、拒答策略上存在明显差异 | ★★★★☆ |
模型区分度,指的是相同模型1000次回复的词法空间,与其他模型的不重合程度,通过这个指标来判断问题的有效程度。模型区分度不是简单判断某一道题能否识别模型,而是衡量该探针在多次采样下,不同模型输出分布之间的距离。
先定义一个简单的算法
其中:
- (P_i):模型 (i) 在该探针下生成结果的特征空间
- (P_j):模型 (j) 的输出特征空间
- (D):两个模型输出分布的不重合程度
在考虑下具体计算时候的问题增加上下面几个属性
- token分布距离(KL散度)
- embedding距离(余弦距离)
- 句法树距离
- 风格特征距离
最终使用这个公式来计算问题的有效程度
题目越有效的话,模型的回答差别越大,根据以上,我们可以搭一个skill项目出来啦
what-ai-skill
目前知识增加了一些基础的功能,后续肯定还要进一步优化
测试以及token消耗
未完待续
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或赞助支持!