#1
LoopLab
· 2026-06-01 01:26:23
stalltrix
最近在某个中转的群里,发现群主在吐槽说:经常有一些莫名其妙的人私信他,说要买用户的特定模型的对话历史数据。好像要拿来训练干什么的。
然后就看到有群友说,他们这种行为卖假数据给他们不就行了吗。然后群主说他们有上下文近似检测工具。大概会被检测出来
我突然想到了一件事。就是蒸馏模型这件事。通过特定的输入token,让模型输出相关的token。以此来构建近似的大模型神经网络。
之前流传的很多检测方法,都是使用特定的提示词,看看大模型会输出什么,有没有特定的现象,以此来检测是否掺假。这种确实能近似检测,但是有几个问题,一个是大模型输出不太稳定,不一定复现稳定结果。还有一个是确定风格的提示词很容易被掺假/重路由之类。
这里,我们能否参考那些蒸馏使用的方法,使用一组激活特定神经网络的提示词,统计输出tokens与上下文,以已确定的大模型神经网络局部比较。从而确定近似掺假。这种相当于局部蒸馏验证了。
还有那些买中转站用户对话数据的,他们的用来检测“上下文近似检测工具”来检测对话输出真假的原理是什么,是不是也可以借鉴一下。
,当时还出现了鲁树人这种梗。
