小说去除AI,自己微调模型,过朱雀检测

昨天看到 echoMe佬的帖子在说微调模型去除AI味,他是针对公众号优化的,目前公众号的数据还要做数据清洗,我没那没多token,看到论坛里的佬们很多在写AI小说,俺也训练了一个模型来做AI小说的味道去除。落笔

原始的章节

优化章节

我没有做特定优化,因为我是一台非常mini的设备,只支持小于4k字的输入,每个Linuxdo的账号每天有5次额度,并且单并发可能需要排队。佬们有什么意见可以反馈,我在模型上继续优化一下!

目前的问题

  1. 样本量比较少,还没做充分的低质量数据的微调,如果是纯ai生成的可以进行几次迭代,但是可能会破坏语义。
12 个赞

现在在番茄上发文的话要过检测吗?

试试gpt5.6 sol 中 直出去测朱雀 大概率纯绿 不过gpt情绪不行

1 个赞

这个不能吧, 佬是用了什么提示词吗?

1 个赞

佬,可以分享下微调思路不,基模型是啥?数据集是咋准备的,微调过程这种,期待ing

之前试过高,出来的基本是纯黄,中还能不一样吗。我感觉gpt写小说真的很难读下去,总感觉有些怪怪的味道。

朱雀貌似意义不是很大来着 之前看他们写小说的说的

很简单,直接找个qwen基座就行,主要是如果构建清洗数据和找卡

嗷嗷嗷,没事,图一乐就行,再整点其他的

很厉害,我的那个模型公众号的数据集偏多,这周在准备小说的数据集,大概下周周末左右可以放给佬们体验一下了,就是有些费钱,哈哈哈哈哈

佬现在的模型应该只要原始不是红色的AI特征应该能过朱雀检测了

佬的这个模型是多少的参数啊,我看看能不能在免费云上面跑

佬, 这个可以开源吗? 让我们可以根据自己的小说数据训练.

我用的数据集规模比较少,质量比较差(没token了)。lora的model也比较小。毕竟租卡真的太贵了。

训练模型什么的都是比较简单,主要是设计数据集的思路。我在jetson nx上跑的参数量非常少,等我丰富更多的数据集进去。主要是没啥token了哈哈哈哈

1 个赞

感同身受,我训练出那个模型已经吃了好长时间的图了,数据集这个玩意儿是最难的,而且还需要大量的token做基础过滤,小说我还要人工再过滤一遍,比较情绪丢了就没那个味了,很麻烦

是的,主要是清洗数据巨麻烦。我打算直接本地部署小模型慢慢清洗了。

确实不错哎,全黄变成全绿了,语义也没什么太大变化

正在处理:image.png…
给大佬们看看我的,之前在论坛里一个姥提供的开源代码

正在处理:image.png…,什么都看不见