冷知识:博客的评论区不是广告区
刷聚合站,刷到了ZyPlj(ZY知识库)的博文,大概是说,某AI(LLM,下同)中转站的老板,使用AI编写了脚本(或让其代为操作),向一组个人博客的评论区批量发送中转站的推广信息。
看到这篇文章后,如果按传统的文艺表达,那就是『哭笑不得』,按现在的网络用语,那就是,『气笑了』,大概就是『坏人不可怕,就怕坏人有文化』的感觉。
垃圾评论样本,图源ZY知识库,按CC BY-NC-SA 4.0共享,下同1. 前言
关于博客的垃圾评论(下面也偶尔简称SPAM)问题,之前已经有文章介绍过,也分析了一些东西,比如发送者的目的,以及常见的几个类别,有兴趣的读者可以前往阅读。在AI时代,垃圾评论及其发送手段当然会产生一些变体,比如广告内容,传播方式,发布方式的不同。在此情况下,一些老的防护手段依然可以应付,但也有不少手段可能显得力不从心,甚至已经失效。
可以看到AI辅助的一些角度,下文会详细分析,图源ZY知识库因此,本文就针对这个话题展开聊聊。除了讨论技术外,主要也是想当做一种给公告之类的东西,即,请不要尝试往本站的评论区发广告,我不会买你们的产品的,而且也有能力去分析发送方式,去做定向清除。建议各位商家把精力放在改进商品的质量上,不要费心发SPAM了。
2. 病毒式推广
之前的博文提到,个人博客是垃圾评论的重灾区,因为他小,但还有一定的流量进入,所以发送者就可以广撒网式地发送,赌一把站长没空看评论情况,从而让广告信息多存在一段时间。即使是评论需要经过人工审核,也至少会被站长看到,保底也有一次曝光度。另外,由于个人博客(尤其是独立博客)的站长很多都是技术向出身,因此机场(加速器),AI中转站,VPS等有一定技术含量的广告,就更显得是在精准推送。
我们先来分析ZyPlj的那篇博文里提到的软文内容。
图源ZY知识库和传统的脚本推广比较类似的是,AI脚本同样是在评论区的『网址』字段插入站点的地址,正文写几句恭维的话(或者如引言的图中所示,装都不装,直接塞广告),如此重复,发三五条评论。传统脚本一般是预先准备好文案,随机选择并发送,降低每一个文案的复用度(从图中也能看到,那个脚本也使用了类似技术)。但与以前不同的是,AI脚本能做的事情更多了,比如:
- 根据关键词实时生成文案
- 分析博文内容后进行针对性回复
- 实时分析页面上的各类反爬措施,从而有针对性地绕过
很显然,因为有了AI加持,原来的脚本小子SPAM已经演进了,变得更像是一个真人,能智能地进行分析,更加精准地发SPAM。站在商家的角度看,这当然是好事,因为发送成功率大幅上升,能让自己的产品触及更多潜在用户。但对于用户(包括站长和访客)来说,这种SPAM评论自然也是不受欢迎的,跟以前满大街的小广告其实没啥区别,都是挑人多的地方,都是低成本,都是有碍市容,所推广的东西质量也都参差不齐。
另外,从上面的群截图可见,这种脚本还可以进行连锁扩展:通过AI分析并提取站点友链,形成类似病毒感染那样一传十十传百的感染链,只要有一个博客被盯上,他所链接的其他博客也跟着遭殃。显然,这里并不是说友链这玩意不好,也不是说站长做错了什么,而是这更能衬托出发送者的不要脸程度。友链是给你这么用的吗,大哥大姐?
AI脚本最大的问题还不是这个,而是会让人自我感觉良好,换句话说,坏人也许没有文化,但AI帮他有了文化。具体来讲,比如一个普通的老板,可能并不懂得太多的技术知识,但他完全可以把自己的想法告诉AI,『帮我做一个推广程序,向这些博主推广我的xxx产品』,AI就有概率开始自动走歪路,比如开始研发垃圾评论发送器,还想方设法找到更多的目标(比如去博客聚合站,比如扒友链),想办法绕过机制,等等,变成了一个效率极高的干坏事的人。更进一步地,如上面的聊天截图所示,如果站长问他今日发送情况,那么他在如实报告的同时,还会问你要不要加快速度,要不要每个博客多发几篇。
关键在于,AI是不一定懂得这种行为背后的风险与道德考量的。很多云服务商所提供的API(也就是原版大模型)就已经有很大概率不会对此类行为做针对性拦截,你直接跟他说『做个评论批量发送器』就真的会帮你做。更不用提别有用心的人可以下载去审查版大模型,并自行部署。最近新鲜出炉的 Qwen3.8-27B 已经有了很不错的编程能力,几个著名的量化/去审查组也很快就放出了版本,NVFP4量化用4090/5060ti之类的高端显卡就能直接跑起来。虽然显卡的价格较为高昂,但这并非不可能,尤其是并不要求有专业的加速卡,这就已经把门槛降低了很多。
3. 验证码也无用
AI脚本对垃圾评论的加持,其实还有另一个角度。
上文提到,AI脚本可以『实时分析页面上的各类反爬措施』,展开来说就是:
- 读取HTML,分析评论表单位置,提交接口
- 读取JS,分析评论校验措施
- 检测博客所用的CMS,自动读取相应的产品文档,分析提交结构
- 对接NodeJS等引擎,实时跑代码,获取动态token等
- 对接自动化浏览器,全自动发送
- 甚至直接模拟键鼠操作,用真实浏览器,按真实速度进行发送
在传统脚本的年代,上面所提到的几点并非不能实现,而是相对要麻烦些。对AI脚本来说,上面的都是一句话的事情,门槛已经大大降低,背后的真实发送者也更有动力放手让AI去干:找台机器开起来,让AI跑着,自己在一边休息,悠哉悠哉。
另外,传统脚本通常较为死板,对于略微有所变动的评论区就会失去发送能力。网上能看到有很多博主分享的『小撬门』,本质上就是这个思路,比如虽然用的是热门博客主题系统,但我魔改一下,加一个验证码,问问一加一等于几,很多脚本就会因为无法通过验证而发送失败。只要每个人都做一点不同的魔改,脚本很快就会失效。然而AI不同,AI具有自我迭代和自然语言分析能力。放个图片验证码?OCR看看。放算术题?自己动手算一下。直接放Cloudflare Turnstile?开个正经的浏览器,再操控系统鼠标去模拟点击,秒过。
我知道,上面那段排比句可能会让人疑心是否有AI代笔,其实并没有,而是真的有这么多,甚至还有很多我自己都意识不到的手段,等着这些SPAM发送者去发掘。
4. 多管齐下
从上述分析来看,AI时代,单靠少数几个方法也许能提高一点垃圾评论的发送成本,但绝对没办法挡住垃圾评论了。
最好的办法当然就是多管齐下,增加检测维度。最基本的,一些防止自动化提交的东西(比如验证码,动态token,隐藏表单,提交速度限制,甚至是工作量证明等)都可以整上去。另外,评论在后台也要进行关键词拦截处理,比如评论内容含有http://,https://,.com之类的(包括添加空格的变体,和全角字符的变体),或者昵称含有特定关键词(比如中转站,彩票,以及最近出现的算命,姓名打分),一律送人工审核。
有能力的朋友,还可以选择以牙还牙:引入AI(不论是自己训练一个小模型,还是接在线API)来对评论和昵称等进行打分,分数低的一律人工审核,等等。这里特别说一句自己训练小模型:笔者翻了翻资料,基本上都表示,即使是一个参数量不高的的小模型(比如 Qwen3.5-0.8B 之类的),通过『拆掉LM head,换成分类头(Classifier Head),然后进行微调』的方式,也可以比较稳定地实现这种文本二分类,而且直接用CPU跑,速度也不是不能接受,顶多异步处理。如果你有一块不错的显卡,托管博客的VPS内存也够大,不妨试试此路径?具体的操作方法有很多,基本都是用Python来操作,有需要的朋友可以自行查询资料或询问AI,此处限于篇幅,就不再赘述了。
5. 写在最后
垃圾评论何时休?
恐怕休不了,见招拆招吧,他有张良计,我也有过墙梯。
(完)
其实挺羡慕博主的,写博客勤快也有流量,我的网站冷到 PV 都寥寥无几。
以前见过个离谱的,在别家的独立博客推广论坛,结果博主还煞有介事地跟推广贩子聊上了。