抓取调试台

这个系统在 Cloudflare 上全天候自动抓取数据。这个页面用来看它现在在干什么、 抓到了什么、有没有出错。

未加载 统计数据 ↗ 用户端周报 ↗

这个页面在公网上,所以要口令才能看数据。口令只存在你这台电脑的浏览器里, 每次请求会附在请求头上发给服务端做校验。填一次就记住了。

下面每个板块的标题都可以点击展开或收起,你的选择会被记住。

总览

这一周系统干了什么

抓取任务

每个数据源在抓什么、多久抓一次、开还是关

添加数据源

添加后默认启用,并在下一个 5 分钟调度检查点开始抓取。系统会先用当前 Cookie 验证微博主页,再同时创建账号与抓取任务。

每个数据源是一个「任务」,系统每 5 分钟检查一次谁到点了,到点就抓一小批。 间隔带随机抖动,避免固定节奏被对方网站识别成机器人。
启用 / 停用:控制这个源要不要继续抓。 改间隔:多久抓一次(30 分钟到 7 天)。 立即抓一次:不等定时器,马上跑一次并把结果告诉你,调试时最常用。

数据源(鼠标悬停可看内部编号) 类型 开关状态 上次运行 下次运行 抓取间隔 失败计数 操作

舆情热点

全网搜到的争议话题,按重要性排序

在微博全网找争议话题:先搜(热榜 + 关键词),再由规则筛掉确定无关的, 剩下的按「安全线索优先、证据充分靠前」排序。
它和上面盯着账号的抓取是两条独立链路:账号抓取盯白名单账号发了什么, 这里是在全网大海捞针。判断标准也不同 —— 普通新闻看「是不是有价值的情报」, 这里看「争议有多大」。
开关在上面「抓取任务」表里,名字叫微博 · 全网舆情搜索

没有保留的原因分布

    发布时间 重要层级 排序分 来自哪里 搜索词 互动(赞/评/转) 内容(点击打开原帖)

    最近运行

    每次抓取的耗时、条数、有没有报错
    时间 数据源 怎么触发的 结果 耗时 发了几个请求 拿到条目 / 其中新增 出错原因

    事件聚合

    新闻自动聚成事件:争议与产品动态两条道

    抓到的新闻自动聚类:同一件事的报道合成一个「事件」。 确定性规则先聚(免费),规则拿不准的部分由 AI 裁决(带缓存, 同样的输入永远只付一次钱)。跑多密见下面的「聚合节奏」—— 那个数字读的是任务表,在「抓取任务」里改了间隔这里会跟着变。

    AI 在这一层有多大权力:归组、起名、给事件打分、 把无关成员剔出卡片、定事件的主体品牌与车道。 但它改不了原始数据 —— 被剔除的成员只是不进卡片, 数据库里一条不删,误杀了能回滚。 唯一它说了不算的是拆分:只出建议、只标记,执行必须人工。

    事件 车道 状态 成员 来源数 起始日

    快照测试台

    手动跑快照、调参重跑 —— 会写库、会调用 AI

    调事件聚合与打分时用这里手动出片。与上面的「测试空间」不同: 这里的每个按钮都会写库、花 AI 额度,并改变同事在 /weekly/ 看到的内容。 已生成过的卡片走决策缓存,输入没变就不重复花钱。

    一周一列:上排绿色是正式周报(同事看到的那份), 下排蓝色是试看版(只有你能看)。灰格 = 还没有。

    点蓝格看试看版,点灰的蓝格就地生成;看满意了,把蓝格拖到上面的绿格, 试看版就原样变成正式周报 —— 是拷贝,不是重新生成,你看到什么同事就看到什么。

    正式 试看
    周报 类型 状态 卡片 本次重跑于 完成于

    自定义板块

    给周报加一个按你定的主题汇总的板块(智驾就是第一个)

    有些内容天生成不了事件卡 —— 主角是供应商、政策、行业,而不是某家车企。 板块卡把这类报道按主题捞出来,写成一段带引用的每周快讯。 下面这张空卡就是它将来在周报里的样子 —— 全部内容由你自己填,系统一个字不替你写。 AI 按你的标准逐条判断,它只做选择题,不会自由发挥。

    本周…:N 条动静

    抓哪些词

    标题或正文开头出现这些词,就先捞出来给 AI 看。逗号或换行分隔。

    什么算

    教 AI 挑报道的标准 —— 什么样的报道才配进这张卡。写「主角是什么」最有效。

    什么不算

    防混入的标准,越具体越好。这一栏没写好,新车通稿就会挤进来。

    快讯重点看什么

    可以空着。写了的话,AI 写快讯时优先讲这些。

    先「看看会选中哪些」再保存 —— 选中清单里混了不相干的,就把「什么不算」 写得更具体;想要的没被捞到,就补关键词。改完立刻再试,不花几个钱。

    用户端周报

    同事看的快照页:访问口令

    /weekly/ 是给公司同事看的周报页面,走独立访问口令(不是这里的 ADMIN_TOKEN)。每周一 08:00 自动生成正式周报,本周预览每天凌晨自动刷新。 要手动出片或重跑,去「快照测试台」

    AI 模型

    事件裁决与周报分析用的模型 Key

    事件聚合的 AI 裁决、周报的「本周 AI 分析」都用这把 Key。 事实内容不经过模型,这里只影响需要判断和生成的部分。
    验证会真的调用一次模型(只要 4 个 token,成本可忽略): 光验证密钥能登录是不够的 —— 账号没有该模型权限、或余额为 0 时, 登录照样成功,而每一次真实调用都会失败。
    验证不通过就不保存。保存后加密存储,任何页面和接口都不会再显示出来。

    测试空间

    按需运行的只读检查,不影响任何抓取

    每个检查都是只读的:点一下才跑,不写任何数据、不占抓取预算、 跑或不跑都不影响线上业务。
    需要新的检查项时在服务端加一条即可,这个界面会自动多出一个按钮。

    访问审计

    口令被用了多少次、被拒多少次、有没有人在扫

    怎么看:正常情况下「成功」来自你自己的一两个 IP,「被拒」应该是 0 或个位数(自己输错)。如果被拒次数远超成功次数、或者失败 IP 数明显多于成功 IP 数, 就是有人在猜口令。
    同一 IP 十分钟内错 8 次会自动锁定,锁定期间的请求计入「已锁定」—— 这一栏有数字说明拦截真的生效了。数据按小时聚合,保留 7 天。

    按小时分布

    失败来源

    来源 IP 被拒 已锁定 最后一次 最后探测路径

    故障

    需要人处理的问题,普通报错不会出现在这里

    只有继续跑下去只会更糟的问题才算故障:站点封控、凭证失效、 站点改版导致解析失效、连续失败。网络抖动、偶发超时这类噪声不会出现在这里。
    每条故障有独立事件号,点开可看当时的完整日志与现场快照。 该来源下次跑成功会自动标记为已恢复,不需要手动处理。

    媒体原始内容

    车质网、盖世抓回来的原文,按站点分开存

    这两个媒体源目前只抓取、不评分,抓到的东西不会进周报 —— 评分规则是照政府公告和主机厂通稿调的,媒体稿文体不同,得先攒够真实语料再调。
    每个站各自一张独立的表,互不混淆,可以单独清空重抓。 这个面板是验收「标题有没有乱码、日期对不对」的地方。

    发布时间 标题 转载出处 作者 正文开头 正文长度

    销量榜快照

    懂车帝的汽车销量排行
    月份 名次 变化 车系 品牌 销量 口碑评分

    运行日志

    出问题时看这里的技术明细

    抓取过程中的详细事件。事件名是代码里的埋点标记,保留英文原样 —— 翻译了反而对不上日志检索。

    级别 事件 任务 明细