抓哪些词
标题或正文开头出现这些词,就先捞出来给 AI 看。逗号或换行分隔。
什么算
教 AI 挑报道的标准 —— 什么样的报道才配进这张卡。写「主角是什么」最有效。
什么不算
防混入的标准,越具体越好。这一栏没写好,新车通稿就会挤进来。
快讯重点看什么
可以空着。写了的话,AI 写快讯时优先讲这些。
这个系统在 Cloudflare 上全天候自动抓取数据。这个页面用来看它现在在干什么、 抓到了什么、有没有出错。
这个页面在公网上,所以要口令才能看数据。口令只存在你这台电脑的浏览器里, 每次请求会附在请求头上发给服务端做校验。填一次就记住了。
每个数据源是一个「任务」,系统每 5 分钟检查一次谁到点了,到点就抓一小批。
间隔带随机抖动,避免固定节奏被对方网站识别成机器人。
启用 / 停用:控制这个源要不要继续抓。
改间隔:多久抓一次(30 分钟到 7 天)。
立即抓一次:不等定时器,马上跑一次并把结果告诉你,调试时最常用。
| 数据源(鼠标悬停可看内部编号) | 类型 | 开关状态 | 上次运行 | 下次运行 | 抓取间隔 | 失败计数 | 操作 |
|---|
微博需要登录凭证才能抓取,而 Cookie 会过期,需要定期更换。
在浏览器登录 m.weibo.cn 后,从开发者工具里复制整段 Cookie 粘贴到这里。
会先验证再保存:验证不通过就不会存,避免坏凭证把抓取卡住。
保存后加密存储,任何页面和接口都不会再显示出来。
在微博全网找争议话题:先搜(热榜 + 关键词),再由规则筛掉确定无关的,
剩下的按「安全线索优先、证据充分靠前」排序。
它和上面盯着账号的抓取是两条独立链路:账号抓取盯白名单账号发了什么,
这里是在全网大海捞针。判断标准也不同 —— 普通新闻看「是不是有价值的情报」,
这里看「争议有多大」。
开关在上面「抓取任务」表里,名字叫微博 · 全网舆情搜索。
| 发布时间 | 重要层级 | 排序分 | 来自哪里 | 搜索词 | 互动(赞/评/转) | 内容(点击打开原帖) |
|---|
| 时间 | 数据源 | 怎么触发的 | 结果 | 耗时 | 发了几个请求 | 拿到条目 / 其中新增 | 出错原因 |
|---|
抓到的新闻自动聚类:同一件事的报道合成一个「事件」。 确定性规则先聚(免费),规则拿不准的部分由 AI 裁决(带缓存, 同样的输入永远只付一次钱)。跑多密见下面的「聚合节奏」—— 那个数字读的是任务表,在「抓取任务」里改了间隔这里会跟着变。
AI 在这一层有多大权力:归组、起名、给事件打分、 把无关成员剔出卡片、定事件的主体品牌与车道。 但它改不了原始数据 —— 被剔除的成员只是不进卡片, 数据库里一条不删,误杀了能回滚。 唯一它说了不算的是拆分:只出建议、只标记,执行必须人工。
| 事件 | 车道 | 状态 | 成员 | 来源数 | 起始日 |
|---|
调事件聚合与打分时用这里手动出片。与上面的「测试空间」不同: 这里的每个按钮都会写库、花 AI 额度,并改变同事在 /weekly/ 看到的内容。 已生成过的卡片走决策缓存,输入没变就不重复花钱。
一周一列:上排绿色是正式周报(同事看到的那份), 下排蓝色是试看版(只有你能看)。灰格 = 还没有。
点蓝格看试看版,点灰的蓝格就地生成;看满意了,把蓝格拖到上面的绿格, 试看版就原样变成正式周报 —— 是拷贝,不是重新生成,你看到什么同事就看到什么。
| 周报 | 类型 | 状态 | 卡片 | 本次重跑于 | 完成于 |
|---|
有些内容天生成不了事件卡 —— 主角是供应商、政策、行业,而不是某家车企。 板块卡把这类报道按主题捞出来,写成一段带引用的每周快讯。 下面这张空卡就是它将来在周报里的样子 —— 全部内容由你自己填,系统一个字不替你写。 AI 按你的标准逐条判断,它只做选择题,不会自由发挥。
标题或正文开头出现这些词,就先捞出来给 AI 看。逗号或换行分隔。
教 AI 挑报道的标准 —— 什么样的报道才配进这张卡。写「主角是什么」最有效。
防混入的标准,越具体越好。这一栏没写好,新车通稿就会挤进来。
可以空着。写了的话,AI 写快讯时优先讲这些。
先「看看会选中哪些」再保存 —— 选中清单里混了不相干的,就把「什么不算」 写得更具体;想要的没被捞到,就补关键词。改完立刻再试,不花几个钱。
/weekly/ 是给公司同事看的周报页面,走独立访问口令(不是这里的 ADMIN_TOKEN)。每周一 08:00 自动生成正式周报,本周预览每天凌晨自动刷新。 要手动出片或重跑,去「快照测试台」。
事件聚合的 AI 裁决、周报的「本周 AI 分析」都用这把 Key。
事实内容不经过模型,这里只影响需要判断和生成的部分。
验证会真的调用一次模型(只要 4 个 token,成本可忽略):
光验证密钥能登录是不够的 —— 账号没有该模型权限、或余额为 0 时,
登录照样成功,而每一次真实调用都会失败。
验证不通过就不保存。保存后加密存储,任何页面和接口都不会再显示出来。
每个检查都是只读的:点一下才跑,不写任何数据、不占抓取预算、
跑或不跑都不影响线上业务。
需要新的检查项时在服务端加一条即可,这个界面会自动多出一个按钮。
怎么看:正常情况下「成功」来自你自己的一两个 IP,「被拒」应该是 0
或个位数(自己输错)。如果被拒次数远超成功次数、或者失败 IP 数明显多于成功 IP 数,
就是有人在猜口令。
同一 IP 十分钟内错 8 次会自动锁定,锁定期间的请求计入「已锁定」——
这一栏有数字说明拦截真的生效了。数据按小时聚合,保留 7 天。
| 来源 IP | 被拒 | 已锁定 | 最后一次 | 最后探测路径 |
|---|
只有继续跑下去只会更糟的问题才算故障:站点封控、凭证失效、
站点改版导致解析失效、连续失败。网络抖动、偶发超时这类噪声不会出现在这里。
每条故障有独立事件号,点开可看当时的完整日志与现场快照。
该来源下次跑成功会自动标记为已恢复,不需要手动处理。
这两个媒体源目前只抓取、不评分,抓到的东西不会进周报 ——
评分规则是照政府公告和主机厂通稿调的,媒体稿文体不同,得先攒够真实语料再调。
每个站各自一张独立的表,互不混淆,可以单独清空重抓。
这个面板是验收「标题有没有乱码、日期对不对」的地方。
| 发布时间 | 标题 | 转载出处 | 作者 | 正文开头 | 正文长度 |
|---|
| 月份 | 名次 | 变化 | 车系 | 品牌 | 销量 | 口碑评分 |
|---|
抓取过程中的详细事件。事件名是代码里的埋点标记,保留英文原样 —— 翻译了反而对不上日志检索。
| 级别 | 事件 | 任务 | 明细 |
|---|