首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >用 WorkBuddy 定时任务搭居间费素材库:每天自动采集 1 篇高传播度文章,只入库不发布

用 WorkBuddy 定时任务搭居间费素材库:每天自动采集 1 篇高传播度文章,只入库不发布

原创
作者头像
财税亿公子
发布2026-09-04 18:56:16
发布2026-09-04 18:56:16
120
举报

用 WorkBuddy 定时任务搭"居间费素材库":每天自动采集 1 篇高传播度文章,只入库不发布

作者:亿公子(税务合规 / 大额居间费方向自媒体博主) 适用场景:垂直领域内容素材沉淀、竞品/同行内容监控、知识库自动化建设

一、先说痛点:我为什么要建这个库

我是做税务自媒体的,主攻大额居间费这个细分方向。做垂直内容的人应该都有同感,最难受的不是写不出来,而是这三件事:

  1. 不知道同行今天写了什么。居间费这个赛道,每天都有财税号在写,爆款选题就那么多,等我看到的时候热度已经过了;
  2. 看到好文章存不下。收藏夹里躺着几十篇,真要写稿时翻不出来,链接还经常失效;
  3. 抄作业会被带沟里。同行文章里夹着大量"自然人代开 1%~1.5%""园区核定 2%~3%""税收洼地返税"这类避税引导,直接照搬就是给自己埋雷。

所以我用 WorkBuddy 搭了一条采集流水线:每天定时自动抓一篇传播度高的居间费文章,做结构化入库、打上传播度和红线标签,最后生成一个可以点开就看的单文件 HTML 索引。

跑了两个多月,库里已经攒了 25 篇,我每天打开 HTML 就能看到今天进了什么货、风险几级、能不能改。这篇把整套方案和踩过的坑拆给你看,提示词和配置直接能抄。


二、整体思路:先定三条规矩,再谈自动化

很多人做自动化采集,上来就写爬虫。我建议先想清楚三件事,否则采回来的都是垃圾。

规矩一:不是所有"税务号"都该采集

这是我踩的第一个坑。一开始我把所有讲税的大号都扔进采集范围,结果发现华税、晶晶亮的税月、无极小刀这类号,主体是税务稽查和政策解读,根本不写居间费。混进来之后,素材库变成了大杂烩。

后来我把来源分成三类,写死在提示词里:

代码语言:markdown
复制
① 类:税务稽查专业号(华税、晶晶亮的税月、无极小刀、明税、何博士说税、中国财税浪子)
   → 排除。主体是稽查/政策,不是写居间费的
② 类:居间费内容号(夏花财税、每日一税、税屋、建筑/房地产财税号、头条财税号)
   → 优先采集。长期写居间费,选题对口
③ 类:官方平台(国家税务总局、中国税务报、12366、各地税务局)
   → 排除。查政策和权威背书时单独去,不混进素材池

品类对不对,比文章好不好更重要。 一个讲稽查的号写得再好,对居间费选题也没用。

规矩二:传播度拿不到精确值,就用代理指标

公众号的精确阅读量和转发量,外部是拿不到的。与其假装能拿到,不如老实承认,改用代理指标:

代码语言:markdown
复制
传播度 = 多平台转载频次 + 标题爆款度 + 是否有 10万+ 标识

- 多平台转载:同一篇文章在头条、搜狐、网易、微信都能搜到 → 说明被大量搬运
- 标题爆款度:含"被罚 XX 万""敢收吗""不是灰色收入""别再 XX 了"等结构
- 10万+ 标识:能确认的算高,确认不了就降级为"中高"并注明原因

我在元数据里会写明判断依据,比如"标题为损失厌恶型爆款结构 + 三组检索词均命中 → 中高,无精确 10万+ 标识"。这样几个月后回看,还能知道自己当初为什么选它。

规矩三:采集 ≠ 发布,人做判断和签发

这条是底线。我在提示词最后一行写了加粗:绝不自动改写、绝不自动发布

税务内容一旦出错,轻则平台限流,重则误导读者。AI 只负责把货搬回来、贴上标签,改写和发布必须我亲自过一遍。这也是我把"红线标注"设计成必填字段的原因——下一节细说。


三、目录结构:一个 md 仓库 + 一个自包含 HTML

代码语言:bash
复制
居间费素材库/
├── 资料库索引.md          # 总表:序号/日期/标题/来源/传播度/红线/状态
├── 资料库索引.html        # 自包含单文件索引(正文内嵌,点开即看)
├── build_index_html.py    # 索引生成器
└── 文章/
    ├── 20260901_居间费不能签税后.md
    ├── 20260903_三流一致也会被税务重罚.md
    └── 20260904_居间费付了税不能抵.md

为什么坚持要 HTML?因为 md 文件在浏览器里点开经常是空白或者一堆未渲染的符号,真正会去看的只有能直接点开的那一个文件。让 AI 每天重建一次 HTML,等于给了素材库一个"首页"。


四、每篇文章的元数据:把判断固化成字段

每篇入库文章头部都有 YAML frontmatter,我设计的字段长这样:

代码语言:yaml
复制
---
序号: 25
采集日期: 2026-09-04
标题: 居间费付了,税不能抵——这可能是你今年最亏的一笔钱
来源账号: 融控罗盘|罗盘君(②类头条财税号)
来源平台: 今日头条
原文链接: https://www.toutiao.com/article/7674593767412646442
传播度: 中高(损失厌恶型爆款标题 + 3900万工程312万场景钩子;无精确10万+标识)
可借鉴结构: 痛点场景钩子 → 5%红线算例 → 个税代扣算例 → 稽查三信号 → 五个坑 → 两种合规模式
红线标注: ✅ 低(无任何避税引导)。改写须纠偏4处:①银行大额交易标准误传 ②...
改写状态: 待改写
---

重点说三个字段:

「可借鉴结构」——不抄观点,抄骨架。比如"损失厌恶钩子 → 两笔账算给你看 → 稽查三信号 → 五个坑 → 两种模式选一个",这个骨架我下次写别的话题也能用。观点会过时,结构不会。

「红线标注」——这是整个库最有价值的字段。每条都要求标出三件事:

代码语言:markdown
复制
1. 有没有避税引导(❌ 自然人代开1%-1.5% / 个体户园区核定2%-3% / 税收洼地返税)
2. 有没有事实错误(例:把"个人居间费按经营所得"误读,
   正确口径是劳务报酬所得、由支付方代扣代缴)
3. 改写时必须改哪几处(列序号,具体到改法)

举个真实的例子:今天入库的一篇文里写"对公向自然人单笔转 20 万以上会触发银行大额交易监测"——这不是《金融机构大额交易和可疑交易报告管理办法》(人民银行令〔2016〕第 3 号)的标准,法定口径是"自然人与非自然人银行账户之间当日单笔或累计人民币 50 万元以上"。这句话在自媒体圈传得很广,但它是错的。如果不标出来,我改写时很可能顺手写进去。

「改写状态」——待改写 → 改写中 → 已定稿 → 已发布。有了状态机,我打开库就知道哪些是没动的原料,哪些已经变成了成品。


五、去重:先读索引,再决定采不采

自动化跑几天就会遇到重复问题——同一个案例被十个号写过,标题不同但内容一样。

我的做法是在提示词里加了一步:检索之后、入库之前,必须先读一遍 资料库索引.md,比对标题和案例主体。

代码语言:markdown
复制
3. 先读取 `居间费素材库/资料库索引.md`,检查候选文章标题或案例是否已在库中
   (同标题/同案例只更新不重复),避免重复入库。

配套的硬门槛(踩坑后补的):

  1. 检索结果里没有可访问原文 URL 的,一律不选。头条/搜狐搜索经常返回标题但没有正文链接,抓不到正文的条目没有入库价值;
  2. 案例没有税务机关、文书号、日期的,可以入库,但必须在红线栏标明"不得作真实案例引用"。自媒体文章里的"某公司被罚近千万"十个有九个查无此案。

六、HTML 索引生成器:一个脚本收口

这个脚本做的事很简单:读总表 → 扫描 文章/ 目录兜底 → 把全部正文内嵌进单文件 HTML。

核心就三个设计:

1. 目录兜底扫描。 只写 .md 忘了更新总表是常有的事,所以脚本会扫一遍目录,没进总表的也一并收录,并在控制台和页脚提示:

代码语言:python
复制
indexed_files = {os.path.basename(r["rel"]) for r in records if r["rel"]}
extra_files = []
for fp in sorted(glob.glob(os.path.join(ART_DIR, "*.md"))):
    base = os.path.basename(fp)
    if base in indexed_files:
        continue
    fields, body = parse_frontmatter(open(fp, encoding="utf-8").read())
    extra_files.append(base)
    records.append(dict(...))   # 兜底入库,不漏

2. 按未转义竖线切分单元格。 Markdown 表格里如果单元格内容带竖线 |,不转义就会整行字段错位,而且是静默错位,肉眼很难发现:

代码语言:python
复制
# 按「未转义的竖线」切分,支持单元格内用 \| 表示字面竖线
cells = [c.strip().replace("\\|", "|")
         for c in re.split(r"(?<!\\)\|", lines[i].strip().strip("|"))]

所以我在提示词里专门加了一句"单元格内若需写竖线必须转义为 \|"。

3. 风险等级只取单元格开头。 风险栏是"低 + 一长段说明",说明文字里经常出现"两高解释""最高院""税负高"这类词,用全文子串匹配会把低风险误判成高风险:

代码语言:python
复制
def risk_level(r):
    s = re.sub(r"^[^高中低]*", "", str(r).strip())  # 跳过 ✅/⚠️/❌ 等前缀
    if s.startswith("高"): return "高"
    if s.startswith("中"): return "中"
    if s.startswith("低"): return "低"
    return ""

跑起来就一行,输出会告诉你收录了多少篇、高中低各多少:

代码语言:bash
复制
cd "C:/Users/Admin/WorkBuddy/居间公众号/居间费素材库"
python build_index_html.py

# OK -> 资料库索引.html | 文章数: 25 | 高/中/低: 4 4 17 | 生成时间: 2026-09-04 00:02

生成的页面带风险等级筛选芯片 + 全文搜索 + 展开/收起全部,正文全部内嵌,离线也能看。页脚有"最后生成时间",一眼能确认今天有没有真的刷新。


七、挂上定时任务:整条流水线的启动开关

最后一步,把上面所有规则写成一条 WorkBuddy 自动化任务。配置要点:

代码语言:json
复制
{
  "name": "居间费文章每日采集入库",
  "scheduleType": "recurring",
  "rrule": "FREQ=DAILY",
  "status": "ACTIVE",
  "prompt": "(下面那段完整提示词)",
  "cwds": ["C:\\Users\\Admin\\WorkBuddy\\居间公众号"]
}

rrule 只写 FREQ=DAILY 就是每天跑一次;要指定钟点就补上 BYHOURBYMINUTE,比如 FREQ=DAILY;BYHOUR=8;BYMINUTE=0

完整提示词(可直接改造成你自己的领域):

代码语言:markdown
复制
你是内容采集助手。任务:每天从第三方平台采集**一篇传播度较高**的
{你的领域}文章,存入「{领域}素材库」,供后续人工改写优化后发布。

执行步骤:
1. 用 WebSearch 检索 {领域关键词} 相关文章,优先来源为②类内容号:
   {A号}、{B号}、{C号}。传播度用代理指标判断:多平台转载频次、
   标题爆款度(如"被罚XX万""敢收吗")、是否有10万+/阅读量标识。
2. **排除**:①类专业号({不相关的大号,列举})和官方平台
   ({官方来源,列举})——它们不是写这个主题的,不要入库。
3. 先读取 `素材库/资料库索引.md`,检查候选文章标题或案例是否已在库中
   (同标题/同案例只更新不重复),避免重复入库。
4. 选定当天唯一一篇最佳候选,抓取原文正文。
5. 在 `素材库/文章/` 下新建 `YYYYMMDD_简短标题.md`,头部用 YAML
   frontmatter,字段:序号、采集日期、标题、来源账号、来源平台、
   原文链接、传播度(含判断依据)、可借鉴结构、红线标注、改写状态。
6. 在 `素材库/资料库索引.md` 的索引总表末尾追加一行。
   注意:单元格内若需写竖线必须转义为 `\|`,否则会导致字段错位。
7. **必须重建 HTML 索引**(采集未进 HTML 视为任务未完成):
   `python build_index_html.py`
8. 交付 HTML 索引文件,让我可直接点开浏览。
9. **绝不**自动改写、绝不自动发布。只采集+入库+更新索引+重建 HTML。

完成后用一句话汇报:今日入库了哪篇、来源、传播度、红线风险等级、
HTML 已收录总数。若当天未找到符合条件的新文章,则跳过入库并说明原因。

几个我觉得关键的设计,说明一下为什么这么写:

  • 步骤 2 的排除清单必须列举具体账号名。只说"排除不相关的号",AI 判断不了;
  • 步骤 4 强调"当天唯一一篇"。不加这句,AI 会一次给你塞三篇,质量稀释;
  • 步骤 7 明确"未进 HTML 视为任务未完成"。这是我在 AI 偷懒只写 md 不重建索引之后补的;
  • 步骤 9 的"绝不自动发布"加粗。发布是外部动作,必须留给人。

八、踩过的坑,一张表说完

现象

解决

品类混淆

稽查专业号混进居间费素材库

建①②③类来源清单,写死在提示词里

表格静默错位

标题里的 \| 让整行字段偏移

单元格内竖线转义为 \|

风险等级误判

说明文字里的"最高院""税负高"被判成高风险

只取单元格开头的等级字

.md 写了没进 HTML

只更新正文忘了更新总表

脚本加目录兜底扫描 + 页脚提示

抓不到正文

搜索结果只有标题没有正文链接

硬门槛:无原文 URL 的一律不选

虚构案例

"某公司被罚近千万"查无此案

无机关/文书号/日期的,标明"不得作真实案例引用"

一次采三篇

质量稀释,每篇都不深

提示词里写死"当天唯一一篇"


九、效果与小结

跑到现在,库里 25 篇,我的体感变化是:

  • 选题不再焦虑。每天打开 HTML 就有新货,选题从"想不出来"变成"挑一个";
  • 改写变快了。结构和红线都标好了,我只需要往骨架里填自己的案例和口径;
  • 踩雷概率降了。那些错误的法条引用、虚假的大额交易标准,在入库时就被标出来了。

如果你也在做垂直内容,我建议把 WorkBuddy 当流水线而不是聊天框来用:采集走定时任务,判断固化成字段,人只做签发

顺带说一句,这套思路不止能用在内容采集——竞品监控、政策追踪、论文文献沉淀,本质都是同一件事:定好来源分级、把判断写成字段、用定时任务收口、最后留一道人工闸门

完整提示词在上面第七节,欢迎改造成你自己的领域。觉得有用点个赞 👍


声明:文中涉及的税务口径仅为素材标注示例,具体业务请以主管税务机关意见为准,不构成税务建议。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 用 WorkBuddy 定时任务搭"居间费素材库":每天自动采集 1 篇高传播度文章,只入库不发布
    • 一、先说痛点:我为什么要建这个库
    • 二、整体思路:先定三条规矩,再谈自动化
      • 规矩一:不是所有"税务号"都该采集
      • 规矩二:传播度拿不到精确值,就用代理指标
      • 规矩三:采集 ≠ 发布,人做判断和签发
    • 三、目录结构:一个 md 仓库 + 一个自包含 HTML
    • 四、每篇文章的元数据:把判断固化成字段
    • 五、去重:先读索引,再决定采不采
    • 六、HTML 索引生成器:一个脚本收口
    • 七、挂上定时任务:整条流水线的启动开关
    • 八、踩过的坑,一张表说完
    • 九、效果与小结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档