作者:亿公子(税务合规 / 大额居间费方向自媒体博主) 适用场景:垂直领域内容素材沉淀、竞品/同行内容监控、知识库自动化建设
我是做税务自媒体的,主攻大额居间费这个细分方向。做垂直内容的人应该都有同感,最难受的不是写不出来,而是这三件事:
所以我用 WorkBuddy 搭了一条采集流水线:每天定时自动抓一篇传播度高的居间费文章,做结构化入库、打上传播度和红线标签,最后生成一个可以点开就看的单文件 HTML 索引。
跑了两个多月,库里已经攒了 25 篇,我每天打开 HTML 就能看到今天进了什么货、风险几级、能不能改。这篇把整套方案和踩过的坑拆给你看,提示词和配置直接能抄。
很多人做自动化采集,上来就写爬虫。我建议先想清楚三件事,否则采回来的都是垃圾。
这是我踩的第一个坑。一开始我把所有讲税的大号都扔进采集范围,结果发现华税、晶晶亮的税月、无极小刀这类号,主体是税务稽查和政策解读,根本不写居间费。混进来之后,素材库变成了大杂烩。
后来我把来源分成三类,写死在提示词里:
① 类:税务稽查专业号(华税、晶晶亮的税月、无极小刀、明税、何博士说税、中国财税浪子)
→ 排除。主体是稽查/政策,不是写居间费的
② 类:居间费内容号(夏花财税、每日一税、税屋、建筑/房地产财税号、头条财税号)
→ 优先采集。长期写居间费,选题对口
③ 类:官方平台(国家税务总局、中国税务报、12366、各地税务局)
→ 排除。查政策和权威背书时单独去,不混进素材池品类对不对,比文章好不好更重要。 一个讲稽查的号写得再好,对居间费选题也没用。
公众号的精确阅读量和转发量,外部是拿不到的。与其假装能拿到,不如老实承认,改用代理指标:
传播度 = 多平台转载频次 + 标题爆款度 + 是否有 10万+ 标识
- 多平台转载:同一篇文章在头条、搜狐、网易、微信都能搜到 → 说明被大量搬运
- 标题爆款度:含"被罚 XX 万""敢收吗""不是灰色收入""别再 XX 了"等结构
- 10万+ 标识:能确认的算高,确认不了就降级为"中高"并注明原因我在元数据里会写明判断依据,比如"标题为损失厌恶型爆款结构 + 三组检索词均命中 → 中高,无精确 10万+ 标识"。这样几个月后回看,还能知道自己当初为什么选它。
这条是底线。我在提示词最后一行写了加粗:绝不自动改写、绝不自动发布。
税务内容一旦出错,轻则平台限流,重则误导读者。AI 只负责把货搬回来、贴上标签,改写和发布必须我亲自过一遍。这也是我把"红线标注"设计成必填字段的原因——下一节细说。
居间费素材库/
├── 资料库索引.md # 总表:序号/日期/标题/来源/传播度/红线/状态
├── 资料库索引.html # 自包含单文件索引(正文内嵌,点开即看)
├── build_index_html.py # 索引生成器
└── 文章/
├── 20260901_居间费不能签税后.md
├── 20260903_三流一致也会被税务重罚.md
└── 20260904_居间费付了税不能抵.md为什么坚持要 HTML?因为 md 文件在浏览器里点开经常是空白或者一堆未渲染的符号,真正会去看的只有能直接点开的那一个文件。让 AI 每天重建一次 HTML,等于给了素材库一个"首页"。
每篇入库文章头部都有 YAML frontmatter,我设计的字段长这样:
---
序号: 25
采集日期: 2026-09-04
标题: 居间费付了,税不能抵——这可能是你今年最亏的一笔钱
来源账号: 融控罗盘|罗盘君(②类头条财税号)
来源平台: 今日头条
原文链接: https://www.toutiao.com/article/7674593767412646442
传播度: 中高(损失厌恶型爆款标题 + 3900万工程312万场景钩子;无精确10万+标识)
可借鉴结构: 痛点场景钩子 → 5%红线算例 → 个税代扣算例 → 稽查三信号 → 五个坑 → 两种合规模式
红线标注: ✅ 低(无任何避税引导)。改写须纠偏4处:①银行大额交易标准误传 ②...
改写状态: 待改写
---重点说三个字段:
「可借鉴结构」——不抄观点,抄骨架。比如"损失厌恶钩子 → 两笔账算给你看 → 稽查三信号 → 五个坑 → 两种模式选一个",这个骨架我下次写别的话题也能用。观点会过时,结构不会。
「红线标注」——这是整个库最有价值的字段。每条都要求标出三件事:
1. 有没有避税引导(❌ 自然人代开1%-1.5% / 个体户园区核定2%-3% / 税收洼地返税)
2. 有没有事实错误(例:把"个人居间费按经营所得"误读,
正确口径是劳务报酬所得、由支付方代扣代缴)
3. 改写时必须改哪几处(列序号,具体到改法)举个真实的例子:今天入库的一篇文里写"对公向自然人单笔转 20 万以上会触发银行大额交易监测"——这不是《金融机构大额交易和可疑交易报告管理办法》(人民银行令〔2016〕第 3 号)的标准,法定口径是"自然人与非自然人银行账户之间当日单笔或累计人民币 50 万元以上"。这句话在自媒体圈传得很广,但它是错的。如果不标出来,我改写时很可能顺手写进去。
「改写状态」——待改写 → 改写中 → 已定稿 → 已发布。有了状态机,我打开库就知道哪些是没动的原料,哪些已经变成了成品。
自动化跑几天就会遇到重复问题——同一个案例被十个号写过,标题不同但内容一样。
我的做法是在提示词里加了一步:检索之后、入库之前,必须先读一遍 资料库索引.md,比对标题和案例主体。
3. 先读取 `居间费素材库/资料库索引.md`,检查候选文章标题或案例是否已在库中
(同标题/同案例只更新不重复),避免重复入库。配套的硬门槛(踩坑后补的):
这个脚本做的事很简单:读总表 → 扫描 文章/ 目录兜底 → 把全部正文内嵌进单文件 HTML。
核心就三个设计:
1. 目录兜底扫描。 只写 .md 忘了更新总表是常有的事,所以脚本会扫一遍目录,没进总表的也一并收录,并在控制台和页脚提示:
indexed_files = {os.path.basename(r["rel"]) for r in records if r["rel"]}
extra_files = []
for fp in sorted(glob.glob(os.path.join(ART_DIR, "*.md"))):
base = os.path.basename(fp)
if base in indexed_files:
continue
fields, body = parse_frontmatter(open(fp, encoding="utf-8").read())
extra_files.append(base)
records.append(dict(...)) # 兜底入库,不漏2. 按未转义竖线切分单元格。 Markdown 表格里如果单元格内容带竖线 |,不转义就会整行字段错位,而且是静默错位,肉眼很难发现:
# 按「未转义的竖线」切分,支持单元格内用 \| 表示字面竖线
cells = [c.strip().replace("\\|", "|")
for c in re.split(r"(?<!\\)\|", lines[i].strip().strip("|"))]所以我在提示词里专门加了一句"单元格内若需写竖线必须转义为 \|"。
3. 风险等级只取单元格开头。 风险栏是"低 + 一长段说明",说明文字里经常出现"两高解释""最高院""税负高"这类词,用全文子串匹配会把低风险误判成高风险:
def risk_level(r):
s = re.sub(r"^[^高中低]*", "", str(r).strip()) # 跳过 ✅/⚠️/❌ 等前缀
if s.startswith("高"): return "高"
if s.startswith("中"): return "中"
if s.startswith("低"): return "低"
return ""跑起来就一行,输出会告诉你收录了多少篇、高中低各多少:
cd "C:/Users/Admin/WorkBuddy/居间公众号/居间费素材库"
python build_index_html.py
# OK -> 资料库索引.html | 文章数: 25 | 高/中/低: 4 4 17 | 生成时间: 2026-09-04 00:02生成的页面带风险等级筛选芯片 + 全文搜索 + 展开/收起全部,正文全部内嵌,离线也能看。页脚有"最后生成时间",一眼能确认今天有没有真的刷新。
最后一步,把上面所有规则写成一条 WorkBuddy 自动化任务。配置要点:
{
"name": "居间费文章每日采集入库",
"scheduleType": "recurring",
"rrule": "FREQ=DAILY",
"status": "ACTIVE",
"prompt": "(下面那段完整提示词)",
"cwds": ["C:\\Users\\Admin\\WorkBuddy\\居间公众号"]
}rrule 只写 FREQ=DAILY 就是每天跑一次;要指定钟点就补上 BYHOUR 和 BYMINUTE,比如 FREQ=DAILY;BYHOUR=8;BYMINUTE=0。
完整提示词(可直接改造成你自己的领域):
你是内容采集助手。任务:每天从第三方平台采集**一篇传播度较高**的
{你的领域}文章,存入「{领域}素材库」,供后续人工改写优化后发布。
执行步骤:
1. 用 WebSearch 检索 {领域关键词} 相关文章,优先来源为②类内容号:
{A号}、{B号}、{C号}。传播度用代理指标判断:多平台转载频次、
标题爆款度(如"被罚XX万""敢收吗")、是否有10万+/阅读量标识。
2. **排除**:①类专业号({不相关的大号,列举})和官方平台
({官方来源,列举})——它们不是写这个主题的,不要入库。
3. 先读取 `素材库/资料库索引.md`,检查候选文章标题或案例是否已在库中
(同标题/同案例只更新不重复),避免重复入库。
4. 选定当天唯一一篇最佳候选,抓取原文正文。
5. 在 `素材库/文章/` 下新建 `YYYYMMDD_简短标题.md`,头部用 YAML
frontmatter,字段:序号、采集日期、标题、来源账号、来源平台、
原文链接、传播度(含判断依据)、可借鉴结构、红线标注、改写状态。
6. 在 `素材库/资料库索引.md` 的索引总表末尾追加一行。
注意:单元格内若需写竖线必须转义为 `\|`,否则会导致字段错位。
7. **必须重建 HTML 索引**(采集未进 HTML 视为任务未完成):
`python build_index_html.py`
8. 交付 HTML 索引文件,让我可直接点开浏览。
9. **绝不**自动改写、绝不自动发布。只采集+入库+更新索引+重建 HTML。
完成后用一句话汇报:今日入库了哪篇、来源、传播度、红线风险等级、
HTML 已收录总数。若当天未找到符合条件的新文章,则跳过入库并说明原因。几个我觉得关键的设计,说明一下为什么这么写:
坑 | 现象 | 解决 |
|---|---|---|
品类混淆 | 稽查专业号混进居间费素材库 | 建①②③类来源清单,写死在提示词里 |
表格静默错位 | 标题里的 | 单元格内竖线转义为 |
风险等级误判 | 说明文字里的"最高院""税负高"被判成高风险 | 只取单元格开头的等级字 |
.md 写了没进 HTML | 只更新正文忘了更新总表 | 脚本加目录兜底扫描 + 页脚提示 |
抓不到正文 | 搜索结果只有标题没有正文链接 | 硬门槛:无原文 URL 的一律不选 |
虚构案例 | "某公司被罚近千万"查无此案 | 无机关/文书号/日期的,标明"不得作真实案例引用" |
一次采三篇 | 质量稀释,每篇都不深 | 提示词里写死"当天唯一一篇" |
跑到现在,库里 25 篇,我的体感变化是:
如果你也在做垂直内容,我建议把 WorkBuddy 当流水线而不是聊天框来用:采集走定时任务,判断固化成字段,人只做签发。
顺带说一句,这套思路不止能用在内容采集——竞品监控、政策追踪、论文文献沉淀,本质都是同一件事:定好来源分级、把判断写成字段、用定时任务收口、最后留一道人工闸门。
完整提示词在上面第七节,欢迎改造成你自己的领域。觉得有用点个赞 👍
声明:文中涉及的税务口径仅为素材标注示例,具体业务请以主管税务机关意见为准,不构成税务建议。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。