我在学习卢麒元《投资学》课程时,遇到了一个典型痛点:上下两册讲义共1400多页,内容散落在PDF、聊天记录和整理笔记
里,想系统化整理成一份可检索、可引用的Word文档,靠手动做至少要一周。
抱着试试的心态用WorkBuddy做这件事,整个过程出乎意料的顺畅。下面把完整流程拆出来,希望能帮到同样有"知识结构化"需
求的朋友。
一、素材准备:把PDF变成可检索文本
问题:讲义是PDF格式,无法直接搜索关键词。
做法:用WorkBuddy的文档解析能力,把PDF逐页提取为纯文本,保存为txt文件。这样后续所有检索工作都可以在秒级完成。
效果:1400页PDF → 140万字符的纯文本文件,grep任意关键词瞬间出结果。以前翻纸质书找一句话要半小时,现在0.5秒定
位。
二、核心考据:用全文检索定位散落的知识点
这是整个项目最关键的一步。讲义里"十大原则""三三制""剑宗气宗""投资三要素""短股长金"这些概念分布在上下两册不同章节,
靠人翻书会漏掉大量内容。
做法: 1. 把140万字符的文本文件导入WorkBuddy对话 2. 用自然语言提问:"全文搜索'三要素'出现在哪些段落?上下文是什
么?" 3. WorkBuddy逐段提取原文,标注出具体讲次、日期和页码
发现:有几个重要概念讲义里其实没有系统讲过,比如"机器人"在两册全文中出现0次——这说明不能假定名师什么都讲了,得自
己验证。
效果:原本预估需要2-3周的手动整理,实际3天完成,考据精度远超预期。
三、生成Word文档:链式插入法
问题:一篇2.4万字的文档怎么生成?直接让AI一次输出太长,容易中断。
做法: 1. 把内容拆成6个markdown分片(每片约4000字) 2. 通过editor_sdk的doc_insert_markdown接口,按返回的position链
式插入 3. idx=0插第1片 → 返回position=3616 → 用3616插第2片 → 以此类推 4. 最后调用save_file保存为docx
关键技巧:doc_insert_markdown返回的position可以直接作为下一次插入的idx,形成链式操作,无需反复查询文档结构。
最终产出:《卢麒元投资学_核心精编_全文版.docx》——六大部+三附录,每条知识点都标注了出处(讲次/日期/页码),约2.4
万字。
四、实战验证:市场数据的自动拉取与分析
文档整理完成后,我需要验证框架的有效性,于是用WorkBuddy做了实战配置分析:
1 . 批量拉取A股数据:通过westock-mcp工具,24只候选标的的行情、五维评分、财务数据一次拉完
2 . 交叉验证:把讲义里的"实质负利率公式"代入2026年8月真实数据,算出中国当前实际利率约-0.7%
3 . 三三制落位:按框架给每个标的分配长/中/预备队仓位
一个有意思的发现:把"两化"(信息产业化+产业信息化)框架套到23只个股上,用"复式回报>15%"这把尺子一量,全组过关的
只有6只——很多挂着"信创""AI"标签的公司实际并不达标。
五、三个实用技巧
1. 分片法处理长任务
任何超过3000字的生成任务,都先拆成3-6个分片,分别生成后链式组装。避免单次输出太长导致内容截断或质量下降。
2. 用自然语言提问代替指令
不是告诉AI"帮我提取第56000-57000字符",而是问"投资三要素在哪些段落有论述?请引用原文"。后者准确率更高,因为AI理解
上下文更完整。
3. 关键数据交叉验证
AI给出的数据(如PE、ROE)一定要用官方数据源二次确认。这次我用westock-mcp拉了两组独立数据交叉比对,发现个别数据
源有1-2个百分点的偏差。
六、总结
WorkBuddy对我最大的价值不是"聊天机器人",而是**能真正干活的Agent**:
● 140万字符的文献检索 → 3天完成
● 2.4万字结构化文档 → 自动生成
● 24只标的的批量数据分析 → 一次拉完
● Word文档的链式生成 → 零手动排版
整个过程中我消耗的积分,主要花在了深度调研报告(300-800积分/次)和文档解析上。简单的问答和整理用Ask模式就够了,
积分消耗极低。
如果你也在做类似的"知识工程"——无论是整理课程笔记、撰写研究报告、还是批量处理文档,WorkBuddy的Agent能力会比纯
对话工具效率高得多。
本文所有数据均来自2026年9月4日A股真实行情,所有讲义引用均可溯源至具体讲次与页码。文档不构成投资建议。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。