我从事律师行业,主做建设工程和争议解决诉讼。手头有个案子涉及多起关联诉讼,当事人交付的案卷材料散落在多个文件夹里——判决书、裁定书、证据材料、庭审笔录混在一起,有的文件名是"XXXX号案件卷宗 2024-04-26 10.22.pdf"这种,有的干脆没有案号。
去法院开庭前需要快速找到某一份判决书,结果翻半天找不到。于是我想:能不能让 WorkBuddy 帮我把这些材料按规范整理一遍?
答案是:能,而且比我手动整理快了至少十倍。
我对 WorkBuddy 说:
"把43甲公司案卷这个文件夹里面,法院的所有判决和裁定文件都单独复制一份,复制件集中放在桌面的新建的文件夹里。"
就这一句话。WorkBuddy 自动完成了以下工作:
1. 1. 扫描整个案卷文件夹(含子文件夹),找出所有 PDF 文件
2. 2. 逐个打开 PDF,识别哪些是法院判决书或裁定书
3. 3. 将识别出的法院文书集中复制到桌面新建文件夹
WorkBuddy 首先递归扫描了案卷文件夹,列出所有 PDF 文件。我的案卷文件夹结构比较复杂,有多个子文件夹:
43甲公司案卷/ ├── 01对方律师发的案卷材料/ │ ├── 1、其他案件卷宗/ │ │ ├── XXXX号案件卷宗 2024-04-26 10.22.pdf (288页) │ │ ├── XXXX号案件卷宗 2024-04-26 11.23.pdf │ │ ├── XXXX号案卷第一册-2.pdf │ │ └── ... (共10个案卷PDF) │ └── 2、本案一审判决书/ │ └── 一审判决书-20260810签收-甲公司酒店.pdf (36页) ├── 02法院电子送达/ │ └── (2025)鄂01民终XXXX号_民事判决书.pdf └── ...
【截图位置:插入案卷文件夹原始结构截图】
这一步是最关键的。很多案卷 PDF 是扫描件,没有文字层,WorkBuddy 需要把扫描页渲染成图片来识别文书类型。
具体来说,WorkBuddy 对每个 PDF 做了这些操作:
· 用 Python 的 PyMuPDF 库打开 PDF
· 检查每页是否有文字层(page.get_text())
· 如果有文字层,直接提取文本识别案号和文书类型
· 如果是扫描件(无文字层),将页面渲染为图片(page.get_pixmap(matrix=fitz.Matrix(2, 2))),然后视觉识别
比如那份288页的XXXX号案件卷宗,完全是扫描件,WorkBuddy 逐页渲染图片后,从封面识别出案号"(2011)某民二初字第XXXX号"、案由"合同纠纷",确认这是一份法院卷宗。
【截图位置:插入WorkBuddy识别PDF封面信息的对话截图】
识别完成后,WorkBuddy 在桌面创建了新文件夹"甲公司案-法院判决裁定文件汇总",把所有法院文书复制过去。最初整理出15个文件。
接下来我又说了一句话:
"把甲公司案-法院判决裁定文件汇总,里面的文件按照时间排序,并且在每个文件名字上标注文书时间和案号。"
WorkBuddy 逐个打开文件,提取判决日期和案号,按时间从早到晚排序,并用统一格式重命名:
[YYYYMMDD]_[案号]_[文书类型-当事人].pdf
整理后的文件列表(按时间排序):
20070827_(2007)汉民二初字第XXXX号_民事判决书-资产转让纠纷.pdf 20140827_(2014)鄂江汉民二初字第XXXX号_民事裁定书-撤回本诉.pdf ... 20260807_(2025)鄂0103民初XXXX号_一审民事判决书-甲公司酒店.pdf
时间跨度从2007年到2026年,整整19年的关联诉讼材料,一次性整理到位。
【截图位置:插入整理后的文件夹截图,展示规范命名的文件列表】
部分法院文书是拍照扫描的 PDF,PyMuPDF 的 get_text() 返回空字符串。解决办法是渲染为图片后视觉识别。WorkBuddy 自动处理了这个问题,但如果你自己写脚本,一定要注意检查 len(text) > 0。
有些判决书的落款日期盖了红色公章,扫描后很难辨认。WorkBuddy 的处理方式是:高分辨率渲染该页(Matrix(2.5, 2.5)),放大看局部。实在看不清的,根据卷宗内相邻文书的日期推断,并在文件名中标注为近似值。
比如XXXX号案件同时有判决书和管辖异议裁定书,需要区分文书类型分别命名。WorkBuddy 通过识别"民事判决书""民事裁定书"等标题关键词来区分。
项目 | 手动整理 | WorkBuddy |
|---|---|---|
文件扫描 | 人工逐个打开查看 | 自动递归扫描 |
日期提取 | 逐页翻找落款 | 自动渲染识别 |
重命名 | 手动逐个改 | 批量自动完成 |
耗时 | 约2-3小时 | 约15分钟 |
作为律师,案卷整理是最基础但也最耗时的工作。以前拿到一堆散乱材料,光是理清楚有多少份判决书、分别是什么案号、什么时间,就得花大半天。
用 WorkBuddy 之后,一句话下达任务,它自己扫描、识别、提取、命名、归类,十几分钟就搞定了。而且整理完的文件命名规范统一,后续查找特别方便。
建议同行朋友试一试,尤其是处理复杂案件(多案号、多文书类型、时间跨度大)的时候,效率提升非常明显。
本文基于真实案件整理过程撰写,已隐去当事人敏感信息。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。