首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >用 WorkBuddy 整理案件卷宗:从零散材料到规范归档的实操记录

用 WorkBuddy 整理案件卷宗:从零散材料到规范归档的实操记录

原创
作者头像
用户12693105
发布2026-08-16 15:04:40
发布2026-08-16 15:04:40
1390
举报
文章被收录于专栏:提高效率提高效率

一、背景

我从事律师行业,主做建设工程和争议解决诉讼。手头有个案子涉及多起关联诉讼,当事人交付的案卷材料散落在多个文件夹里——判决书、裁定书、证据材料、庭审笔录混在一起,有的文件名是"XXXX号案件卷宗 2024-04-26 10.22.pdf"这种,有的干脆没有案号。

去法院开庭前需要快速找到某一份判决书,结果翻半天找不到。于是我想:能不能让 WorkBuddy 帮我把这些材料按规范整理一遍?

答案是:能,而且比我手动整理快了至少十倍。

二、任务描述

我对 WorkBuddy 说:

"把43甲公司案卷这个文件夹里面,法院的所有判决和裁定文件都单独复制一份,复制件集中放在桌面的新建的文件夹里。"

就这一句话。WorkBuddy 自动完成了以下工作:

1. 1. 扫描整个案卷文件夹(含子文件夹),找出所有 PDF 文件

2. 2. 逐个打开 PDF,识别哪些是法院判决书或裁定书

3. 3. 将识别出的法院文书集中复制到桌面新建文件夹

三、实操过程

第一步:文件扫描

WorkBuddy 首先递归扫描了案卷文件夹,列出所有 PDF 文件。我的案卷文件夹结构比较复杂,有多个子文件夹:

43甲公司案卷/ ├── 01对方律师发的案卷材料/ │   ├── 1、其他案件卷宗/ │   │   ├── XXXX号案件卷宗 2024-04-26 10.22.pdf (288页) │   │   ├── XXXX号案件卷宗 2024-04-26 11.23.pdf │   │   ├── XXXX号案卷第一册-2.pdf │   │   └── ... (共10个案卷PDF) │   └── 2、本案一审判决书/ │       └── 一审判决书-20260810签收-甲公司酒店.pdf (36页) ├── 02法院电子送达/ │   └── (2025)鄂01民终XXXX号_民事判决书.pdf └── ...

【截图位置:插入案卷文件夹原始结构截图】

第二步:文书识别

这一步是最关键的。很多案卷 PDF 是扫描件,没有文字层,WorkBuddy 需要把扫描页渲染成图片来识别文书类型。

具体来说,WorkBuddy 对每个 PDF 做了这些操作:

· 用 Python 的 PyMuPDF 库打开 PDF

· 检查每页是否有文字层(page.get_text())

· 如果有文字层,直接提取文本识别案号和文书类型

· 如果是扫描件(无文字层),将页面渲染为图片(page.get_pixmap(matrix=fitz.Matrix(2, 2))),然后视觉识别

比如那份288页的XXXX号案件卷宗,完全是扫描件,WorkBuddy 逐页渲染图片后,从封面识别出案号"(2011)某民二初字第XXXX号"、案由"合同纠纷",确认这是一份法院卷宗。

【截图位置:插入WorkBuddy识别PDF封面信息的对话截图】

第三步:集中复制

识别完成后,WorkBuddy 在桌面创建了新文件夹"甲公司案-法院判决裁定文件汇总",把所有法院文书复制过去。最初整理出15个文件。

第四步:按时间排序+规范命名

接下来我又说了一句话:

"把甲公司案-法院判决裁定文件汇总,里面的文件按照时间排序,并且在每个文件名字上标注文书时间和案号。"

WorkBuddy 逐个打开文件,提取判决日期和案号,按时间从早到晚排序,并用统一格式重命名:

[YYYYMMDD]_[案号]_[文书类型-当事人].pdf

整理后的文件列表(按时间排序):

20070827_(2007)汉民二初字第XXXX号_民事判决书-资产转让纠纷.pdf 20140827_(2014)鄂江汉民二初字第XXXX号_民事裁定书-撤回本诉.pdf ... 20260807_(2025)鄂0103民初XXXX号_一审民事判决书-甲公司酒店.pdf

时间跨度从2007年到2026年,整整19年的关联诉讼材料,一次性整理到位。

【截图位置:插入整理后的文件夹截图,展示规范命名的文件列表】

四、踩过的坑

坑1:扫描件无文字层

部分法院文书是拍照扫描的 PDF,PyMuPDF 的 get_text() 返回空字符串。解决办法是渲染为图片后视觉识别。WorkBuddy 自动处理了这个问题,但如果你自己写脚本,一定要注意检查 len(text) > 0。

坑2:日期被印章遮挡

有些判决书的落款日期盖了红色公章,扫描后很难辨认。WorkBuddy 的处理方式是:高分辨率渲染该页(Matrix(2.5, 2.5)),放大看局部。实在看不清的,根据卷宗内相邻文书的日期推断,并在文件名中标注为近似值。

坑3:同一案号有多份文书

比如XXXX号案件同时有判决书和管辖异议裁定书,需要区分文书类型分别命名。WorkBuddy 通过识别"民事判决书""民事裁定书"等标题关键词来区分。

五、效果对比

项目

手动整理

WorkBuddy

文件扫描

人工逐个打开查看

自动递归扫描

日期提取

逐页翻找落款

自动渲染识别

重命名

手动逐个改

批量自动完成

耗时

约2-3小时

约15分钟

六、总结

作为律师,案卷整理是最基础但也最耗时的工作。以前拿到一堆散乱材料,光是理清楚有多少份判决书、分别是什么案号、什么时间,就得花大半天。

用 WorkBuddy 之后,一句话下达任务,它自己扫描、识别、提取、命名、归类,十几分钟就搞定了。而且整理完的文件命名规范统一,后续查找特别方便。

建议同行朋友试一试,尤其是处理复杂案件(多案号、多文书类型、时间跨度大)的时候,效率提升非常明显。

本文基于真实案件整理过程撰写,已隐去当事人敏感信息。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、背景
  • 二、任务描述
  • 三、实操过程
    • 第一步:文件扫描
    • 第二步:文书识别
    • 第三步:集中复制
    • 第四步:按时间排序+规范命名
  • 四、踩过的坑
    • 坑1:扫描件无文字层
    • 坑2:日期被印章遮挡
    • 坑3:同一案号有多份文书
  • 五、效果对比
  • 六、总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档