我们每天都会浏览大量网页:商品列表、热门榜单、行业资讯、公开目录、招聘信息、课程资料……这些内容看起来只是页面上的文字和图片,背后其实都是可以被整理和分析的数据。
这是我们 AI 学习打卡群第十五周的作业:从网页中采集公开数据。
本周出题人是黄亮,他所在的公司主要从事生活方式类商品销售。因为团队平时出差较多,对机票的需求也比较大,他注意到:网上虽然有很多机票搜索平台,但不同平台展示的价格和信息往往存在差异。
如果能用 AI 自动采集、整理和分析机票信息,不仅可以帮同事节省比价时间,也可能为公司的行政工作带来一些效率提升。
因此,这周我们把“爬取网页数据”作为一个实战选题,一起学习如何借助 AI,把网页上的公开信息转化为可以整理、比较和使用的数据。
黄亮计划采集机票销售网站上的信息。对机票需求不大的同学,也可以选择自己感兴趣的网页,例如:
不需要一开始就追求复杂的网站或庞大的数据量。找一个真实的小需求,把整个流程完整跑通,比采集多少条数据更重要。
工具和形式不限
大家可以根据自己的基础和使用习惯选择工具,例如:
使用 Python 配合 requests、BeautifulSoup 完成基础采集
使用 Playwright 或 Selenium 处理动态网页
使用 AI 分析页面结构、定位字段并生成采集脚本
将采集结果整理成 Excel、CSV 或 JSON
基于数据制作一个简单的比价表或查询视图
不会写代码也没关系。
现在使用 Codex、Claude Code、WorkBuddy 等智能体,我们可以先用自然语言说明目标,例如:
请分析这个网页,提取每条机票信息的出发时间、到达时间、航空公司、价格和链接,并整理成表格。
如果网页存在翻页、滚动加载或者动态请求,也可以继续让 AI 帮助定位数据来源、修改脚本和检查结果。
形式不限,关键是让流程能够稳定跑通,并且真正拿到自己需要的数据。
建议完成步骤
第一步,选择一个公开、可以正常访问的网页,并明确自己的实际需求。
第二步,确定要采集的字段。不要笼统地说“把整个网站爬下来”,而要明确到名称、价格、时间、日期、链接等具体内容。
第三步,让 AI 帮助分析网页结构,选择适合的采集方式并生成代码。
第四步,先采集少量数据进行验证,检查是否存在字段错位、内容遗漏、重复记录或格式异常。
第五步,根据采集结果继续完成一项实际任务,例如:
比较不同平台或不同时间的机票价格
筛选符合预算和出行时间的航班
汇总某类商品的价格区间
分析招聘岗位的技能要求
建立一个可以重复运行的数据更新流程
完成标准
本周作业主要看两个方面:
是否借助 AI 成功获取了自己想要的数据。
是否进一步使用这些数据,帮助自己完成了一项实际任务。
也就是说,程序“成功运行”只是第一步。
更重要的是,数据是否准确、是否可用,以及它有没有帮助你减少重复劳动、提高判断效率,或者解决一个真实问题。
数据采集的边界
网页数据采集并不天然等于违规,但也不能简单理解为“网上能看到的数据都可以随意抓取”。
本次作业只采集公开且允许访问的信息,不绕过登录、验证码、付费限制和其他访问控制,不破解接口,不采集个人隐私或敏感数据,也不要进行高频、大规模抓取。
使用数据时,还需要关注网站服务协议、知识产权、个人信息保护、数据使用目的和访问频率。如果网站明确禁止自动采集,应当尊重其规则并更换数据来源。
这次练习的目标,是学习如何合理地使用公开数据,而不是挑战网站的安全和访问边界。
数据只有被使用,才会产生价值
这是一个对个人和团队都很实用的练习。
我们每天接触大量数据,但真正阻碍数据发挥价值的,往往不是“没有数据”,而是数据散落在不同页面中,没有被整理,也没有进入实际工作流程。
从机票比价这个小需求出发,我们可以看到一条清晰的路径:
发现问题,采集数据,整理数据,分析数据,最后用数据辅助行动。
有些企业拥有大量数据,却没有真正利用起来。AI 智能体的发展,正在改变数据与服务之间的连接方式。
此前已经出现企业尝试通过 MCP 等方式,把商品、订单或服务能力直接开放给智能体。当智能体能够查询商品、比较信息,甚至调用企业提供的接口完成下单时,它就不再只是一个聊天工具,而可能成为连接用户与服务的新入口。
这周,我们的 AI 学习打卡社群也开放了 MCP。随着大家逐渐习惯使用 Codex、Claude Code、WorkBuddy 等智能体工作,未来通过智能体查询商品、比较价格、安排出行和调用其他服务,也会变得越来越自然。

AI 会带来很多改变,其中不少变化是我们现在还无法准确预料的。
但我们可以从一个个具体的小需求开始,亲自理解这种变化是如何发生的。
本周,请找一个你真正感兴趣的网页,用最趁手的工具,把需要的公开数据采集并整理出来。如果还能进一步利用这些数据,解决一个真实问题,这次作业就完成得非常有价值。