最近一直在研究腾讯元宝。

我想做的事情其实很简单:把它回答过程里展示出来的思考、搜索、搜索结果、引用这些信息,尽量完整地拿下来。

结果折腾了很久以后,我才发现,我们一开始的问题就想错了。

1、我们一开始一直在研究 “怎么抓”

元宝的 “已处理” 里面有很多东西。

有思考过程、有搜索词、有搜索结果卡片,还有 “+4”“+8” 这种继续展开的内容。

所以一开始,我和 AI 一直在研究:

怎么自动把这些东西展开?

然后就开始搞 selector、DOM、自动点击、浏览器插件、MutationObserver……

折腾了挺久,总感觉差一点。

今天我自己按了 F12,随手看了一张已经展示出来的搜索结果卡片。

结果发现一个特别尴尬的事情。

这个卡片明明可以点击,点了以后也确实能跳到外部网站,但是它的 DOM 里面根本没有 href。

这一下我才反应过来:

我们之前一直默认 “它既然是个链接,代码里面就应该有 URL”。

实际上根本不是这么回事。

2、页面 “展示了什么” 和程序“抓到了什么”,完全是两回事

比如元宝的一张搜索结果卡片。

页面展示标题了吗?

展示了。

页面展示完整 URL 了吗?

没有。

DOM 里面直接有 URL 吗?

目前看到的也没有。

但是这个卡片能不能点?

能。

点了以后能不能打开真实网页?

也能。

那程序最终能不能自动把这个真实 URL 拿下来?

这是另外一个问题。

之前我们其实把这些东西全混在一起了。

程序说 “没有获取到 URL”,并不能直接理解成 “这个来源没有 URL”。

有可能只是这个 URL 根本就没有直接写在当前 DOM 里面。

3、后来才发现,我们前面少问了一个最基础的问题

这个问题其实特别简单:

这个页面,用户到底看到了什么?

现在回头看,我觉得这才应该是第一步。

比如每一个数据,都应该先搞清楚:

1)页面上有没有展示?

2)DOM 里面有没有直接暴露?

3)是不是必须点击或者展开以后才会出现?

4)最后程序到底能不能稳定自动获取?

这四个问题是完全不同的。

之前我们直接跳到了第 4 个:

“程序怎么自动获取?”

前面三层都没真正搞明白。

所以才会一直绕。

4、我现在觉得,正确顺序应该反过来

以后再研究这种 AI 网页,我会先按这个顺序走:

第一步,先看页面。

像普通用户一样,把页面到底展示了什么先看清楚。

第二步,再看 DOM。

看看这些肉眼能看到的东西,在代码里面到底是什么结构。

第三步,再看交互。

哪些内容默认没有,必须点击、展开以后才会出现?

哪些东西虽然能点,但目标信息并没有直接写在 DOM 里面?

第四步,最后才做自动化。

能直接读的直接读。

需要展开的,再研究怎么展开。

需要点击以后才能解析出来的,就单独研究点击后的获取方式。

顺序应该是:

先看页面 → 再看 DOM → 再看交互 → 最后自动化

5、这个坑很低级,但我觉得特别值得记录

现在大家一说 AI 数据采集、AI GEO 监测,第一反应很容易就是:

写爬虫。

写插件。

找 selector。

搞自动化。

但有时候最应该先做的事情,反而特别 “笨”:

先把网页当成一个正常用户,好好看一遍。

因为你连平台到底给用户展示了什么都没弄清楚,后面程序写得越快,可能只是绕得越远。

这次对我最大的提醒就是:

做 AI GEO 监测,不是先想着 “我到底能抓多少东西”。

而是先搞清楚:

AI 平台到底真实展示了什么。