网站上线了,大模型为什么还是搜不到你?个人站免费 GEO 教程

网站上线了,大模型为什么还是搜不到你?个人站免费 GEO 教程

现在,用 Claude Code、Codex 做一个个人网站,门槛真的低了很多。

你不一定会写代码。把自己的经历、项目和想法告诉 Agent,它就能帮你搭页面、改样式,再一步步部署上线。

但很多人做到这里,就停下来了。

网站能打开,不等于大模型能找到。

对很多人来说,找答案的入口已经从搜索框变成了对话框。你不一定会专门打开 Google 或 Bing,而是直接去问 ChatGPT、Perplexity,或者其他带联网搜索的大模型。

可大模型并不会因为你把网站部署成功,就自动知道你的名字、项目和文章。它们仍然需要从公开网页里发现网址、读取内容,再决定要不要把你的页面带进回答里。

Google 和 Bing 在这里更像底层水电。你平时未必会主动打开它们,但网站的发现、抓取和索引这套基础工作不能省,面向 AI 搜索的爬虫也要能正常进来。

我自己的个人站也踩过这个坑。网站正常打开,文章也在更新,但搜索引擎到底收没收、AI Bot 到底来没来,我一开始完全不知道。

所以这篇文章,我想教大家一个完全免费的办法,给自己的个人站做最基础的 GEO。

不用购买 GEO 服务,也不用自己写代码。网站里面的配置交给 Claude Code、Codex 这类 Agent,Google 和 Bing 的账号验证由你自己完成。

我不是专业做 SEO 的,这也不是一套排名秘籍。我只是把这次自己跑通的流程、踩过的坑和真实结果完整放出来。

先给大家看结果。

我直接把域名分别发给 Claude 和 ChatGPT,它们已经可以读取网站的公开页面,并说出站点定位、项目、博客和其他公开板块。

Claude 与 ChatGPT 均能找到并总结本站公开内容

左边是 Claude,右边是 ChatGPT。两者在联网检索时都能找到首页,并根据公开内容整理出站点定位、项目和博客等板块。

这里需要讲严谨一点。这说明它们在联网检索时已经能够找到并读取网站,不代表所有大模型都永久记住了这些内容,也不保证每次提问都会引用。

但开始操作以前,我们得先弄懂一个词。

索引。

先搞懂一个词,什么叫索引

你可以把搜索引擎想成一座很大的图书馆。

网站上线,只相当于你把一本书送到了图书馆门口。网址虽然能打开,但图书管理员还不知道这本书叫什么、里面写了什么、应该放在哪个书架上。

搜索引擎通常会先发现网址,再让爬虫读取页面,最后决定要不要把页面放进自己的目录。

这个进入可搜索目录的过程,就叫建立索引。

我们平时在 Google 或 Bing 搜东西时,它们不是临时把整个互联网翻一遍,而是先从已经建立好的索引里找答案。

所以,一个页面没有进入索引,即使拿着完整网址可以打开,别人也很难通过搜索找到它。

进入索引也不代表一定排在前面,更不代表一定会被大模型引用。它只是拿到了一张进入搜索结果的入场券。

后面要配置的 robots.txtsitemap.xml 和站长平台,目的其实很简单。

让搜索引擎知道网站在哪、哪些页面可以读取,以及网站里到底有哪些公开内容。

开始前,先看懂这张分工表

事情谁来做
登录 Google Search Console站长
在域名平台添加 DNS TXT 记录站长
登录 Bing Webmaster Tools 并授权 Google 账号站长
检查并生成 robots.txtAgent
检查并生成 sitemap.xmlAgent
检查公开页面能否访问、有没有误加 noindexAgent
部署网站Agent 可以准备,站长确认后执行
根据 Search Console 的具体网址排查问题Agent

下面先把站长需要亲手完成的账号、授权和 DNS 操作一次走完;再把剩下的网站配置和检查直接交给 Agent。

不要把 Google 密码、验证码、DNS 平台密码发给 Agent。登录和授权这一步自己点,反而最简单,也最安全。

一、站长先注册 Google Search Console

下面这部分不要交给 Agent,因为需要登录你的 Google 账号和修改域名 DNS。

打开 Google Search Console,点击添加资源。

Google Search Console 首页,点击 Add a website

点击 Add a website / 添加网站。Google 后台有时显示英文,按钮位置和中文版基本一致。

这里建议选择「网域」,然后只填写域名,不要带 https://,也不要带后面的路径。

example.com

选择 Domain 网域资源

左边选 Domain / 网域,输入 example.com 这种裸域名;右边的 URL prefix / 网址前缀 只管理某个协议和路径,这次不用选。然后点 Continue / 继续

Google 会生成一条 TXT 验证记录。

Copy / 复制,把 Google 给出的整条验证字符串复制下来。不要只复制后半段,也不要把它公开放进教程截图里。

Google 生成 DNS TXT 所有权验证记录

保持 TXT (recommended) / TXT(推荐),点击 Copy / 复制。然后去域名服务商添加这条记录,完成后再回到这里点 Verify / 验证

打开你购买域名的平台,在 DNS 管理里新增一条记录。下面用腾讯云 DNSPod 演示,入口是 腾讯云 DNS 解析控制台。其他域名平台的字段名字可能不同,但要填的内容一样。

腾讯云 DNSPod 记录管理页面

选中自己的域名,进入 记录管理,点击 添加记录。图中的服务器 IP 和与教程无关的子域名已经打码。

主机记录  @
记录类型  TXT
线路类型  默认
记录值    Google 提供的完整验证字符串
TTL       默认即可

DNSPod 新增记录时仍误选为 A 记录

这里很容易顺手就点确认。即使已经把验证值粘进去,只要 记录类型 还是 A,就是错的。先别保存。

DNSPod 正确选择 TXT 记录

记录类型 改成 TXT,确认 主机记录@,再点击 确认 / Confirm。验证字符串已打码,每个人拿到的值都不同。

保存以后回到 Search Console 点击验证。

DNS 有时不会立刻生效。如果第一次验证失败,不要反复修改记录,先等几分钟再试。

Google 提示 Ownership verified

看到 Ownership verified / 所有权已验证 就成功了。点击 Go to property / 前往资源 进入后台。Google 也会提醒你不要删除刚才的 DNS 记录,否则以后可能失去验证状态。

进入后台后,新站显示 Processing data, please check again in a day or so / 正在处理数据,请过一天左右再查看 很正常,不是配置失败。下一步点左侧 Sitemaps / 站点地图

从 Google Search Console 后台进入 Sitemaps

红框位置就是 Sitemaps / 站点地图。新站的数据卡片还在处理中,不影响提交 sitemap。

先在新标签页打开 https://你的域名/sitemap.xml。如果能看到 XML 和一组公开网址,就可以继续提交;如果显示 404、空白或报错,先跳过这一步,等后面的 Agent 生成并部署完成后再回来。Google 和 Bing 的账号验证不会因此失效。

这里是 Google 官方的站点地图说明。第一次操作不用全部看完,先照着下面的步骤提交即可,遇到格式问题再回来核对。

这里我真的踩了一个很小、但很容易卡住小白的坑。

我第一次只填了。

sitemap.xml

页面提示地址无效。

后来改成完整地址才提交成功。

https://你的域名/sitemap.xml

所以如果你也添加的是「网域」资源,遇到 sitemap 地址无效,先试完整 URL,不要急着让 Agent 重写 sitemap。

只填写 sitemap.xml 时,Google 提示“无效的站点地图地址”

这是当时的真实报错。换成完整的 https://你的域名/sitemap.xml 后即可提交。

提交以后,Google 会开始发现和抓取页面。新网站不会因为提交 sitemap 就立刻获得排名,这一步只是把网站正式交给 Google 管理,让你以后能看到抓取、收录和报错原因。

二、再把网站从 Google 导入 Bing

Google 验证完成以后,打开 Bing Webmaster Tools

点击 Get started / 开始使用,登录方式选择 Google。这里直接使用刚才验证 Search Console 的同一个 Google 账号。

左侧进入 Bing 并选择 Google 登录,右侧为 Google sitemap 提交成功

左边是原图片 13:进入 Bing 后先点 Get started,再选择 Google 登录;右边是原图片 12:有效的 sitemap 最终会显示 Sitemap submitted successfully / 站点地图提交成功。如果此时 sitemap 还没做好,右边这一步可以等 Agent 部署后再完成。

登录以后选择 Import your sites from GSC / 从 Google Search Console 导入网站。如果你的后台入口和截图不一样,可以对照 Bing 官方的导入说明

从 Google Search Console 导入网站

选左边的导入方式,不要走右边的手动添加,这样不用再做一遍网站所有权验证。

Bing 会说明它准备读取什么数据。它申请的是只读权限,用来读取已经验证的网站和 sitemap,并定期确认验证状态。确认后点击 Continue / 继续,再完成 Google 授权。

确认 Bing 从 Google Search Console 读取的数据

确认说明以后点右下角 Continue / 继续。Google 密码和授权仍然由站长本人操作。

授权完成后,勾选要导入的网站,点击右下角 Import / 导入

选择需要导入 Bing 的网站

站点导入成功后,不需要再去 DNSPod 添加验证记录。不过这次页面里的 Sitemaps Count 显示为 0,说明 sitemap 没有跟着带过来。

Bing 的说明里写着可以导入 Google 已提交的 sitemap,但实际结果不一定每次都成功。不要凭感觉判断,直接看 Sitemaps Count。如果是 0,就在 Bing 里手动提交一次。

进入 Bing 后台,左侧点击 Sitemaps / 站点地图

在 Bing Webmaster Tools 中打开 Sitemaps

顶部会提示数据可能需要最多 48 小时处理,同时建议通过 Sitemaps 功能提交站点地图。这里仍然填写完整地址 https://你的域名/sitemap.xml

提交成功以后,Google 和 Bing 的注册就全部完成了。后面不用每天盯着看,等平台慢慢发现和处理页面即可。

Bing 接入完成以后,如果还想让新页面更新得更快,可以让 Agent 按 IndexNow 官方文档 接入发布流程。这是可选项,不做也不影响 Google 和 Bing 的基础注册,所以这篇教程不再展开。

三、把剩下的网站配置交给 Agent

Google 和 Bing 的账号操作看完以后,剩下的网站内部配置就可以交给 Agent。网站至少需要准备两个文件。

一个是 robots.txt,告诉搜索引擎哪些页面可以抓。

一个是 sitemap.xml,告诉搜索引擎网站里有哪些公开页面。

如果你不知道自己的网站有没有这两个文件,可以先在浏览器访问。

https://你的域名/robots.txt
https://你的域名/sitemap.xml

能正常打开,不代表内容一定正确,所以我更建议直接让 Agent 检查。

你可以把下面这段提示词发给 Claude Code、Codex 或其他能读取网站代码的编程 Agent。

请帮我给这个个人网站配置基础搜索引擎收录能力。

开始前先阅读项目规则,并运行 git status,保留已有修改。先检查,不要直接发布。

请完成这些事情。

1. 检查网站是否已有 robots.txt,没有就创建,有就检查内容。
2. robots.txt 默认允许 Googlebot、Bingbot 和普通搜索爬虫访问公开页面。
3. 私密页面、后台页面和明确不想公开的页面不要进入索引。
4. 检查是否已有 sitemap.xml,没有就根据实际公开页面生成。
5. sitemap 只包含返回 200、允许索引、使用正式 HTTPS 地址的公开页面。
6. 如果网站会持续新增文章,请让 sitemap 在构建或发布时自动更新,不要长期手工维护。
7. 检查公开页面有没有误加 noindex,canonical 是否指向自己的正式网址。
8. 检查 robots.txt 和 sitemap.xml 部署后应该使用的公开地址。
9. 修改后运行项目现有测试,并告诉我改了哪些文件、哪些步骤需要我本人去 Google 或 Bing 后台完成。

不要添加付费服务,不要批量生成 SEO 文章,不要修改现有文章内容,不要提交、推送或部署,等我确认。

这段提示词里,最重要的是最后一句。

让 Agent 先改、先检查,但不要直接上线。等它把修改文件和检查结果告诉你,你确认以后再部署。

一个最简单的 robots.txt 大概长这样。

User-agent: *
Allow: /

Sitemap: https://你的域名/sitemap.xml

如果网站有不想被搜索引擎访问的路径,可以单独添加。

Disallow: /private/

但这里需要注意,robots.txt 不是保护隐私的保险柜。真正的私密页面必须加登录或鉴权,不能只靠一句 Disallow

如果你希望网站有机会被 ChatGPT 搜索读取,也可以让 Agent 单独允许 OAI-SearchBot。它和可能用于训练抓取的 GPTBot 可以分开设置。

如果你想先确认这些爬虫分别做什么,可以看 OpenAI 官方爬虫说明

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

这不是 Google 和 Bing 注册的必选项。不想考虑 AI 爬虫的话,先不加也完全不影响后面的操作。

本站当前 robots.txt 的实际内容

这是我现在使用的配置:公开页面允许抓取,私密目标页排除;OAI-SearchBot 和 GPTBot 分开设置。

本站当前 sitemap.xml 的实际内容

sitemap 里使用的是正式 HTTPS 地址,并且随着博客构建自动更新。

Agent 修改完成并通过检查以后,再让它部署。

可以继续发这段。

我已经确认刚才的修改。请按照这个项目原有的发布流程上线,不要绕过测试,不要提交无关文件。发布后检查 robots.txt 和 sitemap.xml 能否通过正式域名访问,并确认首页和至少一个文章页返回 200。

到这里,网站内部的准备工作就完成了。

如果前面因为 sitemap.xml 不存在而跳过了提交,现在只需要最后回到 Google 和 Bing,各填写一次完整地址:

https://你的域名/sitemap.xml

这一步仍然建议由你本人完成,因为站长平台涉及账号登录。Agent 可以检查地址和文件内容,但不需要拿到你的 Google 或 Microsoft 密码。

四、怎么判断有没有效果

网站注册完成以后,最容易犯的错误就是每天去 Google 搜 site:你的域名

我就是这么被误导的。

我们是在 7 月 31 日统一提交索引的。到 8 月 3 日,也就是提交后第三天,site:zykdata.cn 仍然没搜到任何结果,我一度以为 Google 还没有收录。

但到 8 月 5 日,也就是提交后第五天,通过 Search Console 的 URL 检查数据逐条核对,真实结果已经是这样的。

平台已收录sitemap 中的网址收录比例
Google474898%
Bing3486%

Google 和 Bing 即使在同一天提交,处理速度也可能差很多。这里 Google 已经收录 47 个页面,Bing 当时只有 3 个页面,并不代表 Bing 配置失败,只是两个平台的发现、抓取和索引节奏不同。

所以新站提交后的头几天看不到结果很正常。不要因为第二天搜不到,就反复删除 sitemap、修改 DNS 或重新验证。先等 3~7 天,再到站长后台看真实状态;页面较多或网站较新时,等待时间还可能更长。

到 8 月 8 日,也就是统一提交大约一周后,前面展示的 Claude 和 ChatGPT 已经能够在联网检索中找到并总结本站公开内容。这个时间线更接近真实情况:先提交,耐心等平台处理,再看效果。

这组数据不能证明做完配置以后一定会有 98% 收录,也不能证明 GEO 会立刻带来流量。它只能证明两件事。

网站的发现和索引链路已经正常工作。

判断收录要看各自站长后台,不能只看一次搜索结果。

如果你想检查某一篇重要文章,在 Search Console 顶部输入完整网址,使用 URL 检查。

重点看页面能不能抓取、是否允许编入索引、Google 选择的规范网址是不是你自己的正式网址。

如果显示「已发现,尚未编入索引」或「已抓取,尚未编入索引」,不一定是代码错误。新网站和新文章都可能需要等待。

如果 Search Console 发来邮件,说出现下面这些原因,也先别慌。

Alternate page with proper canonical tag
Excluded by noindex tag
Page with redirect

它们分别表示替代页已经指向规范页、页面主动设置了不收录、当前网址会跳转到另一个网址。

这些情况很多时候是正常的。比如 HTTP 跳转到 HTTPS、私密页主动 noindex、重复地址指向正式 canonical,都不需要修。

真正要做的是点开示例网址,看里面有没有你原本希望被搜索到的首页、文章或项目页。

如果有,再把具体网址交给 Agent 排查。

Google Search Console 报告这个网址没有被索引。

网址是
粘贴具体网址

原因是
粘贴 Search Console 的完整原因

请检查网站源代码和部署配置,重点核对 HTTP 状态码、跳转链、robots.txt、meta robots、canonical、hreflang,以及它是否被正确放进 sitemap。

先告诉我这个状态是有意设计还是实际故障。只有确认是故障后再修改。修改后运行项目测试,但不要自行发布。

这段提示词里最关键的一句,是先判断它到底是不是故障。

不是所有「未编入索引」都需要修。

最后,AI Bot 真的来了吗

Google 和 Bing 的数据,只能证明搜索引擎这条链路已经跑通。

我还想再确认一件事。

那些面向 AI 搜索的机器人,有没有真的来过我的网站?

所以我又查了服务器的 Nginx 访问日志。这次没有只看 User-Agent,因为它可以被伪装。我把请求来源和 OpenAI、Perplexity 官方公布的 IP 段做了核对,只保留能通过官方网段验证的记录。

最硬的一条出现在 7 月 30 日上午。

OpenAI 的 OAI-SearchBot 在不到一分钟里,连续读取了本站一篇已发布教程的正文、17 张配图、CSS、JS、英文版和 feed。请求来源也全部落在 OpenAI 官方公布的 SearchBot 网段内。

后面的独立站点日志里,还能看到它在 8 月 3 日至 8 日之间检查了 14 次 robots.txt,每次都正常返回 200。

PerplexityBot 也通过官方网段核验。它实际读取了本站首页、一篇公开案例页、相关配图和 robots.txt,4 次请求全部返回 200。按照 Perplexity 官方说明,这个 Bot 用于让网站有机会出现在 Perplexity 的搜索结果里,不用于抓取基础模型训练数据。

时间已核验的 Bot实际发生的事情
7 月 30 日OAI-SearchBot不到一分钟读取一篇教程的正文、17 张配图和页面资源
8 月 3 日至 8 日OAI-SearchBot14 次检查 robots.txt,全部返回 200
8 月 3 日至 4 日PerplexityBot读取首页、公开案例页、配图和 robots.txt,全部返回 200

OAI-SearchBot 读取本站教程和页面资源的脱敏日志证据

这张图只展示通过 OpenAI 官方 SearchBot IP 段核验的请求,并且已经去掉来源 IP。

OAI-SearchBot 读取正文这件事发生在注册 Google 和 Bing 以前,所以不能把它写成 Search Console 或 Bing 接入带来的结果。

它能证明的是,允许访问的 AI 搜索爬虫已经能够找到并读取本站的公开内容。

本站对 OpenAI 也做了同样的区分,允许面向搜索的 OAI-SearchBot,同时拒绝可能用于训练抓取的 GPTBot

抓取不等于收录,收录也不等于最终会被大模型引用。

但至少,这条链路已经真的开始工作了。

GEO 也没有那么玄学。

先让搜索引擎和允许访问的 AI Bot 找到你、读懂你的公开页面,并且在出问题时有地方检查。

这样,你的个人站才不再是一个只有自己拿着网址才能找到的孤岛。

本文原文链接:https://zykdata.cn/blog/2026-08-08-personal-site-geo-zero-cost.html

张玉魁的头像

张玉魁 / Ktao

临床医学在读。白天学医,其余时间把真实企业的客服、内容、数据和报表变成每天在跑的自动化系统。

评论

0 / 200
评论

加载中…