robots、schema 到底是啥?小生意要不要管
太长不看(TL;DR)
robots.txt 是贴在你家门口的"访客须知"——告诉各种爬虫哪些房间能进、哪些不能。schema markup 是贴在每个房间门上的"房间说明"——告诉进来的人这个房间里放的是什么。对小企业来说,这两样都要管:robots.txt 没配好,AI 爬虫进不了门;schema 没有,AI 进了门也看不懂你是谁、卖什么。BrandGEO 的修复中心能帮你自动生成 JSON-LD 代码,复制粘贴到网站上就行。
用一个比喻讲清楚
假设你的网站是一栋房子。
robots.txt 就是门口的一块牌子。上面写着:"Googlebot 可以参观所有房间;GPTBot 只能看一楼;ClaudeBot 不允许进入。"每个爬虫来到你的房子前,都会先看这块牌子,然后决定自己能进哪些房间。如果牌子上写了"AI 爬虫全部禁止入内",那 ChatGPT、Perplexity、Claude 的爬虫就会转身离开——不管你家里装修得多漂亮。
schema markup(结构化数据标记——用标准化代码标签标注"这个页面上的东西是什么"的技术规范)是你在每个房间门上贴的说明标签。"这个房间是客厅,里面有沙发和电视"、"这个房间是厨房,提供早餐和晚餐服务"。有了这些标签,进来参观的人不需要自己猜——他们一看标签就知道每个房间是什么、里面有什么。
没有 robots.txt = 门口没有牌子,爬虫可能自己决定进不进、看不看。 没有 schema = 房间里什么说明都没有,爬虫进来了也要自己猜你是谁、卖什么。 两个都没有 = 一栋没有门牌、房间里也没标签的房子——AI 来了转一圈,啥也没搞清楚就走了。
robots.txt:谁能进门
它在哪里、长什么样
robots.txt 是一个纯文本文件,放在你的网站根目录。访问 yourdomain.com/robots.txt 就能看到。它的内容很简单,长这样:
User-agent: Googlebot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
User-agent 指定哪个爬虫,Allow 表示允许爬取,Disallow 表示禁止。上面这个例子的意思是:Googlebot 可以爬所有页面,GPTBot 不能爬任何页面,其他爬虫都可以爬。
2026 年你需要知道的关键变化
2026 年 AI 搜索领域最重要的变化之一是:主流 AI 公司把爬虫拆成了两类——训练爬虫和搜索爬虫。[1][2]
以 OpenAI 为例,它有三个不同的爬虫:GPTBot 负责训练数据收集(你的内容会被用来训练未来的模型),OAI-SearchBot 负责 ChatGPT 搜索功能的索引(让你的页面能出现在 ChatGPT 的搜索结果里),ChatGPT-User 负责实时浏览(用户在 ChatGPT 里点"搜索"时实时抓取你的页面)。[1][2]
Anthropic 也类似:ClaudeBot 是训练爬虫,Claude-SearchBot 是搜索爬虫。[1]
这意味着什么?你可以做到"精细控制":屏蔽训练爬虫(不让你的内容被用来训练 AI 模型),同时允许搜索爬虫(让你的页面能出现在 AI 的搜索回答里)。[1][2] 这是 2026 年的推荐策略——绝大多数网站都应该这么配置。
小企业的推荐配置
如果你是一个希望被 AI 搜索引擎引用、但不希望内容被用来训练 AI 模型的小企业,推荐这样配置 robots.txt:
# 允许传统搜索引擎
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
# 屏蔽 AI 训练爬虫
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# 允许 AI 搜索爬虫(让你出现在 AI 搜索回答中)
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
# 默认允许其他爬虫
User-agent: *
Allow: /
Sitemap: https://yourdomain.com/sitemap.xml
一个常见的错误是:很多小企业主看到"AI 爬虫"就全部屏蔽,结果连搜索爬虫也一起挡了。[2] 这就像把快递员和推销员一起赶走——你不想要推销员(训练爬虫),但你还是需要快递员(搜索爬虫)把你的信息送到用户手里。
schema markup:让 AI 看懂你
它是什么
schema markup(也叫结构化数据)是一段嵌入在你网页 HTML 里的标准化代码,用来告诉搜索引擎和 AI"这个页面上的信息是什么类型"。
比如,你的页面上写了"$49.99"。没有 schema,AI 不知道这是产品价格、运费还是折扣码。加了 Product 类型的 schema 标记后,AI 就能明确理解:这是一个叫"XX"的产品,售价 $49.99,品牌是"XX",有 4.5 星评分。
2026 年,schema 对 AI 搜索的影响已经有了明确的数据支撑。被 ChatGPT 引用的页面中,71% 使用了结构化数据;被 Google AI Mode 引用的页面中,65% 使用了 schema。[3] 含有 FAQPage schema 的页面在 AI 回答中的引用率是没有的 2.7 倍。[3] Google 在 2025 年 5 月的官方指南中明确推荐使用 JSON-LD 格式来实现 schema。[3]
JSON-LD 是什么
JSON-LD 是 schema markup 的一种实现格式(另外两种是 Microdata 和 RDFa,但 Google 官方推荐 JSON-LD)。它的好处是:代码和你的页面 HTML 是分开的——你只需要在页面的 <head> 或 <body> 里加一个 <script> 标签,里面放 JSON 格式的结构化数据,不需要改动页面上已有的任何内容。
一个小企业的 JSON-LD 示例:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "LocalBusiness",
"name": "SunnyBrew Coffee",
"description": "旧金山精品咖啡烘焙商,专注单一产地手冲咖啡。",
"url": "https://sunnybrew.com",
"telephone": "+1-415-555-0123",
"address": {
"@type": "PostalAddress",
"streetAddress": "123 Market St",
"addressLocality": "San Francisco",
"addressRegion": "CA",
"postalCode": "94105",
"addressCountry": "US"
},
"openingHoursSpecification": {
"@type": "OpeningHoursSpecification",
"dayOfWeek": ["Monday","Tuesday","Wednesday","Thursday","Friday"],
"opens": "07:00",
"closes": "18:00"
}
}
</script>
看起来很长,但它本质就是一个填表——品牌名、描述、地址、电话、营业时间。你不需要"会写代码",你只需要把自己的信息填进去。
小企业最该加的 schema 类型
不需要一次加完所有 schema 类型。根据你的业务,从这几个开始:[4][5]
所有小企业都该有的(基础层):
Organization或LocalBusiness:告诉 AI 你是谁——品牌名、描述、地址、联系方式。WebSite:告诉 AI 你的网站叫什么、有哪些核心页面。BreadcrumbList:告诉 AI 你的页面层级结构。
根据页面类型追加的:
- 博客文章 →
Article或BlogPosting - 产品页 →
Product(含价格、评分、库存状态) - FAQ 页 →
FAQPage(AI 引用率高 2.7 倍 [3]) - 教程页 →
HowTo
大多数商业网站需要 4–6 种 schema 类型。[5] 先把基础层做好,再根据页面类型逐步追加。
先看看你现在有没有
跑一次 BrandGEO 的体检(10 分钟自查:你的网站 AI 到底能不能看懂),你会在 Report 页面看到:
- Crawler Access 门:逐个 AI 爬虫的 HTTP 访问状态——哪些能进、哪些被拦。这里显示的是实际检测结果,不只是 robots.txt 的理论配置。
- Technical Readiness 门:schema markup 检测——你的网站有没有结构化数据、有哪些类型、缺什么。
如果两个门都是绿色 ✓,说明你的基础没问题。如果有红色 ×,继续往下看怎么修。
手把手:用修复中心补上 schema
第 1 步:跑完整体检,进入 Fix 页面
登录 brandgeo.app,跑一次完整体检。完成后,在左侧导航点 Fix 进入修复中心。
第 2 步:找到 JSON-LD 修复任务
修复中心会根据你的体检结果自动生成任务。如果你缺少 JSON-LD 结构化数据,会看到一个 Artifact 类型的任务,显示一个代码块——里面就是根据你的网站信息自动生成的 JSON-LD 代码。
修复中心的 JSON-LD 任务——代码块里就是给你生成好的结构化数据代码。
第 3 步:复制代码,粘贴到你的网站
点"全部复制",然后把这段代码粘贴到你网站首页(或对应页面)的 HTML 里。具体位置:放在 <head> 标签里,或者 <body> 标签的末尾。
如果你用 WordPress:很多 SEO 插件(Yoast、Rank Math、Schema Pro)可以直接通过界面添加 JSON-LD,不需要手动编辑代码。
如果你不会编辑 HTML:把 BrandGEO 生成的 JSON-LD 代码复制下来,用 把这段 prompt 丢给 AI 编程助手就行 里的方法,让 AI 编程助手帮你插入到网站上。
第 4 步:验证部署
部署后,回到修复中心,点这条任务的"部署后验证"按钮。系统会实际访问你的页面,检查 JSON-LD 是否存在、格式是否正确。
你也可以用 Google 的 Rich Results Test 工具,输入你的页面 URL,看看 Google 能不能识别你的结构化数据。
部署后点"验证"——系统确认 JSON-LD 已正确部署,显示通过徽章。
robots.txt 怎么改
robots.txt 的修改取决于你的网站平台:
WordPress:Yoast SEO 和 Rank Math 都有 robots.txt 编辑器,在插件设置里可以直接修改,不需要 FTP。
Shopify:Shopify 从 2023 年开始允许通过 robots.txt.liquid 模板自定义 robots.txt。在 Shopify 后台 → 主题 → 编辑代码 → 添加 robots.txt.liquid 模板即可。
自己管理的服务器:直接编辑网站根目录下的 robots.txt 文件。
不会操作?:BrandGEO 的修复中心如果检测到 robots.txt 有问题,会生成一条 Checklist 类型的任务,告诉你具体要改什么、怎么改。你也可以把修改说明丢给 AI 编程助手。
做完后你会看到什么
修好 robots.txt 和 schema 之后,跑一次复检。你会在 Report 页面看到:
- Crawler Access 门的红色 × 变成绿色 ✓(AI 搜索爬虫能进来了)。
- Technical Readiness 门的 schema 检查项变成 pass。
- 综合分数上升——因为消除了多个扣分项。
这两项修复——打开 AI 爬虫的门 + 加上结构化数据标签——是整个 GEO 技术地基中优先级最高的。没有这两项,后面的内容优化和效果追踪都建立在不稳定的基础上。关于分数变化的具体数据,见 修复前后,AI 可见度分数真的会变。
常见问题
我怕 AI 偷我的内容去训练,能不能全部屏蔽?
可以全部屏蔽训练爬虫(GPTBot、ClaudeBot、Google-Extended、CCBot),同时允许搜索爬虫(OAI-SearchBot、PerplexityBot、ChatGPT-User)。[1][2] 这是 2026 年的推荐策略:保护你的内容不被用来训练模型,同时让你的页面能出现在 AI 搜索的回答中。上面"小企业的推荐配置"部分有完整的示例。
我的网站是 Shopify / WordPress / Wix 建的,robots.txt 和 schema 都已经自带了吗?
不完全。WordPress 会自动生成一个基础的 robots.txt,但它不包含针对 AI 爬虫的规则——你需要手动添加。Shopify 也有默认的 robots.txt,但同样不涉及 AI 爬虫配置。至于 schema,WordPress 有多个插件可用(Yoast、Rank Math),Shopify 内置了基础的 Product schema 但不够完整,Wix 有一些自动 schema 但能力有限。[5] 无论用什么平台,跑一次 BrandGEO 体检能帮你确认到底缺什么。
schema 加上之后多久能看到效果?
大多数网站在部署完整的结构化数据后 2–6 周内开始看到 AI 引用的变化。[3] 但这不是线性的——效果取决于你的内容质量、竞品情况、AI 平台的更新周期。先跑一次 BrandGEO 体检确认部署正确,然后在 2–4 周后跑复检看分数变化。
robots.txt 只是"建议",AI 爬虫真的会遵守吗?
robots.txt 确实是一个"协议"而不是强制机制——爬虫可以选择不遵守。但主流 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot)目前都声明遵守 robots.txt。[1] 需要注意的是,有些爬虫(如字节跳动的 Bytespider)可能不遵守——对于这类爬虫,你需要在服务器层面(WAF 或 CDN)做额外拦截。BrandGEO 的 Crawler Access 检测会告诉你每个爬虫的实际访问状态,不管它声不声明遵守 robots.txt。
来源
[1] Best SEO SG. (2026). GPTBot, ClaudeBot and PerplexityBot: A 2026 AI Crawler Configuration Guide.
[2] Primores. (2026). GPTBot vs OAI-SearchBot: What's the Difference?.
[3] Globerunner. (2026). Structured Data in 2026: The Schema Markup AI Actually Uses. AI Growth Agent. (2026). Schema Markup for AI Search: A Practical 2026 Playbook.
[4] W3Era. (2026). Schema Markup Types 2026: Complete Guide for Every Page.
[5] Discoverability. (2026). Schema Markup Guide: SEO and AI Search in 2026.
[6] Cloudflare. (2025). From Googlebot to GPTBot: Who's Crawling Your Site in 2025.
[7] Iorso. (2026). Schema Markup for Small Business: Get Cited by AI Search.
[8] Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., & Deshpande, A. (2024). GEO: Generative Engine Optimization. arXiv:2311.09735.
最后更新:2026-07-23
不确定你的 robots.txt 和 schema 有没有问题?打开 BrandGEO 免费体检 →