久久停停,家庭观影首选投屏,,,,大屏清晰、声画同步,,,,不费眼、气氛好,,,,老人小孩都看得开心。。。。。。
高效使用百度搜索引擎优化教程低质量外链批量剔除工具节约时间
久久停停
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
跳出率剖析
高跳出率可能意味着内容不匹配。。。。。。优化首屏内容以吸引用户继续阅读。。。。。。
刑孤守看:百度搜索引擎优化教程实体图谱与知识面板的融合演进与落地技巧
久久停停
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
山西临汾SEO建站外包,,,,企业官网搜索推广效果提升实战履历谈
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
通过百度搜索引擎优化教程蜘蛛陷阱规避手艺(如正当Robots)提升网站收录
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
- 内容新鲜度一连更新
- 按期审查:每季度检查旧文章数据的准确性。。。。。。
- 增量更新:为旧文章添加最新案例、统计数据。。。。。。
- 日期标识:在页面显眼处标注最后更新时间。。。。。。
百度搜索引擎优化教程站群内链螺旋结构搭建的实操要领全剖析
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。
前言:为什么百度需要预渲染
百度搜索引擎对JavaScript动态渲染内容的抓取能力相对有限,,,,若是你的站点依赖Vue、React等前端框架构建,,,,大宗焦点内容通过JS异步加载,,,,百度爬虫很可能抓取到空缺页面。。。。。。预渲染服务(Prerender)的焦点原理,,,,是在服务端提前将SPA(单页应用)页面渲染成静态HTML,,,,返回给爬虫,,,,从而让百度顺遂收录页面内容。。。。。。
准备事情:确认你的手艺栈
在最先设置前,,,,先确认以下几点:
- 你的网站是否基于主流SPA框架(如Vue、React、Angular)构建。。。。。。
- 服务器情形(Nginx、Apache或Node.js)以及你是否拥有root或sudo权限。。。。。。
- 是否已注册百度站长平台,,,,并验证站点所有权。。。。。。
第一步:安排或接入预渲染服务
预渲染有两种常见实现方式:
- 使用Prerender中心件(推荐):通过npm装置
prerender-node包(适用于Express框架),,,,或在Nginx中设置Prerender署理。。。。。。以Node.js为例,,,,执行npm install prerender-node --save,,,,然后在服务端代码中添加:
app.use(require('prerender-node').set('prerenderServiceUrl', '你的预渲染服务地点')); - 自建Prerender服务器:安排官方的prerender容器(基于Node.js),,,,需要特殊设置Chrome渲染引擎。。。。。。这种方式适合需要高度自界说的团队。。。。。。
关于大大都中小站点,,,,建议直接使用第三方Prerender服务(如Prerender.io)或通过Nginx反向署理接入,,,,维护本钱更低。。。。。。
第二步:设置百度爬虫识别与转发
要害在于让服务器准确识别百度爬虫(Baiduspider)的User-Agent,,,,并将这些请求转发给预渲染服务。。。。。。以Nginx为例,,,,在server设置中添加:
location / {
if ($http_user_agent ~* "Baiduspider|baiduspider") {
proxy_pass http://你的预渲染服务地点;
}
try_files $uri $uri/ /index.html;
}
注重:一定要同时保存静态文件的直接返回规则,,,,阻止预渲染服务处理css、js等资源请求,,,,造成特殊开销。。。。。。
第三步:验证设置有用性
设置完成后,,,,使用百度站长平台的“抓取诊断”工具,,,,模拟Baiduspider抓取你的网站首页及几个内页。。。。。。视察返回的HTML中是否包括完整的页面问题、正文和链接。。。。。。你也可以在外地用curl测试:
curl -A "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.m.suntecwpc.com/search/spider.html)" 你的网站URL
若是返回的内容包括完整的DOM结构,,,,而非仅<div id="app"></div>,,,,则说明预渲染生效。。。。。。
常见问题与注重事项
| 问题 | 可能的原因 | 建议 |
|---|---|---|
| 百度依然不收录 | 页面加载了被屏障的外部资源,,,,或保存JS过失 | 检查页面控制台过失,,,,确保所有第三方资源可被爬虫会见 |
| 预渲染服务响应慢 | Chrome实例开启过多或并发请求超限 | 限制同时渲染数目,,,,或升级预渲染服务器设置 |
| 其他搜索引擎也被转发 | User-Agent匹配规则过于宽泛 | 只针对Baiduspider和须要的搜索爬虫做转发 |
效果优化建议
- 按期通过百度站长平台的“索引量”工具监控收录转变,,,,一般设置后1-2周能看到收录提升。。。。。。
- 阻止在预渲染页面上使用过多动态交互元素(如实时谈天),,,,这些内容可能让爬虫“迷失”。。。。。。
- 若是站点有用户登录后的私密页面,,,,务必在预渲染设置中扫除这些路由,,,,防止敏感内容被缓存。。。。。。
预渲染设置不是一次性事情,,,,随着站点内容更新和百度爬虫战略转变,,,,建议每季度检查一次设置的可用性。。。。。。准确设置后,,,,绝大大都SPA站点能在1个月内看到百度收录量的显着改善。。。。。。