带参数的URL满天飞,蜘蛛掉进陷阱出不来

URL参数 动态参数 蜘蛛陷阱

带参数的 URL,是很多站的一个隐形杀手。它不像 404 那么明显,但造成的重复内容问题,可能比 404 还严重。

我先说说参数是怎么惹祸的。最常见的是追踪参数。你做推广,给链接后面加个 utm_source=x,本来是为了统计效果。但搜索引擎不管你这套,它看到的就是两个不一样的地址,一个是干净的 www.example.com/page,一个是带参数的 www.example.com/page?utm_source=x。内容完全一样,它就当成两个页面收录了。你来十个渠道,就有十个重复版本。

还有排序和筛选参数。电商站里特别多,按价格排序、按销量排序、按品牌筛选,每个操作都生成一个新 URL。有些站把这些参数组合起来,能生成几万甚至几十万个 URL,绝大多数内容还高度重复。搜索引擎一头扎进去,爬都爬不完,真正的商品页反而被淹没了。

解决办法有几个。第一,追踪参数用 robots.txt 挡掉,让搜索引擎别去抓那些乱七八糟的 utm 链接。第二,给所有带参数的页面加上 canonical,统一指向不带参数的那个干净地址。这样搜索引擎知道,这些只是同一个页面的不同门牌号。第三,能改静态化的尽量静态化,把关键的筛选维度做成路径式的伪静态地址,比参数友好得多。

还有一个技巧,叫参数顺序规范化。同一个页面,?a=1&b=2 和 ?b=2&a=1 是不同的 URL,但内容一样。你可以在服务器层面把它们统一成一个固定的参数顺序,或者干脆用 nginx 做个跳转,把乱序的都跳到规范顺序上来。

我自己做站,从建站第一天就会把参数规范定下来。哪些参数允许出现在可索引的地址里,哪些一律挡掉。这个规则定在前头,后面就不会失控。要是等站做大了再来收拾,几万个参数 URL 处理起来,那叫一个头大。

—— 来自 挖的客 - 优秀网站分类目录 的分享

🔗 推荐网站

« 返回文章列表