为什么 Similarweb 这类工具能查到别人网站的访问量?
本文最后更新于25 天前,其中的信息可能已经过时,如有错误请发送邮件到big_fw@foxmail.com

打开 Similarweb、Semrush,随便输入一个域名,就能看到”月访问量约 XX 万”、”流量来源占比”、”用户地区分布”这些数据。这不禁让人好奇:网站的访问日志明明存在网站自己的服务器里,别人是怎么”看到”的?

答案是:它们看到的不是真实数据,而是估算出来的数据。 这篇文章讲讲这个估算是怎么做出来的。

一个前提:真实数据只有网站主自己有

这一点必须先说清楚。一个网站到底有多少人访问,这个精确数字只存在于两个地方:

网站自己的服务器访问日和网站主自己接入的统计工具(Google Analytics、百度统计等),数据存在网站主自己的后台

除此之外,任何第三方都拿不到这个精确数字。Similarweb 也一样——它没有权限进入淘宝、京东的服务器看日志。所以它做的事情,本质上是用有限的样本,去推算一个未知的总体,这是一个统计学问题,不是一个”读取数据库”的问题。

样本从哪来:四类数据源

1. 自家产品收集的行为数据

Similarweb 这类公司通常会自己做一些免费产品,比如浏览器插件(网页测速、购物比价、广告拦截)、免费 VPN、SDK 嵌入到一些 App 里。用户装了这些工具,他们的上网行为——访问了哪些网站、停留多久、从哪个页面跳转过来——就会被匿名化收集。

这是一个样本,比如全球几百万到上千万台设备。样本不是全体网民,但只要样本量够大、分布够均匀,就能用来推算。

2. ISP / DNS 合作数据

一些工具会和网络运营商、DNS 解析服务商合作,拿到匿名化、聚合后的域名访问记录(不涉及具体是谁访问的,只是”这个域名被查询了多少次”)。这类数据样本量通常比插件数据更大,因为不需要用户主动安装任何东西。

3. 网站主动接入的真实数据

现在不少工具支持网站主自愿把自己的 Google Analytics 或 GA4 账号连接进去。这部分是真实数据,不是估算的。工具会用这部分真实数据去校准自己的估算模型——如果知道某个网站的真实流量,就能反过来验证”样本外推”的算法准不准。

4. 公开信息辅助

比如搜索引擎公开的收录量和关键词排名、社交媒体的分享和讨论热度、网站备案信息等,这些不能直接算出访问量,但可以作为辅助信号,帮助模型判断一个网站的”体量级别”。

从样本到答案:统计推算是怎么做的

有了样本之后,核心逻辑其实和民意调查、收视率调查是一回事:

如果在 1000 万台被监测的设备里,有 1000 台访问过某个网站,访问了 3000 次,那么假设这个样本能代表整体网民行为,就可以按比例放大,推算出全网的访问量级别。

真实的模型当然复杂得多,会考虑:

  1. 地区、设备类型的分布偏差:样本可能在某些国家/某些浏览器上过采样,需要加权修正
  2. 网站类型的流量模式:新闻类网站和电商网站的访问规律不同,模型会分类处理
  3. 时间序列的平滑:避免单日异常波动导致估算跳变
  4. 多数据源交叉验证:插件数据、ISP数据、真实接入数据互相校准,减少单一来源的偏差

这也是为什么大网站的估算相对准(样本量大,统计上稳定),小众网站误差极大甚至查不到(样本里可能只有个位数的记录,统计上完全不可靠)。

一个直接的证据:为什么不同工具查出来的数字不一样

如果你拿同一个网站分别在 Similarweb、Semrush 上查,经常会发现数字对不上,有时候差好几倍。原因就在上面——每家公司的样本来源不同、样本量不同、推算模型不同,得出的估算自然不同。这也从侧面证明了这些数字确实是”估算”而非”读取”,如果是真实数据,不同工具查出来的应该是一样的。

为什么这类工具做不成开源、免费的

理解了原理,就能理解为什么市面上没有免费的开源替代品:

这类工具最值钱的东西不是代码逻辑(样本外推的统计模型并不神秘,学过统计的人都能实现),而是样本数据本身——那几百万台设备的持续行为监测,是靠真金白银运营出来的数据资产:做浏览器插件要维护、要推广获取安装量,和 ISP 谈合作要付费,服务器和数据处理也是持续成本。

开源能公开的是代码,公开不了的是这套数据采集网络。没有免费的数据源,自然也就没有免费的准确估算工具,这是商业模式决定的,不是技术门槛的问题。

小结

  • Similarweb 类工具查到的不是网站的真实访问量,而是基于多来源样本数据的统计估算
  • 数据来源主要是:自家产品的行为监测、ISP/DNS合作数据、网站主自愿接入的真实数据、公开信息辅助
  • 大网站估算相对准,小网站误差大甚至查不到,本质是样本量决定的统计置信度问题
  • 这类服务的核心壁垒是数据采集网络,而非算法本身,这也是为什么没有免费开源替代品的根本原因

主流付费第三方流量分析工具

工具链接特点/大致定价
Similarwebhttps://www.similarweb.com/website/流量估算最全面,尤其流量来源渠道拆分强;免费版访问有限,完整功能需付费,入门约 $125/月起
Semrushhttps://www.semrush.comSEO功能最全(关键词、外链、站点审计都有),起价约 $129.95/月
Ahrefshttps://ahrefs.com外链分析最强,免费工具有限,完整版付费,档位从免费到约 $499/月不等
SE Ranking搜”SE Ranking SEO”中端价位替代品,比Ahrefs/Semrush便宜
Ubersuggest搜”Ubersuggest Neil Patel”定位是预算有限团队的入门选项

文末附加内容
暂无评论

发送评论 编辑评论


				
|´・ω・)ノ
ヾ(≧∇≦*)ゝ
(☆ω☆)
(╯‵□′)╯︵┴─┴
 ̄﹃ ̄
(/ω\)
∠( ᐛ 」∠)_
(๑•̀ㅁ•́ฅ)
→_→
୧(๑•̀⌄•́๑)૭
٩(ˊᗜˋ*)و
(ノ°ο°)ノ
(´இ皿இ`)
⌇●﹏●⌇
(ฅ´ω`ฅ)
(╯°A°)╯︵○○○
φ( ̄∇ ̄o)
ヾ(´・ ・`。)ノ"
( ง ᵒ̌皿ᵒ̌)ง⁼³₌₃
(ó﹏ò。)
Σ(っ °Д °;)っ
( ,,´・ω・)ノ"(´っω・`。)
╮(╯▽╰)╭
o(*////▽////*)q
>﹏<
( ๑´•ω•) "(ㆆᴗㆆ)
😂
😀
😅
😊
🙂
🙃
😌
😍
😘
😜
😝
😏
😒
🙄
😳
😡
😔
😫
😱
😭
💩
👻
🙌
🖕
👍
👫
👬
👭
🌚
🌝
🙈
💊
😶
🙏
🍦
🍉
😣
Source: github.com/k4yt3x/flowerhd
颜文字
Emoji
小恐龙
花!
上一篇