飞瓜数据抓取服务:一行 curl 拿到抖音电商数据

飞瓜数据抓取服务:一行 curl 拿到抖音电商数据
做电商选品、竞品调研、达人研究的人,应该都懂这种痛:飞瓜数据是好东西——抖音电商数据的头部平台,销量、佣金、达人带货、消费画像全都有。但网页端看一两个可以,批量拉就要命:翻页、复制、粘贴、整理,一个品类几十个商品弄下来一下午就没了。而且飞瓜没有现成的开放 API。
这篇分享一个思路:把飞瓜网页上能看到的核心数据,变成一个 JSON API——以后 curl 一行就能拿到商品榜、品牌全貌、爆款拆解,灌进 Excel、丢给大模型分析、接进你自己的选品面板,都随你。
痛点:数据都看得见,就是"抓不走"
飞瓜网页版四大维度:品牌、商品、达人、视频/直播。每个维度都有你要的数据:
- 品牌排行、市场份额、消费画像
- 商品销量、佣金率、带了多少视频、多少达人
- 达人带货能力、粉丝画像、上升趋势
- 每日热门视频选题
但麻烦在这:这些数据散在几十个页面里,飞瓜不给你 API。你要做一次完整的品类调研,得在网页上一个一个点、一行一行复制——"看得见、抓不走、批量更痛苦",这就是这个服务要解决的核心问题。
怎么实现:还是"浏览器干活",但这次是抓数据
思路和上一篇抖音 API 一脉相承:用无头浏览器代替人打开网页,把页面上的数据解析成结构化 JSON,外面包一层 HTTP 接口。四个核心接口:
| 接口 | 干吗 | 典型回答 |
|---|---|---|
/api/brand?keyword=练己 | 摸一个品牌的全貌 | SPU 数、总销量、达人数、视频数、消费画像、行业排名 |
/api/products?keyword=髌骨带 | 拉一个品类的商品榜 | TOP N 商品,每个含佣金/销量/带货视频数/达人数 |
/api/product?keyword=练己髌骨带 | 拆一个爆款商品 | 带货 TOP 达人、带货视频、粉丝画像、相似商品、评价词云 |
/api/videos | 每天的热门选题清单 | 飞瓜官方"这些视频在起量"推荐 |
有几个实现细节值得说:
- 登录靠 cookie:飞瓜没开放 API,登录也是模拟的——用你自己的飞瓜账号 cookie,服务里放个 Chromium 带着 cookie 去访问,看到的就是你登录后的数据
- 数据是解析页面 DOM 来的:所以响应比较慢(30-90 秒正常,背后是真开浏览器等页面加载),客户端超时得设 180 秒以上,别按普通接口的 5 秒超时来等
- cookie 命很短:飞瓜风控紧,cookie 一般 2-7 天就过期(比抖音还短),过期重抓一下覆盖文件、重启容器就行
解决什么问题:把飞瓜变成"自己家的 SDK"
场景 1:一个品类做完整调研——拉"髌骨带"TOP 25 商品 → 看 rank 1-5 就是品类头部;daren 数特别高的说明内容红利还在;佣金 25%+ 且销量上量的就是高毛利选品机会。
场景 2:摸底竞品品牌——打"练己"之前先查品牌全景:旗下商品、销量分布、达人层级、人群画像。定价、人群定位、达人合作策略的第一手材料。
场景 3:反推爆款打法——一个 SPU 火了,full=1 全量拆:带货 TOP 达人是谁(可直接谈合作)、带货 TOP 视频(反推脚本模板)、相似商品(找差异化)、评价词云(找产品优化点)。这套在飞瓜网页要点开 7 个 tab 反复复制,现在一条 curl。
场景 4:每日选题自动化——热门视频选题清单每天自动拉一次发到 Slack,内容团队早上打开就有选题库。
场景 5:喂给大模型写分析——数据 JSON → GPT/Gemini:写一份该品类竞争格局分析,配合自家的大模型桥服务,"数据抓取 → AI 分析"闭环零成本。
几个避坑提醒(都是跑出来的)
- cookie 每周烦一次:飞瓜 cookie 2-7 天过期,过期表现是接口返回登录页。可以做个 Chrome 扩展一键同步 cookie(我这边有实现)
- 冷门词返回空:飞瓜是近 30 天统计,词太冷没数据,换更宽的品类词
- 别请求太快:飞瓜有单账号频率限制,每次间隔 5 秒以上;真要批量拉 100 个,脚本里 sleep 6
- 能力边界要诚实:只有"你普通登录后能看到的东西"。付费详情报告(数据大屏那种)在页面 DOM 里拿不到,做不了也别硬做
- 合规红线:飞瓜条款不允许自动化爬取。个人自用问题不大(等于手动点击快点),但别转售、别高频轮询、别给不认识的人跑
最后说一句
和上一篇同一个心法:凡是"网页上能看到的重复劳动",都能用"浏览器干活 + 包一层接口"变成程序。飞瓜这个服务最值钱的不是"能抓数据"——是下游组合:日报、AI 分析、选品面板、异动监控(某商品销量突增 200% 自动报警)、自建达人库。把飞瓜变成自己家的 SDK 库,想怎么消费怎么消费。