Web Scraping API
Web Scraping 抓取页面 API
抓取任意网页,以干净的 Markdown 返回其主要内容,并附带标题和元数据。
POST/v1/run/web.scrape
可用率
97.20%
30d · 49,771 次调用
请求数
50,400
30d · 按周,近 12 周
响应时间
2.5s
中位数 · 30d
服务商网络
按流量排序的服务商
试一试
发出你的第一个请求
formatsarray要返回页面的哪些表示形式。可任意组合:markdown(以 Markdown 表示的页面内容)、html(浏览器收到的原样页面 HTML,包括 head 和 script 标签)。每种请求的格式都在对应的输出字段中返回。默认两者都返回。rawHtml 是 html 的已弃用别名,为改名前接入的调用方在 rawHtml 字段中返回;请改为发送 html。
示例响应
免费运行只返回前 3 条结果。为密钥充值即可获得完整响应。
{
"found": true,
"data": {
"url": "https://www.example.com/blog/launch",
"title": "Introducing Example 2.0",
"description": "Everything new in the biggest Example release yet.",
"markdown": "# Introducing Example 2.0\n\nToday we are shipping the biggest release in our history…"
}
}响应类型定义
interface WebScrapeResponse {
data: {
description: string;
html?: string;
language?: string;
markdown?: string;
rawHtml?: string;
title: string;
url: string;
} | null;
found: boolean;
reason?: "not_found";
}完整的参数与响应参考:这个接口的每个字段、类型和示例。
参考
请求、响应与价格
最近验证于 2026-09-29 · 可用率和延迟按 30d 统计POST /v1/run/web.scrape
curl -X POST https://api.getanyapi.com/v1/run/web.scrape \
-H "Authorization: Bearer $ANYAPI_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://www.example.com/blog/launch"}'| 字段 | 类型 | 示例值 |
|---|---|---|
| 请求体 | ||
| url | string | "https://www.example.com/blog/launch"要抓取的页面 URL。 |
| blockAds | boolean | 为 true 时(上游默认值),在抓取前移除广告和 Cookie 同意弹窗元素。设为 false 则保留。 |
| excludeTags | array | 抓取前要移除的 CSS 选择器(例如 ["nav", "footer", ".ads"])。在 includeTags 之后应用。 |
| formats | array | 要返回页面的哪些表示形式。可任意组合:markdown(以 Markdown 表示的页面内容)、html(浏览器收到的原样页面 HTML,包括 head 和 script 标签)。每种请求的格式都在对应的输出字段中返回。默认两者都返回。rawHtml 是 html 的已弃用别名,为改名前接入的调用方在 rawHtml 字段中返回;请改为发送 html。 |
| includeTags | array | 要保留的 CSS 选择器。设置后,只抓取匹配这些选择器的内容(例如 ["article", "main"] 或 ["#content"])。 |
| mobile | boolean | 为 true 时,使用移动端视口和 user agent 渲染页面,而不是桌面端。有些网站向移动端提供的内容有实质差异。 |
| onlyMainContent | boolean | 为 true 时,只返回正文主体内容,去掉导航、页眉、页脚等模板内容。默认为 false,抓取整个页面。 |
| waitFor | integer | 抓取前等待页面完成渲染的毫秒数。适用于大量使用 JavaScript 的页面,或内容在首次绘制后才加载的单页应用。上限为 15000,以免超出请求超时时间。这段等待是你要求我们花费的时间,因此响应会相应延长这么久,并且不计入此接口公布的延迟。 |
| 响应 | ||
| found | boolean | true |
| data | object | |
| data.url | string | "https://www.example.com/blog/launch" |
| data.title | string | "Introducing Example 2.0" |
| data.description | string | "Everything new in the biggest Example release yet." |
| data.markdown | string | "# Introducing Example 2.0\n\nToday we are shipping the biggest release in our history…" |
| 价格 | ||
| 每次请求价格 | USD | US$0.0007 |
| 价格(/千次请求) | USD | US$0.70 |
常见问题
关于 Web Scraping 抓取页面 API
AnyAPI 的 Web Scraping 抓取页面 API 只需一次 POST 请求 /v1/run/web.scrape,就以统一格式的 JSON 返回 Web Scraping 数据。抓取任意网页,以干净的 Markdown 返回其主要内容,并附带标题和元数据。AnyAPI 会在 4 个数据源之间路由每个请求,某个数据源失败时自动切换。费用:每千次请求 US$0.70 起,以美元计价,无需订阅,也没有每月最低消费。过去 30 天,通过 AnyAPI 发起的 Web Scraping 抓取页面 API 调用中有 97.2% 成功,响应时间中位数为 2.5 秒,共测量 49,771 次调用。
费用:每千次请求 US$0.70 起,以美元计价,无需订阅,也没有每月最低消费。你只需为一个美元钱包充值,每次调用从中扣费。部分由钱包付费的失败请求会产生处理费用,我们按成本原价转嫁,不加价;错误响应会显示收取的金额。
抓取任意网页,以干净的 Markdown 返回其主要内容,并附带标题和元数据。响应是统一格式的 JSON,外层结构与每个 AnyAPI 接口相同,所以解析另一个接口只需换一个 URL,别的都不用改。
过去 30 天,通过 AnyAPI 发起的 Web Scraping 抓取页面 API 调用中有 97.2% 成功,响应时间中位数为 2.5 秒,共测量 49,771 次调用。这些是 AnyAPI 对经过网关的流量的自有测量,持续重新计算,并非公开承诺的服务等级目标。