Web Scraping API

Web Scraping 抓取页面 API

抓取任意网页,以干净的 Markdown 返回其主要内容,并附带标题和元数据。

POST/v1/run/web.scrape
可用率
97.20%
30d · 49,771 次调用
请求数
50,400
30d · 按周,近 12 周
响应时间
2.5s
中位数 · 30d

试一试

发出你的第一个请求

formatsarray
要返回页面的哪些表示形式。可任意组合:markdown(以 Markdown 表示的页面内容)、html(浏览器收到的原样页面 HTML,包括 head 和 script 标签)。每种请求的格式都在对应的输出字段中返回。默认两者都返回。rawHtml 是 html 的已弃用别名,为改名前接入的调用方在 rawHtml 字段中返回;请改为发送 html。
打开于
获取免费密钥
示例响应
免费运行只返回前 3 条结果。为密钥充值即可获得完整响应。
{
  "found": true,
  "data": {
    "url": "https://www.example.com/blog/launch",
    "title": "Introducing Example 2.0",
    "description": "Everything new in the biggest Example release yet.",
    "markdown": "# Introducing Example 2.0\n\nToday we are shipping the biggest release in our history…"
  }
}
响应类型定义
interface WebScrapeResponse {
  data: {
    description: string;
    html?: string;
    language?: string;
    markdown?: string;
    rawHtml?: string;
    title: string;
    url: string;
  } | null;
  found: boolean;
  reason?: "not_found";
}

完整的参数与响应参考:这个接口的每个字段、类型和示例。

参考

请求、响应与价格

最近验证于 2026-09-29 · 可用率和延迟按 30d 统计
POST /v1/run/web.scrape
curl -X POST https://api.getanyapi.com/v1/run/web.scrape \
  -H "Authorization: Bearer $ANYAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://www.example.com/blog/launch"}'
字段类型示例值
请求体
urlstring"https://www.example.com/blog/launch"要抓取的页面 URL。
blockAdsboolean为 true 时(上游默认值),在抓取前移除广告和 Cookie 同意弹窗元素。设为 false 则保留。
excludeTagsarray抓取前要移除的 CSS 选择器(例如 ["nav", "footer", ".ads"])。在 includeTags 之后应用。
formatsarray要返回页面的哪些表示形式。可任意组合:markdown(以 Markdown 表示的页面内容)、html(浏览器收到的原样页面 HTML,包括 head 和 script 标签)。每种请求的格式都在对应的输出字段中返回。默认两者都返回。rawHtml 是 html 的已弃用别名,为改名前接入的调用方在 rawHtml 字段中返回;请改为发送 html。
includeTagsarray要保留的 CSS 选择器。设置后,只抓取匹配这些选择器的内容(例如 ["article", "main"] 或 ["#content"])。
mobileboolean为 true 时,使用移动端视口和 user agent 渲染页面,而不是桌面端。有些网站向移动端提供的内容有实质差异。
onlyMainContentboolean为 true 时,只返回正文主体内容,去掉导航、页眉、页脚等模板内容。默认为 false,抓取整个页面。
waitForinteger抓取前等待页面完成渲染的毫秒数。适用于大量使用 JavaScript 的页面,或内容在首次绘制后才加载的单页应用。上限为 15000,以免超出请求超时时间。这段等待是你要求我们花费的时间,因此响应会相应延长这么久,并且不计入此接口公布的延迟。
响应
foundbooleantrue
dataobject
data.urlstring"https://www.example.com/blog/launch"
data.titlestring"Introducing Example 2.0"
data.descriptionstring"Everything new in the biggest Example release yet."
data.markdownstring"# Introducing Example 2.0\n\nToday we are shipping the biggest release in our history…"
价格
每次请求价格USDUS$0.0007
价格(/千次请求)USDUS$0.70

常见问题

关于 Web Scraping 抓取页面 API

AnyAPI 的 Web Scraping 抓取页面 API 只需一次 POST 请求 /v1/run/web.scrape,就以统一格式的 JSON 返回 Web Scraping 数据。抓取任意网页,以干净的 Markdown 返回其主要内容,并附带标题和元数据。AnyAPI 会在 4 个数据源之间路由每个请求,某个数据源失败时自动切换。费用:每千次请求 US$0.70 起,以美元计价,无需订阅,也没有每月最低消费。过去 30 天,通过 AnyAPI 发起的 Web Scraping 抓取页面 API 调用中有 97.2% 成功,响应时间中位数为 2.5 秒,共测量 49,771 次调用。

费用:每千次请求 US$0.70 起,以美元计价,无需订阅,也没有每月最低消费。你只需为一个美元钱包充值,每次调用从中扣费。部分由钱包付费的失败请求会产生处理费用,我们按成本原价转嫁,不加价;错误响应会显示收取的金额。

抓取任意网页,以干净的 Markdown 返回其主要内容,并附带标题和元数据。响应是统一格式的 JSON,外层结构与每个 AnyAPI 接口相同,所以解析另一个接口只需换一个 URL,别的都不用改。

过去 30 天,通过 AnyAPI 发起的 Web Scraping 抓取页面 API 调用中有 97.2% 成功,响应时间中位数为 2.5 秒,共测量 49,771 次调用。这些是 AnyAPI 对经过网关的流量的自有测量,持续重新计算,并非公开承诺的服务等级目标。