AgentStack
Browse Sign in
Browse Why AgentStack Sell Docs
Sign in
SKILL verified MIT Self-run

Web Scraper

skill-bestdeejay-design-agent-skills-web-scraper · by bestdeejay-design

Вежливый скраппинг HTML-страниц в Markdown/JSON. Скрипт scrape.py читает страницу по URL, применяет простой CSS-селектор (tag, tag#id, tag.class) для выбора строк/секций, извлекает текст, ссылки и таблицы и отдаёт результат в Markdown или JSON. Легальные guardrails встроены в код: проверка robots.txt, честный User-Agent, задержка между запросами (по умолчанию 1.0 с), лимит размера страницы 10 МБ.…

No reviews yet
0 installs
0 views
view→install

Install

$ agentstack add skill-bestdeejay-design-agent-skills-web-scraper

✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • Prompt-injection patterns
  • Secret / credential exfiltration
  • Dangerous shell & filesystem operations
  • Untrusted network calls
  • Known-malicious package signatures

What it can access

  • Network access Used
  • Filesystem access No
  • Shell / process execution No
  • Environment & secrets No
  • Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

View the full security report →

Verified badge

Passed review? Show it. Paste this badge into your README, it links to the public security report.

AgentStack Verified badge Links to your public security report.
[![AgentStack Verified](https://agentstack.voostack.com/badges/verified.svg)](https://agentstack.voostack.com/security/report/skill-bestdeejay-design-agent-skills-web-scraper)

Reliability & compatibility

Security review passed
0 installs to date
no reviews yet
today

Declared compatibility

Claude CodeClaude Desktop

Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.

Preview Execution monitoring

We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.

How agent discovery & health will work →
Are you the author of Web Scraper? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

Web Scraper

> Вежливый скраппинг HTML-страниц в Markdown/JSON на чистом Python 3 stdlib.

Загружай этот скилл когда нужно извлечь данные с веб-страницы: текст, ссылки и таблицы из выбранных секций — для анализа, отчётов или датасетов.

🎯 When to use

Use this skill when:

  • Нужно скачать данные с сайта: текст, ссылки, таблицы из выбранных блоков
  • Просят «скраппинг», «парсинг сайта», «парсер html», «извлечь данные»
  • Нужен быстрый дамп страницы в Markdown или JSON без установки библиотек
  • Нужен вежливый сбор данных с учётом robots.txt и rate limit

Do NOT use when:

  • Нужен полноценный CSS/XPath-парсер с вложенными селекторами — это BeautifulSoup/lxml
  • Нужен обход JS-рендеринга (SPA) — stdlib не исполняет JavaScript
  • Нужен массовый сбор тысяч страниц — согласуй с владельцем сайта и ToS
  • Нужны данные из API — используй прямой HTTP-запрос к API

📦 Files

  • SKILL.md — этот файл
  • scripts/scrape.py — скрапер (Python 3 stdlib: urllib.request, html.parser)

🧰 Usage

# Markdown (по умолчанию), селектор по классу:
python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "div.item"

# JSON, селектор по id:
python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "div#list" --output json

# Все абзацы страницы:
python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "p"

# Локальный файл (без сети, для теста):
python3 skills/web-scraper/scripts/scrape.py --url file:///tmp/test.html --selector "p"

# Увеличить задержку между запросами:
python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "article" --delay 2.5

Селектор — простой tag, tag#id или tag.class (например div#list, tr.row). Каждый совпавший элемент становится отдельным пунктом: текст, ссылки и таблицы.

⚖️ Legal guardrails

Скрипт соблюдает правила вежливого скраппинга (встроены в код):

  • robots.txt — перед запросом читается robots.txt с origin-хоста; если путь

запрещён правилом Disallow, скрипт пропускает страницу с сообщением и кодом 3.

  • User-Agent — честный идентификатор

Mozilla/5.0 (compatible; web-scraper/1.0; +educational).

  • Rate limit — задержка между запросами по умолчанию 1.0 с (--delay).
  • Лимит размера — страницы больше 10 МБ отклоняются.
  • ToS — перед массовым сбором проверь условия использования сайта и

авторские права на данные; скрипт предназначен для образовательных целей.

🔬 Проверка результата

  • Markdown: начинается с # , содержит секции ## Элементы (N) с текстом,

ссылками и таблицами.

  • JSON: валидный JSON с ключами title, url, matched, items[] (text, href).
  • При ошибке сети/robots скрипт пишет причину в stderr и завершается с кодом 2

(или 3 при запрете robots.txt), без traceback в stdout.

Canonical analogues

Канонические аналоги, недостающие техники (Retry-After, backoff + jitter, crawl-delay, rate-limit заголовки, условные запросы) и CLI-примеры — в [references/canonical-patterns.md](references/canonical-patterns.md). Топ:

  • MCP Fetch Server (modelcontextprotocol/servers) — эталон «URL → Markdown»: robots.txt по умолчанию, честный UA, лимит размера.
  • Scrapy — эталон вежливости: RobotsTxtMiddleware, AutoThrottle (адаптивная задержка), ретраи на 408/429/5xx.
  • Crawlee (Apify) — respect_robots_txt_file=True, ретраи с backoff, autoscaling, ротация прокси.
  • Playwright — браузерное извлечение: locator API, text_content(), page.content().
  • Trafilatura — ближайший по назначению аналог: CLI HTML → Markdown/JSON.
  • Mozilla Readability — канонический алгоритм извлечения основного контента статьи.

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet, be the first.

Versions

  • v0.1.0 Imported from the upstream source.