🦾 CyberScraper 2077 - собираем данные с сайтов с помощью LLM
Открываешь страницу и пишешь: «Собери названия товаров, цены и ссылки в таблицу». Такой сценарий предлагает CyberScraper 2077 - открытый инструмент для веб-скрейпинга с интерфейсом на Streamlit.
Что умеет:
🔹 Использовать OpenAI, Gemini и локальные модели через Ollama. Есть подключение моделей через LiteLLM.
🔹 Извлекать и структурировать данные по текстовому запросу.
🔹 Экспортировать результат в JSON, CSV, HTML, SQL и Excel, а также загружать CSV в Google Sheets.
🔹 Собирать данные с нескольких страниц: можно задавать диапазоны и шаблоны URL. Функция пока в бета-версии.
🔹 Кэшировать содержимое и запросы, сокращая повторные обращения к API.
🔹 Работать с .onion-сайтами через отдельно настроенный Tor.
🐳 Запуск: Python 3.10+ или Docker. Для Windows автор рекомендует контейнер.
♻️ Сделай репост, чтобы помочь другим.
👉 @itmozg
Открываешь страницу и пишешь: «Собери названия товаров, цены и ссылки в таблицу». Такой сценарий предлагает CyberScraper 2077 - открытый инструмент для веб-скрейпинга с интерфейсом на Streamlit.
Что умеет:
🔹 Использовать OpenAI, Gemini и локальные модели через Ollama. Есть подключение моделей через LiteLLM.
🔹 Извлекать и структурировать данные по текстовому запросу.
🔹 Экспортировать результат в JSON, CSV, HTML, SQL и Excel, а также загружать CSV в Google Sheets.
🔹 Собирать данные с нескольких страниц: можно задавать диапазоны и шаблоны URL. Функция пока в бета-версии.
🔹 Кэшировать содержимое и запросы, сокращая повторные обращения к API.
🔹 Работать с .onion-сайтами через отдельно настроенный Tor.
🐳 Запуск: Python 3.10+ или Docker. Для Windows автор рекомендует контейнер.
♻️ Сделай репост, чтобы помочь другим.
👉 @itmozg