gestiona_scraping
- Ruta de Configuración:
IA_Configuracion/skills/gestiona_scraping/
Skill: Gestionar Scraping (gestiona_scraping)
Este skill interactúa con el microservicio api-utilidades-scraping (corriendo en el puerto 3700 o de manera centralizada a través del API Gateway en http://localhost:3000/api/scrape) para realizar descargas web rápidas, extraer el contenedor principal de texto de la página (eliminando banners, headers, footers y scripts) y transformarlo a formato Markdown limpio y legible.
Cuándo activar
Activa esta habilidad cuando el usuario o los flujos automatizados de investigación requieran:
- “extrae el contenido de la web …”, “descarga este artículo”
- “lee la documentación de la URL …”, “haz scraping a …”
- “extrae texto limpio de la página …”
- “alimenta el RAG con información de este enlace web”
Instrucciones de Uso y Automatización
Paso 1: Verificar el Estado del Servidor (Health Check)
El servicio corre en el puerto 3700 (mapeado en /api/scrape del Gateway). Comprueba su estado a través del Gateway:
try { $r = Invoke-RestMethod -Uri "http://localhost:3000/api/scrape/" -TimeoutSec 3; $r.message } catch { "OFFLINE" }Si no está activo, arráncalo de fondo:
Start-Process -FilePath "node" -ArgumentList "server.js" -WorkingDirectory "C:\Users\jjtei\Desktop\IA_Infraestructura\api-utilidades-scraping" -WindowStyle HiddenStart-Sleep -Seconds 2Paso 2: Extraer Contenido de una URL (POST /api/scrape/extract)
Envía la URL del sitio web público al endpoint. El microservicio procesará la página y devolverá un objeto JSON con el título, descripción y contenido transformado a Markdown:
$body = @{ url = "https://es.wikipedia.org/wiki/Inteligencia_artificial"} | ConvertTo-Json
$res = Invoke-RestMethod -Uri "http://localhost:3000/api/scrape/extract" -Method Post -Body $body -ContentType "application/json"$res.data.title # Título extraído de la página$res.data.contentMarkdown # Contenido limpio estructurado en MarkdownIntegración con RAG (Alimentación de Conocimiento)
Este servicio se complementa de forma natural con gestiona_conocimiento para permitir búsquedas locales sobre páginas de internet. Para implementarlo en paralelo:
- Extracción: Llama a
gestiona_scraping(/api/scrape/extract) pasándole la URL de la documentación externa deseada. - Obtención: Captura el
contentMarkdowny eltitledevueltos. - Indexación: Llama a
gestiona_conocimiento(/api/rag/index) enviando ese texto markdown para que se fragmente e indexe en el almacén de RAG local. - Búsqueda: Posteriormente, el agente puede buscar cualquier dato de esa web realizando peticiones a
/api/rag/search.