CrawlForge MCP
InicioPlaygroundCasos de usoIntegracionesPreciosDocumentaciónBlog
  1. Inicio/
  2. Glosario/
  3. Términos de datos y API
10 términos

Términos de datos y API

Los 10 formatos y protocolos que mueven los datos extraídos entre sistemas: REST y GraphQL, JSON y Markdown, webhooks y el marcado de datos estructurados que leen los buscadores.

En esta página

  • JSON-LD
  • Datos estructurados
  • Marcado de Schema
  • Endpoint de API
  • Webhook
  • REST API
  • GraphQL
  • JSON
  • Markdown
  • Análisis de HTML

JSON-LD

Definición

JSON-LD (JSON for Linking Data) es un método para codificar datos estructurados utilizando el formato JSON. Es el formato preferido para incrustar el marcado de schema.org en las páginas web con el fin de que los motores de búsqueda las comprendan.

JSON-LD se incrusta en las páginas web como una etiqueta script y contiene metadatos estructurados sobre el contenido de la página: detalles de productos, información de artículos, datos de organizaciones y mucho más. Es una rica fuente de datos limpios y estructurados para los scrapers, porque ya es legible por máquina.

extract_metadata de CrawlForge detecta y extrae JSON-LD de las páginas, dándote acceso a datos estructurados que el propietario del sitio ya ha organizado. Esto suele ser más fiable que analizar los elementos visuales, porque JSON-LD está diseñado para el consumo por parte de máquinas.

Herramientas de CrawlForge relacionadas

extract_metadata2 creditsextract_structured3 credits

Términos relacionados: Datos estructurados, Marcado de Schema, JSON, Análisis de HTML

Datos estructurados

Definición

Los datos estructurados son información organizada en un formato predefinido que facilita su análisis y comprensión por parte de las máquinas. En la web, normalmente se refiere al marcado de schema.org incrustado en las páginas HTML.

Los datos estructurados en los sitios web incluyen anotaciones JSON-LD, microdatos y RDFa que describen el contenido en un formato legible por máquina. Los motores de búsqueda los utilizan para los fragmentos enriquecidos, y los scrapers pueden aprovecharlos para una extracción de datos fiable.

extract_metadata de CrawlForge detecta y analiza automáticamente los datos estructurados de cualquier página. Esto ofrece un atajo para la extracción de datos: en lugar de escribir selectores CSS para cada campo, a menudo puedes obtener precios de productos, valoraciones, disponibilidad y mucho más directamente desde los datos estructurados de la página.

Herramientas de CrawlForge relacionadas

extract_metadata2 creditsscrape_structured3 credits

Términos relacionados: JSON-LD, Marcado de Schema, JSON, Salida estructurada

Marcado de Schema

Definición

El marcado de schema es un vocabulario de etiquetas (de schema.org) que añades al HTML para mejorar cómo los motores de búsqueda leen y representan tu página. Define tipos como Product, Article, Organization y sus propiedades.

El marcado de schema les indica a los motores de búsqueda exactamente qué significa tu contenido, no solo qué dice. Una página con marcado de schema Product declara explícitamente el nombre, el precio, la disponibilidad y las reseñas de un producto, lo que permite resultados de búsqueda enriquecidos.

Para el web scraping, el marcado de schema es una mina de oro. extract_metadata de CrawlForge extrae el marcado de schema de las páginas, proporcionando datos estructurados de productos, metadatos de artículos e información de negocios sin la fragilidad de la extracción basada en selectores CSS.

Herramientas de CrawlForge relacionadas

extract_metadata2 creditsanalyze_content3 credits

Términos relacionados: JSON-LD, Datos estructurados, Auditoría SEO, Análisis de HTML

Endpoint de API

Definición

Un endpoint de API es una URL específica donde una API recibe peticiones. Cada endpoint realiza una función concreta, como recuperar datos, crear registros o desencadenar acciones.

Muchos sitios web tienen API que sirven los mismos datos que se muestran en sus páginas, a menudo en un formato JSON más limpio. Descubrir y usar estos endpoints de API puede ser más eficiente y fiable que hacer scraping del HTML renderizado.

CrawlForge funciona como un conjunto de endpoints de API en sí mismo: cada una de las 29 herramientas es accesible a través de un endpoint REST. Al hacer scraping, fetch_url puede acceder tanto a páginas web como a endpoints de API, devolviendo la respuesta JSON sin procesar para su procesamiento programático.

Herramientas de CrawlForge relacionadas

fetch_url1 creditextract_structured3 credits

Términos relacionados: REST API, Webhook, JSON, Cabeceras HTTP

Webhook

Definición

Un webhook es una devolución de llamada HTTP que entrega datos a una URL especificada cuando ocurre un evento. A diferencia del sondeo, los webhooks envían datos en tiempo real, lo que permite arquitecturas basadas en eventos.

Los webhooks se utilizan habitualmente para desencadenar acciones cuando algo cambia: un nuevo pedido, una actualización de precio o una modificación de contenido. Son la contraparte basada en push del enfoque basado en pull del web scraping.

track_changes de CrawlForge cierra la brecha entre el scraping y los webhooks. Monitorea las páginas en busca de cambios y puede notificar a tus sistemas cuando el contenido se actualiza, dándote una conciencia en tiempo real similar a la de un webhook sin que el sitio de destino necesite admitirlos.

Herramientas de CrawlForge relacionadas

track_changes3 credits

Términos relacionados: Endpoint de API, REST API, JSON, Pipeline de datos

REST API

Definición

Una REST API (Representational State Transfer) es una arquitectura de servicio web que utiliza métodos HTTP estándar para realizar operaciones sobre recursos. Es el estilo de API más habitual para los servicios web.

Las REST API utilizan métodos HTTP como GET, POST, PUT y DELETE para interactuar con los recursos identificados por las URL. La mayoría de los servicios web modernos, incluido CrawlForge, exponen su funcionalidad a través de endpoints REST.

Las 29 herramientas de CrawlForge son accesibles a través de endpoints REST API además de MCP. Esto significa que puedes integrar CrawlForge en cualquier lenguaje de programación o plataforma que pueda realizar peticiones HTTP, no solo en los clientes de IA compatibles con MCP.

Herramientas de CrawlForge relacionadas

fetch_url1 credit

Términos relacionados: Endpoint de API, GraphQL, JSON, Cabeceras HTTP

GraphQL

Definición

GraphQL es un lenguaje de consulta para API que permite a los clientes solicitar exactamente los datos que necesitan. A diferencia de REST, un único endpoint de GraphQL sirve todas las consultas, y el cliente especifica la forma de los datos.

Algunos sitios web usan API de GraphQL para impulsar su frontend, lo que puede ser un objetivo de scraping eficiente. Las respuestas de GraphQL ya son JSON estructurado, y puedes solicitar solo los campos que necesitas, reduciendo la transferencia de datos.

fetch_url de CrawlForge puede acceder directamente a los endpoints de GraphQL, enviando consultas y recibiendo respuestas estructuradas. Para los sitios que exponen GraphQL, este enfoque es más eficiente que hacer scraping del HTML renderizado.

Herramientas de CrawlForge relacionadas

fetch_url1 credit

Términos relacionados: REST API, Endpoint de API, JSON, Salida estructurada

JSON

Definición

JSON (JavaScript Object Notation) es un formato ligero de intercambio de datos que es fácil de leer para los humanos y de analizar para las máquinas. Es el formato estándar para las respuestas de API y el intercambio de datos estructurados.

JSON es la lengua franca de los datos web. Las respuestas de API, los archivos de configuración y los datos estructurados se codifican casi universalmente en JSON. Al hacer scraping, el objetivo suele ser transformar un HTML desordenado en JSON limpio que los sistemas posteriores puedan procesar.

Las herramientas de CrawlForge devuelven datos en formato JSON de forma predeterminada. Herramientas como scrape_structured y extract_structured te permiten definir un esquema JSON para la salida, asegurando que los datos extraídos coincidan exactamente con la estructura que esperas.

Herramientas de CrawlForge relacionadas

scrape_structured3 creditsextract_structured3 credits

Términos relacionados: JSON-LD, REST API, Salida estructurada, Datos estructurados

Markdown

Definición

Markdown es un lenguaje de marcado ligero que utiliza una sintaxis de formato de texto plano. Se usa ampliamente para la documentación, la creación de contenido y como un formato intermedio limpio para el contenido web extraído.

Markdown preserva la estructura del contenido (encabezados, listas, enlaces, bloques de código) a la vez que elimina la complejidad del HTML. Esto lo convierte en un formato de salida ideal para el web scraping cuando necesitas texto legible y estructurado en lugar de HTML sin procesar o texto plano.

extract_content de CrawlForge admite markdown como formato de salida, convirtiendo las páginas web en markdown limpio que preserva la estructura del documento. Esto es especialmente útil para la migración de contenido, el scraping de documentación y para alimentar a los modelos de IA que procesan bien el markdown.

Herramientas de CrawlForge relacionadas

extract_content2 creditsextract_text1 credit

Términos relacionados: Análisis de HTML, JSON, Salida estructurada, Migración de contenido

Análisis de HTML

Definición

El análisis de HTML es el proceso de analizar el marcado HTML para extraer su estructura y contenido. Los analizadores convierten las cadenas de HTML sin procesar en estructuras de árbol navegables que los programas pueden consultar y manipular.

El análisis de HTML es la operación técnica central que hay detrás del web scraping. El HTML sin procesar de una página web debe analizarse en una representación estructurada antes de poder extraer cualquier dato. La calidad del analizador determina lo bien que maneja el HTML mal formado, algo habitual en la web.

CrawlForge gestiona el análisis de HTML de forma interna en todas sus herramientas, usando analizadores robustos que manejan con elegancia el HTML del mundo real. Nunca tienes que lidiar tú mismo con las peculiaridades del análisis: solo especifica los datos que necesitas y las herramientas devuelven resultados limpios.

Herramientas de CrawlForge relacionadas

extract_content2 creditsextract_text1 creditextract_metadata2 credits

Términos relacionados: Análisis del DOM, Selector CSS, XPath, JSON-LD

Más guías del glosario

Términos de Web Scraping

15 términos · Web Scraping

Términos de IA y MCP

15 términos · IA / MCP

Términos del sector de datos web

10 términos · Industria

Ver todos los términos del glosario

Empieza a hacer scraping con 1,000 créditos gratis

Empieza a usar CrawlForge hoy mismo. No se requiere tarjeta de crédito.

Empieza a hacer scraping con 1,000 créditos gratis

Pie de página

CrawlForge MCP

Web scraping empresarial para agentes de IA. 29 herramientas MCP especializadas diseñadas para desarrolladores modernos que crean sistemas inteligentes.

Producto

  • Funciones
  • Playground
  • Precios
  • Casos de uso
  • Integraciones
  • Alternativas
  • Registro de cambios

Recursos

  • Primeros pasos
  • Referencia de la API
  • Plantillas
  • Guías
  • Blog
  • Glosario
  • Preguntas frecuentes
  • Mapa del sitio

Desarrolladores

  • Protocolo MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Empresa

  • Acerca de
  • Contacto
  • Privacidad
  • Términos
  • Uso aceptable
  • Cookies

Mantente al día

Recibe las últimas novedades sobre nuevas herramientas y funciones.

Creado con Next.js y el protocolo MCP

© 2025-2026 CrawlForge. Todos los derechos reservados.