Saltar al contenido

CrawlForge TeamEquipo de Ingeniería

5 min de lectura

API de investigación de mercado para consultores: de cero a la lista de proveedores

Un consultor empieza de nuevo su investigación de mercado con cada encargo. Categoría nueva, lista de proveedores nueva, y un cliente que preguntará en la diapositiva catorce de dónde salió ese número. La hoja de cálculo del trimestre pasado no sirve. El método sí.

Una API de investigación de mercado para consultores tiene que funcionar desde cero, porque el primer día no hay ninguna lista de proveedores a la que apuntarla, y tiene que devolver hechos con una fuente y una fecha, porque "lo comprobamos" no es una respuesta que un socio pueda dar. También tiene que costar algo que puedas cargar a un cliente en concreto, en vez de a gastos generales.

¿Por dónde empiezas cuando todavía no hay lista de proveedores?

Con dos llamadas que devuelven URLs en vez de respuestas. search_web cuesta 5 credits por consulta y acepta un array queries, así que seis formas de preguntar "quién le vende X a Y" se ejecutan en una sola llamada por 30 credits. Los fragmentos suelen bastar para distinguir un proveedor de un simple listado. Cuando además quieres los pasajes, deep_research cuesta 10 credits por ejecución: busca, obtiene hasta diez fuentes y devuelve los pasajes que mejor coinciden de forma literal, con una lista sources que lleva la URL de cada una, su título y si se llegó a obtener de verdad o solo se vio en un fragmento. En la API alojada no se sintetiza nada, y ese es justamente el punto. Lo que recibes es una lista larga de dominios y las frases que los pusieron en ella.

El siguiente paso es encontrar la página correcta en cada dominio, y la forma equivocada de hacerlo es adivinar que los precios están en /pricing. map_site cuesta 2 credits por dominio y lee el sitemap del sitio, recurriendo a un rastreo acotado cuando no hay uno, así que obtienes la lista de URLs y eliges de ahí precios, producto, clientes y empleo. Treinta proveedores son 60 credits y nunca obtienes un 404.

¿Cómo llega un hecho a la presentación con su fuente?

Un scrape por página. Pide markdown, metadata y links juntos: todos los formatos salen de la misma llamada y cuesta 2 credits sin importar cuántos pidas. La respuesta lleva un timestamp scraped_at, que es la columna de fecha que necesita tu entregable.

Bash
curl -X POST https://crawlforge.dev/api/v1/tools/scrape \
  -H "X-API-Key: cf_live_NORTHWIND_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://vendor-a.com/pricing",
    "formats": ["markdown", "metadata", "links"]
  }'

La fila que escribes es proveedor, URL de la página, la afirmación, la frase en la que se apoya, y scraped_at. Cita la frase en vez de parafrasearla. Una celda que dice "SSO en todos los planes" es una opinión hasta que la frase de al lado lo confirme, y el post sobre due diligence explica qué pasa cuando un modelo rellena esa celda en su lugar.

Si la misma pregunta hay que responderla para todos los proveedores, añade un formato question por 1 credit más y la llamada devuelve las cinco frases que mejor coinciden, cada una con un offset dentro del markdown. El post de RevOps trata de hacer eso a lo largo de una categoría; este trata de conseguir la categoría en primer lugar.

¿Cómo mantienes separado el gasto de un cliente del de otro?

Crea una clave de API por cliente y ponle el nombre del encargo. Una cuenta admite hasta diez, que son más encargos simultáneos de los que lleva la mayoría de las consultoras. Cada llamada hecha con esa clave escribe una fila en el registro de peticiones con la herramienta, la URL de destino, los credits cobrados y la clave de la que vino, y el registro se filtra por clave y se exporta como CSV.

Eso hace dos cosas que nadie pide hasta que las necesita. El gasto del encargo pasa a ser una consulta en vez de una reconstrucción, y la investigación de un cliente queda separable de la de los demás cuando preguntan qué tienes sobre ellos. Al cerrar el encargo, borra la clave. Borrarla la revoca y conserva las filas, así que el registro de qué se obtuvo y para quién sobrevive al encargo.

El ejemplo de arriba pone al cliente en el nombre de la clave por la misma razón: el nombre es justo lo que vas a usar para filtrar.

¿Cuánto cuesta un encargo?

Un panorama de 30 proveedores, hecho como se explicó arriba:

PasoLlamadasCredits
Lista larga: seis formas de búsqueda, una ejecución de deep_research1 + 140
Encontrar las páginas: map_site por proveedor3060
Leer cuatro páginas por proveedor120240
Una pregunta hecha a cada página de precios3090
Total del encargo430

Los 1.000 credits únicos del plan gratuito cubren dos de ellos. A partir de ahí, un pack de 1K cuesta $3 y uno de 5K cuesta $14, comprados cuando un encargo los necesita en vez de con un plan mensual, lo cual es un argumento aparte. Al precio del pack, todo el panorama de arriba cuesta alrededor de un dólar y medio, lo bastante poco para meterlo dentro de los honorarios y lo bastante auditable si un cliente pregunta qué cubre esa línea.

¿Qué no va a hacer?

  • Ninguna cifra de tamaño de mercado. No dimensiona nada ni hace previsiones. Si la diapositiva necesita un TAM, eso viene de un informe o un dataset.
  • Ningún dato de contacto ni firmográfico. Lee las páginas que le indiques. No es una base de datos de empresas y no se solapa con una.
  • Ningún login de cliente. Una cuenta, claves por cliente, y el cliente ve lo que le envías.
  • robots.txt se respeta por defecto. Una página no permitida se rechaza antes de obtener nada y no cuesta nada, y desactivar esa comprobación queda registrado contra tu clave.

Cuando el encargo se convierte en un contrato continuo y la pregunta pasa a ser "avísame cuando esto cambie", la respuesta es un monitor por cliente, no volver a ejecutar esto de forma programada.

Empieza gratis con 1.000 credits, crea una clave con el nombre de tu próximo encargo, y construye un panorama antes de construir nada a su alrededor.

Pruébalo tú mismo — sin necesidad de registrarte

Explora las 31 herramientas de scraping y extracción de CrawlForge en el playground y luego empieza gratis con 1,000 credits.

1,000 credits gratis • Por única vez • No se requiere tarjeta de crédito

Etiquetas

  • consultants
  • market research
  • scrape
  • map_site
  • deep_research
  • b2b

Sobre el autor

CrawlForge Team

Equipo de Ingeniería

Construimos el MCP server de web scraping más completo. Creamos herramientas que ayudan a los desarrolladores a extraer, analizar y transformar datos web para aplicaciones de IA.

Newsletter

Mantente al día con los últimos artículos

Recibe tutoriales, novedades del producto y consejos de web scraping en tu bandeja de entrada.

Sin spam. Cancela tu suscripción cuando quieras.

FAQ

Preguntas frecuentes

01¿CrawlForge es un proveedor de datos de investigación de mercado para consultores?

No. No tiene estimaciones de tamaño de mercado, ni datos firmográficos, ni señales de intención, ni registros de contacto. Lee las páginas públicas que le indiques y devuelve lo que dicen, con la URL y una marca de tiempo. Para un encargo de consultoría, eso lo convierte en la capa que construye y cita el panorama a partir de las webs de los propios proveedores, junto a cualquier informe sindicado o dataset que la firma ya tenga licenciado.

02¿Cómo encuentro a los proveedores de una categoría que nunca he investigado?

search_web cuesta 5 credits por consulta y acepta un array queries, así que varias formas de preguntar se ejecutan en una sola llamada y se cobran por cada consulta que devolvió resultados. deep_research cuesta 10 credits por ejecución y devuelve pasajes literales más una lista sources con la URL de cada uno, su título y si se llegó a obtener. Ambas devuelven URLs en vez de una respuesta redactada, que es justo lo que quieres en la fase de la lista larga. map_site luego lista las páginas de cada dominio por 2 credits, así que eliges la página de precios o de producto en vez de adivinar su ruta.

03¿Puedo separar el uso de un cliente del de otro?

Sí. Crea una clave de API con nombre por cliente; una cuenta admite hasta diez. Cada llamada registra la clave de la que vino, junto con la herramienta, la URL y los credits cobrados, y el registro de peticiones del panel se filtra por clave y se exporta como CSV. Borrar una clave al cerrar el encargo la revoca y conserva sus filas, así que el registro del encargo sobrevive a la clave.

04¿Necesito una suscripción para hacer un encargo?

No. El plan gratuito da 1.000 credits de una sola vez, suficientes para dos panoramas de 30 proveedores al coste calculado arriba. A partir de ahí, los packs de credits de un solo uso empiezan en $3 por 1.000 y $14 por 5.000, así que una consultora que investiga a rachas puede comprar por encargo en vez de pagar cada mes. Existen planes de pago para firmas que quieren una asignación mensual con acumulación.

05¿Por qué no usar batch_scrape para toda la lista de proveedores de una vez?

En la REST API alojada, batch_scrape cobra 5 credits por URL intentada y devuelve texto plano, mientras que scrape cobra 2 por página y devuelve markdown, metadata y enlaces de una sola llamada. Batch es un solo viaje de ida y vuelta y guarda sus resultados durante 24 horas, lo cual es cómodo, pero para un panorama que vas a leer con detenimiento, un bucle de llamadas a scrape cuesta menos de la mitad y te da más que citar.

Sigue leyendo

Artículos relacionados