Todos los scrapers

Buscadores

Yahoo Images Scraper

images.search.yahoo.com

99.9% Tasa de éxito
2.9s Respuesta media
Bot detection + rate limiting Protección
1040 llamadas Medido sobre

La búsqueda de imágenes de Yahoo sirve resultados del índice de imágenes de Bing en sus propias páginas, con un sitio regional para muchos países. Su cuadrícula carga más mosaicos a medida que haces scroll y guarda la imagen original y la página de origen de cada resultado en atributos del mosaico, así que hacer scraping por tu cuenta implica renderizar la página y leer cada mosaico. Un endpoint de plugin dedicado recibe una palabra clave y devuelve cada resultado ya parseado: la URL real de la imagen a resolución completa (no una miniatura), el dominio y la página de origen, un título y el nombre del sitio, una miniatura y las dimensiones originales en píxeles, sin cuadrícula que renderizar por tu cuenta y sin cuenta de Yahoo. proxy_country elige el sitio regional de Yahoo (de.images.search.yahoo.com para DE) y el exit a través del que se renderiza la página en un navegador real, y pages recopila hasta 10 páginas de unas 60 imágenes cada una en una sola llamada. La respuesta replica nuestros plugins de Google Imágenes y Bing Imágenes, de modo que un solo pipeline los gestiona todos.

Qué puedes extraer

  • La URL de la imagen original a resolución completa en el sitio del editor, para cada resultado
  • El dominio de origen y la URL de la página de origen que muestra la imagen
  • El título del resultado, más el sitio que Yahoo muestra para él
  • Una URL de miniatura alojada por Bing, rápida de cargar: la que Yahoo muestra en su cuadrícula
  • Ancho y alto originales de la imagen en píxeles
  • Un enlace al visor de imágenes de Yahoo para cada resultado
  • Unos 60 resultados por página, hasta 10 páginas por llamada, desde el sitio regional de Yahoo del país que elijas

Endpoints dedicados

/images/yahoo-search

Búsqueda de imágenes de Yahoo

Resultados de imágenes para una palabra clave. Devuelve la URL de la imagen de origen a resolución completa y el dominio de origen de cada resultado, además de la página de origen, el título, el nombre del sitio, la miniatura, las dimensiones y un enlace al visor de imágenes de Yahoo; proxy_country elige el sitio regional de Yahoo y el exit; hasta 10 páginas de unos 60 resultados cada una, con un límite opcional mediante max_results.

Cómo rastrearlo

curl -X POST \
  -H "X-ScrapeUnblocker-Key: $SU_API_KEY" \
  "https://api.scrapeunblocker.com/images/yahoo-search?q=eiffel%20tower&pages=1"
import requests

resp = requests.post(
    "https://api.scrapeunblocker.com/images/yahoo-search",
    headers={"X-ScrapeUnblocker-Key": SU_API_KEY},
    params={"q": "eiffel tower", "pages": "1"},
)
print(resp.text)
import { ScrapeUnblockerClient } from 'scrapeunblocker';

const su = new ScrapeUnblockerClient({ apiKey: process.env.SU_API_KEY });

const results = await su.yahooImages('eiffel tower', {
  pages: 1,
});
console.log(results);

Las peticiones son POST y sus parámetros van en la query string. El renderizado en navegador siempre ocurre: no hay ningún flag que activar.

Ejemplo de respuesta

{
  "engine": "yahoo",
  "query": "eiffel tower",
  "gl": "us",
  "proxyCountry": "US",
  "resultsCollected": 60,
  "pagesFetched": 1,
  "hasMore": true,
  "results": [
    {
      "position": 1,
      "imageUrl": "https://cdn.britannica.com/54/75854-050-E27E66C0/Eiffel-Tower-Paris.jpg",
      "sourceDomain": "britannica.com",
      "sourcePageUrl": "https://www.britannica.com/topic/Eiffel-Tower-Paris-France",
      "title": "Eiffel Tower | History, Height, & Facts | Britannica",
      "sourceName": "www.britannica.com",
      "thumbnailUrl": "https://tse3.mm.bing.net/th/id/OIP.Z97bkX40h0DN2g8WwHpqJwHaLO?r=0&pid=Api&h=220&P=0",
      "width": 1056,
      "height": 1600,
      "fileSize": null,
      "yahooImagesUrl": "https://images.search.yahoo.com/search/images;_ylt=A2RRWreO_LlqFQMABYGJzbkF;_ylu=Y29sbwN1cy1lYXN0LTEEcG9zAzEEdnRpZAMEc2VjA3Ny?p=eiffel+tower&imgurl=https%3A%2F%2Fcdn.britannica.com..."
    },
    {
      "position": 2,
      "imageUrl": "https://cdn.britannica.com/52/245552-050-3D7334F9/Eiffel-Tower-Paris.jpg",
      "sourceDomain": "morilly.com",
      "sourcePageUrl": "https://morilly.com/blog/paris-attractions-eiffel-tower",
      "title": "Paris attractions eiffel tower 60 photos - Morilly.com",
      "sourceName": "morilly.com",
      "thumbnailUrl": "https://tse4.mm.bing.net/th/id/OIP.54RmpGCUWV9JgeBRQFxVjAHaHo?r=0&pid=Api&h=220&P=0",
      "width": 1551,
      "height": 1600,
      "fileSize": null,
      "yahooImagesUrl": "https://images.search.yahoo.com/search/images;_ylt=A2RRWreO_LlqFQMAB4GJzbkF;_ylu=Y29sbwN1cy1lYXN0LTEEcG9zAzIEdnRpZAMEc2VjA3Ny?p=eiffel+tower&imgurl=https%3A%2F%2Fcdn.britannica.com..."
    }
  ]
}

Leer la documentación

Preguntas frecuentes

¿Es legal hacer scraping de la búsqueda de imágenes de Yahoo?

Recopilar resultados de imágenes públicos -URLs, dominios de origen y títulos- es lícito en muchas jurisdicciones, pero las normas dependen de tu país, de los datos que recopiles y de cómo los uses. Las imágenes en sí siguen siendo propiedad de sus dueños, así que sigues siendo responsable del uso que les des. ScrapeUnblocker devuelve los resultados públicos; qué recopilas y cómo lo usas es decisión tuya.

¿Cómo hago scraping de la búsqueda de imágenes de Yahoo sin que me bloqueen?

Yahoo usa detección de bots y limitación de tasa. El plugin /images/yahoo-search renderiza cada página de resultados en un navegador real a través de un exit en el país que elijas, vuelve a renderizar una página con un exit nuevo cuando llega bloqueada y devuelve los resultados de imágenes ya parseados. En el benchmark de ScrapeUnblocker devolvió resultados reales en el 99,9 % de 1.040 llamadas con palabras clave distintas, unos 2,9 s por llamada.

¿Qué datos obtengo de cada imagen?

Por cada resultado: la posición, la URL de la imagen de origen a resolución completa en el sitio del editor (no una miniatura), el dominio y la página de origen, el título y el sitio que Yahoo muestra para él, una URL de miniatura alojada por Bing, el ancho y alto originales en píxeles, y un enlace al visor de imágenes de Yahoo. La búsqueda de imágenes de Yahoo sirve resultados del índice de imágenes de Bing, por eso las miniaturas están alojadas en Bing. fileSize está presente para coincidir con el plugin de Google Imágenes y con Yahoo siempre es null.

¿Necesito una API o una cuenta de Yahoo?

No. Yahoo no ofrece una API pública para sus resultados de imágenes (su API de búsqueda BOSS se cerró en 2016), y el plugin no necesita cuenta de Yahoo: envía q con tu clave de ScrapeUnblocker y recibe los resultados de imágenes parseados. Como la estructura replica /images/google-search y /images/bing-search, el código escrito para cualquiera de los dos lee las imágenes de Yahoo cambiando solo la ruta.

¿Puedo hacer scraping de imágenes de Yahoo desde un país concreto?

Sí. Pasa proxy_country con un código de país de dos letras (por defecto US). Elige el sitio regional de imágenes de Yahoo, por ejemplo de.images.search.yahoo.com para DE o uk.images.search.yahoo.com para GB, y el exit a través del que se renderiza la página, así que obtienes los resultados de imágenes que ve quien busca desde ese país; un país sin sitio regional usa images.search.yahoo.com.

¿Cuánto cuesta hacer scraping de la búsqueda de imágenes de Yahoo?

Cada página de resultados obtenida se factura como una petición: una llamada con pages=3 que obtiene tres páginas de unas 60 imágenes cuenta como 3 peticiones, y pagesFetched muestra el número exacto. 1 petición = 1 crédito, 1,00 EUR por cada 1.000 en Pay as you go, bajando hasta unos 0,55 EUR por cada 1.000 en el plan Ultimate. No se facturan los bloqueos ni los timeouts, y la prueba gratuita incluye 500 peticiones sin tarjeta.

Scrapers relacionados

Empieza a rastrear este sitio hoy

Plan gratuito incluido. No necesitas tarjeta para probarlo.