Sitio Crawling

Rastreador de sitios:  Descargue todas las páginas web de un dominio dado o base URL.

Sitio Crawl Comienzo
Comienzo URL (must start with
http:// https:// ftp:// smb:// file://)

vacío
Lista de enlaces de URL
Sitemap URL

cargar todos los archivos en el dominio
cargar sólo archivos en un sub-path de url dado
no más de documentos

Consejos

  • Limitación de la velocidad de los crawl

    No más de cuatro páginas se cargan desde el mismo host en un segundo (no más que el documento120por minuto) para limitar la carga en el servidor de destino.
  • Balanceador de objetivos

    Un segundo crawl para un host diferente aumenta el rendimiento a un máximo de documentos240por minuto ya que el crawler equilibra la carga sobre todos los hosts.
  • crawl de alta velocidad

    Un 'regateo de baratijas' que no se limita a un solo host (o sitio) puede extender la tasa de páginas por minuto (ppm) a documentos ilimitados por minuto cuando el número de hosts de destino es alto. This can be done using the Expert Crawl Comienzo servlet.
  • Dirección del planificador

    The scheduler on crawls can be changed or removed using Automation.