API Haga clic en este botón APIpara ver una documentación del parámetro POST request para inicios de crawl.

Expert Crawl Start

Comiencen a trabajar en el Crawling:  Puede definir URLs como puntos de inicio para el crawl web e iniciar el crawl aquí. "Crawling" significa que YaCy descargará el sitio web dado, extraerá todos los enlaces en él y luego descargará el contenido detrás de estos enlaces. Esto se repite siempre y cuando se especifique en "Profundidad de calado". A crawl can also be started using wget and the post arguments for this web page.

Trabajo de crawl

Un trabajo de Crawl consiste en uno o más puntos de inicio, limitaciones de crawl y reglas de frescura de documentos.

Punto de inicio
Una URL de inicio o una lista de URL:
(debe comenzar con http:// https:// ftp:// smb:// file://)
infoDefinir el inicio-url(s) aquí. Puede enviar más de un URL, cada línea URL por favor. Cada uno de estos URLsson la raíz para un inicio de crawl, inicio existente URLssiempre se vuelven a cargar. Otros URLsya visitados se clasifican como "doble", si no se les permite usar la opción de re-crawl.  
vacío
De la lista de enlaces de URL

Desde el mapa
Desde Archivo (introduzca una ruta
dentro de su sistema de archivos local)
Atributos del índice
info Un resultado de crawl se puede etiquetar con nombres que son candidatos para una solicitud de recogida. These tags can be selected with the GSA interface using the 'site' operator. To use this option, the 'collection_sxt'-field must be switched on in the Solr Schema
No utilice el subrayado '_' en el nombre de la colección, use '-' en su lugar. Cuando sea útil, agregue un código de idioma al nombre de la colección, por ejemplo 'top-100-en'.
info La zona horaria es necesaria cuando el parser detecta una fecha en la página web crawleada. El contenido puede buscarse con el modificador on:, que también requiere una zona horaria cuando se realiza una consulta. Para normalizar todas las fechas indicadas, la fecha se guarda en la zona horaria UTC. Para obtener el desfase correcto para fechas sin zona horaria a UTC, este desfase debe indicarse aquí. El desfase se expresa en minutos; Los desfases de la zona horaria para los lugares al este de UTC deben ser negativos; los desfases para las zonas al oeste de UTC deben ser positivos.
Filtro de crawler

Estas son limitaciones en el apilador de crawl. Los filtros se aplicarán antes de que se cargue una página web.

Indización
info Esto permite la indexación de las páginas web que el crawler descargará. Esto debe ser activado por defecto, a menos que desee crawler sólo para llenar el cache del documento sin indexar. :     :
info Si se marca, el crawler contactará con otros pares y los usará como indexadores remotos para su crawl. Si necesita localmente los resultados de su crawl, debe desactivar esta opción. Solo los pares senior y principal pueden iniciar o recibir crawls remotos. Un mensaje YaCyNews será creado para informar a todos los pares sobre un crawl global, para que puedan omitir el inicio de un crawl con el mismo punto de partida.
:

Este mensaje aparecerá en la tabla 'Other Peer Crawl Start' de otros pares.
Profundidad de calado
info Esto define con qué frecuencia el Crawler seguirá enlaces (de enlaces..) incrustados en sitios web. 0significa que sólo se añadirá la página que introduzca bajo "Punto de inicio" al índice.2-4es bueno para la indexación normal. Los valores sobre8no son útiles, ya que un crawl de profundidad-8 índice aproximadamente25.600.000.000páginas, tal vez esto es todo el WWW.     también todos los documentos vinculados no analizables
Profundidad de crawl ilimitada para URLs que coincidan con
Páginas máximas por dominio
info Puede limitar el número máximo de páginas que se obtienen e indexan desde un solo dominio con esta opción. Puede combinar esta limitación con el 'Auto-Dom-Filter', para que el límite se aplique a todos los dominios dentro de la profundidad dada. Los dominios fuera de la profundidad dada se ordenan de todos modos. :    :
info A questionmark is usually a hint for a dynamic page. URLs pointing to dynamic content should usually not be crawled. Sin embargo, a veces hay páginas web con contenido estático que is accessed with URLs containing question marks. If you are unsure, do not check this to avoid crawl loops. Los siguientes fotogramas NO son hechos por Gxxg1e, pero por defecto lo hacemos para tener un contenido más rico. "nofollow" en robots metadatos se puede anular; esto no afecta a la obediencia de larobots.txtque nunca se ignora. Aceptar URLscon la parte de consulta ('?'):
Obedecer html-robots-noindex:
Obedecer html-robots-nofollow:
Detección de tipo de medio
Información de verificación del tipo de medios No cargar URLs con extensión de archivo no admitida es más rápido, pero menos preciso. De hecho, en algunos recursos web el tipo de medio real no coincide con la extensión de archivo de la URL. Estos son algunos ejemplos:
Load Filtro en URLs
info The filter is a regular expression. Ejemplo: para permitir solamente urls que contengan la palabra 'ciencia', establezca el filtro de necesidad en '.*ciencia.*'. También puede utilizar una restricción automática de dominio para crawler completamente un único dominio. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
must-match
Restricción para iniciar dominio(s)
Restricción a sub-ruta(s)
Usar filtro (No debe estar vacío)
must-no-match
Filtro de carga en origen URL de enlaces
info The filter is a regular expression. Ejemplo: para permitir cargar sólo enlaces de páginas en el dominio example.org, establezca el filtro que debe coincidir con '.*example.org.*'. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
must-match (No debe estar vacío)
must-no-match
Filtro de carga en IPs
must-match (No debe estar vacío)
must-no-match
info Los crawls se pueden restringir a países específicos. Esto utiliza el código del país que se puede calcular a partir de la IP del servidor que aloja la página. El filtro no es una expresión regular sino una lista de códigos de país, separados por comas. ninguna restricción del código del país
Usar filtro  
Filtro de documento

Estas son limitaciones en el alimentador de índices. Los filtros se aplicarán después de que se haya cargado una página web.

Filtro en URLs
info The filter is a regular expression queno debe coincidir concon el URLspara permitir que el contenido de la url se indice. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
must-match (No debe estar vacío)
must-no-match
No Indización when Canonical present and Canonical != URL
Filtrar en el contenido del documento
(todo texto visible, incluyendo url tokenizada con caja de camello y título)
must-match (No debe estar vacío)
must-no-match
Filtro en el tipo de medio de documento (alias tipo MIME)
Información del filtro de Tipo de Medios The filter is a regular expression quedebe coincidir concon el tipo de medio de documento (también conocido como tipo MIME) para permitir que el URLsea indexado. Standard Media Types are described at the IANA registry. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
must-match
must-no-match
Solr query filter on any active indexed field(s)
 Información del filtro de consulta Solr Cada documento analizado se comprueba con la consulta Solr dada antes de ser añadido al índice. The query must be written in respect to the standard Solr query syntax.
must-match
must-no-match
Filtro de contenido

Estas son limitaciones en partes de un documento. El filtro se aplicará después de que se haya cargado una página web. Puede elegir:

Evaluar por defecto
Uso all words in document by default until a CSS class as listed below appears; then ignore all
Ignorar por defecto
Ignorar todas las palabras en el documento por defecto hasta que aparezca una clase CSS como se indica a continuación, a continuación, evaluar todos
Filtrar nombres de clases div o nav
lista separada por comas de nombres de clase de elementos<div>o<nav>que deben ser filtrados/insegún el cambio anterior.
Limpiar antes de que comiencen los crawl
Limpiar la cache de eventos de búsqueda info Marque esta opción para asegurarse de obtener resultados de búsqueda frescos, incluyendo documentos recién rastreados. Tenga cuidado de que también interrumpirá cualquier refrescante/resortingde resultados de búsqueda actualmente solicitados desde el lado del navegador.
Sin supresión
info Después de que se hizo un crawl en el pasado, el documento puede volverse rancio y eventualmente también se eliminan en el host de destino. Para eliminar los archivos antiguos del índice de búsqueda no es suficiente considerarlos sólo para volver a cargar, pero puede ser necesario para eliminarlos porque simplemente ya no existen. Utilice esto en combinación con un nuevo crawl mientras que este tiempo debe ser más largo. No borre ningún documento antes de iniciar el crawl.
Suprímase el subcamino
Para cada host en la lista de url de inicio, elimine todos los documentos (en el subpath dado) de ese host.
Borrar sólo antiguo
Tratar los documentos que están cargados hace como rancio y eliminarlos antes de que se inicie el crawl.
Reglas de doble comprobación
No hay dobles 
info Un crawl web realiza una doble verificación en todos los enlaces encontrados en Internet contra la base de datos interna. Si la misma url se encuentra de nuevo, entonces la url se trata como doble cuando se comprueba la opción 'no dobles'. Una url puede ser cargada de nuevo cuando ha alcanzado una edad específica, para usar la opción 'recargar'. Nunca cargue ninguna página que ya se conozca. Sólo se puede volver a cargar la start-url.
Recargar
Tratar los documentos que están cargados ago as stale and load them again. If they are younger, they are ignored.
cache del documento
info Esta opción se utiliza por defecto para prefetch proxy, pero no es necesario para el crawl explícito.
info La política de almacenamiento en cache indica cuándo usar la cache durante el crawl: no hay cache : never use the cache, all content from fresh internet source; si fresco: use the cache if the cache exists and is fresh using the proxy-fresh rules; si existe: use the cache if the cache exist. Do no check freshness. Otherwise use online source; cache solamente: never go online, use all content from cache. If no cache exist, treat content as unavailable no hay cache     si fresco    si existe    cache solamente
Comportamiento del robot
info Debido a que YaCy e puede utilizar como reemplazo de los aparatos de búsqueda comercial (como el Google Search Appliance aka GSA) el usuario debe ser capaz de crawler todas las páginas web que se conceden a dichas plataformas comerciales. No tener esta opción sería una gran desventaja para el uso profesional de este software. Por lo tanto, usted es capaz de seleccionar agentes usuarios alternativos aquí que tienen diferentes tiempos de crawl y también se identifican con otro agente de usuario y obedecen la regla de robots correspondiente.