Rastreo web
Rastrear un sitio web. Puede rastrear sitios web públicos y sitios web que requieran autenticación.
IBM Cloud Pak for Data IBM Software Hub
Esta información sólo se aplica a las implantaciones instaladas. Para obtener más información sobre el rastreo de un sitio web desde un despliegue gestionado, consulte Rastreo web.
Qué documentos se rastrean
- El contenido del sitio web se procesa como archivos HTML.
- El rastreador web no rastrea sitios web dinámicos que utilizan JavaScript para representar contenido. Puede confirmar el uso de JavaScript visualizando el código fuente del sitio web en el navegador.
- Cuando se vuelve a rastrear una fuente, se añaden nuevos documentos, se modifican los documentos actualizados a la versión actual y se eliminan los documentos eliminados del índice de la colección durante la actualización.
- Todos los conectores de fuentes de datos Discovery son de sólo lectura. Independientemente de los permisos que se concedan a la cuenta de rastreo, Discovery nunca escribe, actualiza ni elimina ningún contenido en la fuente de datos original.
Paso previo
Si desea conectarse a un sitio web que requiere autenticación, debe conocer las credenciales de autenticación necesarias para acceder al sitio.
-
Para un sitio web que requiere autenticación básica, obtenga la siguiente información:
- Nombre de usuario
- El nombre de usuario de un usuario con acceso al contenido al que desea conectarse en el sitio web.
- Contraseña
- La contraseña que está asociada con el nombre de usuario.
-
Para un sitio web que requiera autenticación Windows NT LAN Manager (NTLM), obtenga la siguiente información:
- Nombre de usuario
- El nombre de usuario de un usuario con acceso al contenido al que desea conectarse en el sitio web.
- Contraseña
- La contraseña que está asociada con el nombre de usuario.
- Nombre de dominio NTLM
- El nombre de dominio NTLM del usuario que se está autenticando con el sitio.
- Nombre de host NTLM
- El nombre de host del servidor NTLM.
-
Para un sitio web que requiere autenticación basada en formularios, elija cómo desea acceder al sitio entre las siguientes opciones:
-
Acceso directo: Envía el formulario sin obtener la página de acceso.
- Formulario de acción URL
- URL, a la que se enviarán los datos del formulario cuando este se envíe. Por ejemplo,
/action_page.php. - Campos obligatorios
- Averigüe los valores de los campos que deben proporcionarse en el formulario.
-
Acceso indirecto: Obtiene la página de acceso y rellena los campos del formulario. Anote la siguiente información para poder facilitarla más adelante:
- Formulario de inicio de sesión URL
- URL de la página de inicio de sesión del sitio web.
- Nombre del formulario
- Nombre del formulario de inicio de sesión.
- Campos obligatorios
- Averigüe los valores de campo que deben proporcionarse en el formulario de inicio de sesión.
-
Conexión a una fuente de datos de rastreo web
Si desea rastrear un grupo de URL que incluye algunos sitios web que requieren autenticación y otros que no, considere la posibilidad de crear una colección diferente para cada tipo de autenticación.
Desde tu proyecto Discovery, completa los siguientes pasos:
-
En el panel de navegación, seleccione Gestionar colecciones.
-
Haga clic en Nueva colección.
-
Haga clic en Rastreo web y, a continuación, en Siguiente.
-
Nombre de la colección.
-
Si el idioma del sitio web no es el inglés, seleccione el idioma apropiado.
Para ver una lista de los idiomas admitidos, consulte Soporte de idiomas.
-
Opcional: Cambia el horario de sincronización.
La fuente de datos de rastreo web está diseñada para utilizarse con sitios web que cambian sólo una o dos veces por semana. Para asegurarse de que su recopilación captura todas las actualizaciones del sitio web, programe el rastreo para que se produzca semanalmente.
Para obtener más información, consulte Opciones de programación de rastreo.
-
En la sección Especifique dónde desea rastrear, agregue el sitio web URL al campo URL de inicio y, a continuación, haga clic en Agregar. Siga añadiendo URL de inicio.
Las URL donde el rastreador comienza a rastrear. De forma predeterminada, el rastreo web puede rastrear subárboles, y las URL pueden rastrearse solo desde la ruta que se proporciona en la semilla. Utilice el URL completo, por ejemplo,
http://www.example.com/. El URL de inicio en el rastreo web tiene dos limitaciones en cuanto a lo que se rastrea:- Rastrea el mismo nombre de dominio que el URL de inicio.
- Rastrea todo el contenido de URL hasta la última barra inclinada (
/) inclusive en URL de inicio. Si el URL de inicio tiene un subárbol, el rastreo de web no rastrea dicho subárbol, a menos que especifique su URL en URL de inicio.
-
Si el navegador ( URL ) comienza con HTTPS: En la sección Configuración avanzada, establezca el conmutador Ignorar certificado en Activado para ignorar cualquier certificado SSL en el sitio web de destino.
-
Opcional: Haga clic en Configuración de autenticación para especificar el tipo de autenticación que se aplicará a una o varias de las URL de inicio:
-
Elija el e URL o inicial.
-
Elija el tipo de autenticación entre las siguientes opciones:
- Autenticación básica
- Autenticación NTLM
- Autenticación de formulario
-
Para Autenticación básica, proporcione los siguientes detalles:
- Nombre de usuario
- El nombre de usuario de un usuario con acceso al contenido al que desea conectarse en el sitio web.
- Contraseña
- La contraseña asociada al usuario.
-
Para Autenticación NTLM, proporcione los siguientes detalles:
- Nombre de usuario
- El nombre de usuario de un usuario con acceso al contenido al que desea conectarse en el sitio web.
- Contraseña
- La contraseña asociada al usuario.
- Nombre de dominio NTLM
- El nombre de dominio NTLM que pertenece al usuario que se está autenticando.
- Nombre de host NTLM
- El nombre de host del servidor NTLM.
-
Para Formulario de autenticación, proporcione los siguientes detalles:
-
En Tipo de formulario, seleccione una de las siguientes opciones:
- Directo
- Haga clic en esta opción si no desea ir a la página de inicio de sesión.
- Indirectas
- Haga clic en esta opción si desea ir a la página de inicio de sesión y rellenar los parámetros del formulario de inicio de sesión.
-
Rellene los siguientes campos si elige Directo:
- Url de acción del formulario
- La acción del formulario URL que se requiere para enviar el formulario.
- Método de formulario
- Especifique GET.
-
Rellene los siguientes campos si elige Indirecto:
- Url de acceso al formulario
- Este campo es obligatorio si selecciona el tipo de formulario Indirecto.
- Nombre del formulario
- Este campo es obligatorio si selecciona el tipo de formulario Indirecto.
- Método de formulario
- Especifique POST.
-
En la sección Parámetros del formulario, lista de pares clave-valor de los parámetros del formulario.
Rellene los campos Clave y Valor y, a continuación, haga clic en + para añadir uno o más parámetros de formulario.
-
-
-
Opcional: Si utiliza un servidor proxy para acceder al servidor de origen de datos, en la sección Configuración proxy, active el interruptor Activar configuración proxy en
On. Añada valores a los siguientes campos:- Nombre de usuario
- El nombre de usuario del servidor proxy que se utilizará para autenticarse con el servidor proxy si éste requiere autenticación.
- Contraseña
- La contraseña del servidor proxy que se utilizará para autenticarse con el servidor proxy si éste requiere autenticación.
- Dominios del servidor proxy
- El dominio o dominios en los que residen los hosts. Puede especificar un carácter comodín en este campo, como por ejemplo un asterisco (
*), para rastrear todos los dominios o un asterisco inicial (*.server1.bar.com) para rastrear los dominios que se ajustan a un patrón. - Nombre de host o dirección IP del servidor proxy
- El nombre de host si desea acceder al servidor mediante una LAN, o la dirección IP del servidor que desea utilizar como servidor proxy.
- Número de puerto del servidor proxy
- El puerto de red al que desea conectarse en el servidor proxy.
-
Opcional: Complete los siguientes campos en Configuración avanzada:
- Página de códigos a utilizar
-
Especifique la codificación de caracteres de las páginas del sitio web. Si no se especifica, se utiliza el valor predeterminado de
UTF-8.Si rastrea sitios web chinos, especifique
UTF-8. - URL Profundidad de ruta
-
El nivel de rutas del sitio a rastrear.
Por ejemplo, si especifica la URL inicial de
https://www.example.comy una profundidad de ruta de4, el rastreador accederá a la páginahttps://www.example.com/some/more/examples/index.html, que se encuentra en una ruta que está a cuatro niveles de distancia de la raíz URL.Sólo puede introducir un valor positivo. Si no se especifica, el valor predeterminado es
5. La profundidad máxima de ruta permitida es20. - Salto máximo
-
El número de enlaces consecutivos a seguir desde el inicio URL.
Si no se especifica, el valor predeterminado es
5. El número máximo de enlaces que puede seguir el crawler es20. Para no permitir ningún salto, introduzca0. - Ignorar robots.txt
-
Active esta opción si desea que el rastreador ignore las reglas de permiso y denegación que el sitio web indica en su archivo robots.txt.
Tenga en cuenta que los sitios suelen utilizar el archivo para mejorar los resultados del rastreo. Por ejemplo, podrían utilizar el archivo robots.txt para evitar que se rastree información duplicada, que se lean borradores de contenido o retrasar el rastreo para no sobrecargar su sitio.
- Reglas para rastrear el dominio
-
Especifique los nombres de dominio que desea permitir o prohibir al rastreador.
Los nombres de dominio distinguen entre mayúsculas y minúsculas y el carácter comodín (*) puede aparecer en cualquier lugar del nombre de dominio.
El orden de las normas es significativo. El rastreador aplica la primera regla que coincide con un candidato URL. La regla por defecto, prohibir dominio *, prohíbe todo rastreo web y debe aparecer la última en la lista de reglas de dominio.
Puede definir, por ejemplo, los siguientes tipos de reglas:
-
Para excluir todo el dominio ibm.com:
forbid domain www.ibm.com -
Para rastrear cualquier dominio que termine en
ibm.com:allow domain *.ibm.com -
Para rastrear sólo el puerto
443en IBM dominios que empiecen porserver:allow domain server*.ibm.com:443
-
- Reglas para rastrear prefijos URL
-
Especifique los prefijos HTTP y HTTPS que desea permitir o prohibir al rastreador.
El carácter comodín (*) puede aparecer una o más veces en el URL.
El orden de las normas es significativo. El rastreador aplica la primera regla que coincide con un candidato URL.
Puede definir, por ejemplo, los siguientes tipos de reglas:
-
Para rastrear las páginas del directorio público de este dominio:
allow prefix http://*.ibm.com/public/* -
Para excluir todos los demás directorios de este dominio:
forbid prefix http://*.ibm.com/*
-
- Propiedades avanzadas del rastreador
-
Utilícelo únicamente cuando así se lo indique el IBM.
-
Opcional: si desea ignorar cualquier certificado SSL en el sitio web de destino, establezca el interruptor Ignorar certificado en
On.Esta opción solo se aplica a las URL HTTPS.
-
Si desea que el rastreador extraiga texto de las imágenes del sitio, amplíe Más opciones de procesamiento, y establezca Aplicar reconocimiento óptico de caracteres (OCR) en
On.Cuando el OCR está activado y sus documentos contienen imágenes, el procesamiento tarda más tiempo. Para obtener más información, consulte Reconocimiento óptico de caracteres.
-
Pulse Finalizar.
La colección se crea rápidamente. Los datos tardan más tiempo en procesarse a medida que se añaden a la colección.
Si desea comprobar el progreso, vaya a la página Actividad. En el panel de navegación, haga clic en Gestionar colecciones y, a continuación, haga clic en para abrir la colección.