Crawl da web

Rastrear um site. Você pode rastrear sites públicos e sites que exigem autenticação.

IBM Cloud Pak for Data IBM Software Hub

Essas informações se aplicam apenas a implementações instaladas. Para obter mais informações sobre o rastreamento de um site a partir de uma implantação gerenciada, consulte Rastreamento da Web.

Quais documentos são rastreados

  • O conteúdo do site é processado como arquivos HTML.
  • O crawler da web não executa crawl de websites dinâmicos que usam JavaScript para renderizar o conteúdo. É possível confirmar o uso de JavaScript visualizando o código-fonte do website em seu navegador.
  • Quando uma fonte é rastreada novamente, novos documentos são adicionados, documentos atualizados são modificados para a versão atual e documentos excluídos são excluídos do índice da coleção durante a atualização.
  • Todos os Discovery conectores de fonte de dados são somente leitura. Independentemente das permissões concedidas à conta de rastreamento, Discovery nunca grava, atualiza ou exclui qualquer conteúdo na fonte de dados original.

Etapa de pré-requisito

Se quiser se conectar a um site que requer autenticação, você precisará conhecer as credenciais de autenticação necessárias para acessar o site.

  • Para um site que requer autenticação básica, obtenha as seguintes informações:

    Nome do usuário
    O nome de usuário de um usuário com acesso ao conteúdo ao qual você deseja se conectar no site.
    Senha
    A senha que está associada ao nome de usuário.
  • Para um site que requer autenticação do Windows NT LAN Manager (NTLM), obtenha as seguintes informações:

    Nome do usuário
    O nome de usuário de um usuário com acesso ao conteúdo ao qual você deseja se conectar no site.
    Senha
    A senha que está associada ao nome de usuário.
    Nome de domínio NTLM
    O nome de domínio NTLM do usuário que está se autenticando no site.
    Nome do host NTLM
    O nome do host do servidor NTLM.
  • Para um site que requer autenticação baseada em formulário, escolha como deseja acessar o site entre as seguintes opções:

    • Acesso direto: Envia o formulário sem obter a página de login.

      Ação de formulário URL
      O endereço URL para o qual enviar os dados do formulário quando o formulário for enviado. Por exemplo, /action_page.php.
      Campos obrigatórios
      Descubra os valores de campo que devem ser fornecidos no formulário.
    • Acesso indireto: Obtém a página de login e preenche os campos do formulário. Anote as informações a seguir para que você possa fornecê-las posteriormente:

      Login de formulário URL
      URL da página de login do site.
      Nome do formulário
      Nome do formulário de login.
      Campos obrigatórios
      Descubra os valores de campo que devem ser fornecidos no formulário de login.

Conexão a uma fonte de dados de rastreamento da Web

Se você quiser rastrear um grupo de URLs que inclua alguns sites que exigem autenticação e outros que não exigem, considere a possibilidade de criar uma coleção diferente para cada tipo de autenticação.

Em seu projeto Discovery, conclua as seguintes etapas:

  1. No painel de navegação, escolha Gerenciar coleções.

  2. Clique em New collection (Nova coleção ).

  3. Clique em Web crawl e, em seguida, clique em Next.

  4. Dê um nome à coleção.

  5. Se o idioma do site não for o inglês, selecione o idioma apropriado.

    Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.

  6. Opcional: Alterar o cronograma de sincronização.

    A fonte de dados de rastreamento da Web foi projetada para ser usada com sites que mudam apenas uma ou duas vezes por semana. Para garantir que sua coleta capture todas as atualizações do site, programe o rastreamento para ocorrer semanalmente.

    Para obter mais informações, consulte Opções de agendamento de rastreamento.

  7. Na seção Specify where you want to crawl (Especifique onde deseja rastrear ), adicione o site URL ao campo Starting URLs (URLs iniciais ) e clique em Add (Adicionar ). Continue adicionando URLs iniciais.

    Os URLs onde o rastreador começa a rastrear. Por padrão, o rastreamento da Web pode rastrear subárvores, e os URLs podem ser rastreados somente a partir do caminho fornecido na semente. Use a URL completa, por exemplo, http://www.example.com/. A URL inicial no crawl da web tem duas limitações quanto ao que é submetido a crawl:

    • Efetua crawl do mesmo nome de domínio que a URL inicial.
    • Efetua crawl de todo o conteúdo da URL até e incluindo a última barra (/) em URLs de início. Se a URL de início tiver uma subárvore, o crawl da web não efetuará crawl dessa subárvore, a menos que você especifique a URL em URLs de início.
  8. Se o endereço URL começar com HTTPS: Na seção Advanced Configuration (Configuração avançada ), defina o seletor Ignore certificate (Ignorar certificado) como On (Ligado ) para ignorar qualquer certificado SSL no site de destino.

  9. Opcional: Clique em Configurações de autenticação para especificar o tipo de autenticação a ser aplicado a um ou mais URLs iniciais:

    • Escolha a página inicial URL.

    • Escolha o tipo de autenticação entre as seguintes opções:

      • Autenticação básica
      • Autenticação NTLM
      • Autenticação de formulário
    • Para Autenticação básica, forneça os seguintes detalhes:

      Nome do usuário
      O nome de usuário de um usuário com acesso ao conteúdo ao qual você deseja se conectar no site.
      Senha
      A senha que é associada ao usuário.
    • Para autenticação NTLM, forneça os seguintes detalhes:

      Nome do usuário
      O nome de usuário de um usuário com acesso ao conteúdo ao qual você deseja se conectar no site.
      Senha
      A senha que é associada ao usuário.
      Nome de domínio NTLM
      O nome de domínio NTLM que pertence ao usuário que está autenticando.
      Nome do host NTLM
      O nome do host do servidor NTLM.
    • Para Autenticação de formulário, forneça os seguintes detalhes:

      • Em Tipo de formulário, selecione uma das opções a seguir:

        direto
        Clique nessa opção se você não quiser buscar a página de login.
        Indireto
        Clique nessa opção se quiser buscar a página de login e preencher os parâmetros no formulário de login.
      • Preencha os campos a seguir se você escolher Direct:

        URL da ação do formulário
        A ação do formulário URL que é necessária para enviar o formulário.
        Método de formulário
        Especifique GET.
      • Preencha os seguintes campos se você escolher Indireto:

        URL de login do formulário
        Esse campo é obrigatório se você selecionar o tipo de formulário Indireto.
        Nome do formulário
        Esse campo é obrigatório se você selecionar o tipo de formulário Indireto.
        Método de formulário
        Especifique POST.
      • Na seção Form parameters (Parâmetros do formulário ), liste os pares de valores-chave dos parâmetros do formulário.

        Preencha os campos Key (Chave ) e Value (Valor ) e, em seguida, clique em + para adicionar um ou mais parâmetros de formulário.

  10. Opcional: se estiver usando um servidor proxy para acessar o servidor da fonte de dados, na seção Configurações de proxy, defina a chave Habilitar configurações de proxy como On. Adicione valores aos seguintes campos:

    Nome do usuário
    O nome de usuário do servidor proxy a ser usado para autenticar com o servidor proxy, se o servidor proxy exigir autenticação.
    Senha
    A senha do servidor proxy a ser usada para autenticação com o servidor proxy, se o servidor proxy exigir autenticação.
    Domínios do servidor proxy
    O domínio ou domínios em que os hosts residem. É possível especificar um curinga nesse campo, como um asterisco (*) para executar crawl de todos os domínios ou um asterisco inicial (*.server1.bar.com) para executar crawl de domínios que correspondam a um padrão.
    Nome do host ou endereço IP do servidor proxy
    O nome do host, caso queira acessar o servidor usando uma LAN, ou o endereço IP do servidor que deseja usar como servidor proxy.
    Número da porta do servidor proxy
    A porta de rede à qual você deseja se conectar no servidor proxy.
  11. Opcional: Preencha os seguintes campos em Advanced Configuration:

    Página de código a ser usada

    Especifique a codificação de caracteres das páginas do site. Se não for especificado, será usado o valor padrão de UTF-8.

    Se estiver rastreando sites chineses, especifique UTF-8.

    URL Profundidade do caminho

    O nível dos caminhos do site a serem rastreados.

    Por exemplo, se você especificar o URL inicial de https://www.example.com e uma profundidade de caminho de 4, o rastreador acessará a página https://www.example.com/some/more/examples/index.html, que está localizada em um caminho que está a quatro níveis de distância da raiz URL.

    Você pode inserir apenas um valor positivo. Se não for especificado, o valor padrão será 5. A profundidade máxima do caminho permitida é 20.

    Máximo de saltos

    O número de links consecutivos a serem seguidos desde o início URL.

    Se não for especificado, o valor padrão será 5. O número máximo de links que o rastreador pode seguir é 20. Para não permitir nenhum salto, digite 0.

    Ignorar robots.txt

    Ative essa configuração se quiser que o rastreador ignore as regras de permissão e negação definidas pelo site em seu arquivo robots.txt.

    Lembre-se de que os sites normalmente usam o arquivo para melhorar os resultados de rastreamento. Por exemplo, eles podem usar o arquivo robots.txt para evitar que informações duplicadas sejam rastreadas, para evitar que o conteúdo de rascunho seja lido ou para atrasar o rastreamento de modo a não sobrecarregar o site.

    Regras para rastrear o domínio

    Especifique os nomes de domínio que você deseja permitir ou proibir que o rastreador rastreie.

    Os nomes de domínio diferenciam maiúsculas de minúsculas e o caractere curinga (*) pode ocorrer em qualquer lugar do nome de domínio.

    A ordem das regras é significativa. O rastreador aplica a primeira regra que corresponde a um candidato URL. A regra padrão, proibir domínio *, proíbe todo rastreamento na Web e deve ocorrer por último na lista de regras de domínio.

    Você pode definir os seguintes tipos de regras, por exemplo:

    • Para excluir todo o domínio ibm.com:

      forbid domain www.ibm.com
      
    • Para rastrear qualquer domínio que termine com ibm.com:

      allow domain *.ibm.com
      
    • Para rastrear somente a porta 443 em domínios IBM que começam com server:

      allow domain server*.ibm.com:443
      
    Regras para rastrear os prefixos de URL

    Especifique os prefixos HTTP e HTTPS que você deseja permitir ou proibir que o rastreador rastreie.

    O caractere curinga (*) pode ocorrer uma ou mais vezes no site URL.

    A ordem das regras é significativa. O rastreador aplica a primeira regra que corresponde a um candidato URL.

    Você pode definir os seguintes tipos de regras, por exemplo:

    • Para rastrear páginas no diretório público desse domínio:

      allow prefix http://*.ibm.com/public/*
      
    • Para excluir todos os outros diretórios desse domínio:

      forbid prefix http://*.ibm.com/*
      
    Propriedades avançadas do rastreador

    Use somente quando instruído a fazê-lo pelo IBM.

  12. Opcional: se você quiser ignorar qualquer certificado SSL no site de destino, defina a opção Ignorar certificado como On.

    Essa opção se aplica somente a URLs HTTPS.

  13. Se quiser que o rastreador extraia texto de imagens no site, expanda Mais configurações de processamento e defina Aplicar reconhecimento óptico de caracteres (OCR) como On.

    Quando o OCR está ativado e seus documentos contêm imagens, o processamento demora mais. Para obter mais informações, consulte Reconhecimento óptico de caracteres.

  14. Clique em Finish.

A coleção é criada rapidamente. Leva mais tempo para os dados serem processados à medida que são adicionados à coleção.

Se quiser verificar o progresso, vá para a página Activity (Atividade). No painel de navegação, clique em Gerenciar coleções e, em seguida, clique para abrir a coleção.