Crawl da web

Inclua uma coleção de web crawl para engatinhar um website, analisar seu conteúdo de página e armazenar informações significativas. Especifique uma ou mais URLs de páginas web base e configure quantas páginas vinculadas para o web crawl a seguir. Você pode configurar com que frequência se sincroniza com o website, assim você controla como até hoje os dados em sua coleção são.

Antes de criar uma coleção de rastreamento da Web, entre em contato com o proprietário do site para obter permissões para rastrear o site. Atualmente, a implantação gerenciada de Discovery não pode rastrear https://www.ibm.com.

IBM Cloud IBM Cloud somente

Essas informações se aplicam apenas a implementações gerenciadas. Para obter mais informações sobre conexão com um website a partir de uma implementação instalada, consulte Web crawl.

Quais documentos estão engatinados

Você pode se conectar com os seguintes tipos de conteúdo web:

  • Websites públicos
  • Sites da empresa privada ou outros sites que requerem autenticação
  • Sites que estão por trás de um firewall corporativo

Durante o crawl inicial do conteúdo, todas as páginas do website que combinam com suas configurações de pesquisa são engatinadas e adicionadas ao índice de documentos de sua coleção. O crawl é iniciado na página da web especificada no campo URLs de Início. Se sua coleção estiver configurada para seguir links, o crawl segue links na página inicial que compartilham a mesma subárvore que a página inicial. Por exemplo, se você especificar https://www.example.com/banking/faqs.html, links com URLs que começam com https://www.example.com/banking/ serão submetidos a crawl. Se você especificar https://www.example.com/banking, links com URLs que começam com https://www.example.com/ serão submetidos a crawl.

O crawl não pode acessar os subdiretórios seguros Por exemplo, se um subdiretório que você espera que o rastreamento acesse, como https://www.example.com/banking/pdfs, não estiver sendo rastreado, verifique se é possível acessar o subdiretório URL diretamente de um navegador da Web. Se você não puder acessá-lo, o crawl não poderá acessá-lo,

Durante os recraques programados subsequentes, um recrawl completo é realizado e quaisquer alterações são refletidas em sua coleção. Os documentos que foram adicionados à sua coleção a partir de páginas do website que são posteriormente excluídos do website externo não são excluídos da coleção. No entanto, a partir das coleções criadas após abril de 2022, quando você remove um URL inicial da configuração de rastreamento da Web, todos os documentos associados são excluídos. Os documentos excluídos incluem documentos indexados que foram adicionados à coleção com base no conteúdo da página da Web no endereço inicial URL e documentos derivados de páginas da Web para as quais o endereço inicial URL foi vinculado. Não é possível limitar o número de documentos indexados alterando outras configurações, como alterar o site URL existente para incluir um caminho com um escopo mais limitado do que antes ou reduzir o número máximo de links a serem seguidos para 0. Somente com a exclusão do site URL é possível remover os documentos indexados que estão associados a ele.

O web crawler pode engatinhar páginas da web que usam JavaScript para renderizar conteúdo, mas o crawler funciona melhor em páginas individuais, nem sites inteiros. Ele não pode engatinhar sites que usam URLs; dinâmicos se você não pode ver nenhum conteúdo ao visualizar o código-fonte de uma página web em seu navegador, então o serviço não pode engatinhar.

Se você quiser rastrear um grupo de URLs que inclua alguns sites que exigem autenticação e outros que não exigem, considere a possibilidade de criar uma coleção diferente para cada tipo de autenticação. O conector não suporta crawling baseado em cookie.

Todos os conectores de origem de dados Discovery são de leitura. Independentemente das permissões que são concedidas à conta de crawl, Discovery nunca grava, atualiza ou exclui qualquer conteúdo na origem de dados original.

A tabela a seguir ilustra os objetos que Discovery podem engatinhar.

Suporte para rastreamento de fontes de dados
Objetos que são rastejados
Websites, subdiretórios do website

Etapa de pré-requisito para se conectar a um site hospedado em um firewall

Se quiser se conectar a um site hospedado atrás de um firewall, configure primeiro o conector IBM Cloud Satellite® fora do Discovery. Para obter mais informações, consulte a Satellite Visão geral do conector.

IBM® Secure Gateway for IBM Cloud® está sendo descontinuado. As coleções existentes que usam o Secure Gateway podem migrar para o conector IBM Cloud Satellite® antes da data de término do suporte. Para obter mais informações, consulte as Secure Gateway datas de depreciação e detalhes de depreciação.

O conteúdo valioso é frequentemente armazenado no site interno da sua empresa. Geralmente, tais websites de intranet são acessíveis apenas a partir de um computador conectado à sua rede de escritório ou através de uma conexão VPN. Você pode estabelecer uma conexão persistente e mais segura entre o rastreador da Web e esse tipo de site interno usando o conector Satellite.

Para configurar o conector Satellite, conclua as etapas a seguir:

  1. Crie um conector Satellite. Para obter mais informações, consulte Criando um conector.
  2. Executar um agente conector. Para obter mais informações, consulte Executando um agente Connector.
  3. Criar e gerenciar os pontos de extremidade do Connector. Para obter mais informações, consulte Criando e gerenciando pontos de extremidade do Connector.

Limitações

As limitações ao usar o conector Satellite são as seguintes:

  • Você pode configurar o conector Satellite somente ao criar uma nova coleção de rastreamento da Web (não é possível modificar após a criação da coleção).
  • Se Conectar-se à rede local estiver definido como On em Mais configurações de conexão, todos os URLs de propagação deverão estar no mesmo domínio.
  • Se a semente URL usar SSL ( https:// ), você poderá usar autenticação básica e URLs absolutos.
  • Se a semente URL usar HTTP ( http:// ), as seguintes limitações se aplicam:
    • A autenticação básica não está disponível ao usar o Satellite Connector.
    • Se a página da Web rastreada tiver um URL absoluto, por exemplo, http://<seed_url_domain>/sample.html, a página vinculada não será rastreada.

Conectando-se à fonte de dados

Para configurar a coleta de crawl web, complete as seguintes etapas:

  1. A partir da pane de navegação, escolha Gerenciar coleções.

  2. Clique em New collection (Nova coleção ).

  3. Clique no link próximo a Necessidade de se conectar a uma origem de dados? , clique em Web crawl e, em seguida, clique em Avançar.

  4. Nomeia a coleção.

  5. Se a linguagem do conteúdo no website não for o inglês, selecione a linguagem apropriada.

    Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.

  6. Opcional: É possível alterar o cronograma de sincronização.

    Para obter mais informações, consulte Opções de planejamento de Crawl.

  7. Especifique o endereço URL do site que você deseja rastrear.

    • Se o site que você deseja rastrear exigir um login, defina a autenticação básica como On, adicione o URL da página ao campo Starting URL e clique em Add (Adicionar ).

      Inclua um nome de usuário e senha com acesso ao site e, em seguida, clique em Salvar credenciais. Você pode especificar apenas um conjunto de credenciais por coleção.

      Por exemplo, você pode especificar https://cloud.ibm.com como o URL inicial e adicionar seu IBMid como as credenciais.

      Se você deseja iniciar o crawl a partir de uma seção específica do site, especifique-o no campo URLs Iniciais. O nome de domínio da subseção deve corresponder ao domínio em URL que você especificou anteriormente.

      Por exemplo, você pode alterar o endereço inicial URL para https://cloud.ibm.com/unifiedsupport/supportcenter.

    • Para todas as páginas públicas da Web que você deseja rastrear, adicione o endereço URL da página raiz do site ao campo URLs iniciais e clique em Adicionar. Você pode adicionar mais de uma página inicial.

      A barra final ( / ) em URL determina a subárvore a ser rastreada. Se você especificar https://www.example.com/banking/faqs.html, todas as URLs que começam com https://www.example.com/banking/ são rastejadas, por exemplo. Se você especificar https://www.example.com/banking todas as URLs que começam com https://www.example.com/ estão engatinhado.

      Por padrão, o número de links consecutivos que o rastreamento segue a partir do site URL inicial é 2. Para alterar o número de hops ou para listar seções do website para excluir do crawl, clique no ícone de edição.

      • O número máximo de saltos permitido é 20.

      • Para especificar os caminhos de URL a serem excluídos, adicione o caminho do site. Por exemplo, se o URL inicial for https://example.com, você poderá excluir o https://example.com/pricing digitando /pricing/.

        Qualquer seção do endereço web que contém o caminho do site que você especificar é excluída. Por exemplo, se você especificar /licenses/, a página https://example.com/products/licenses/europe é excluída, entre outras.

      • Se quiser restringir o rastreamento a uma única página, adicione o endereço URL ao campo URLs iniciais. Por exemplo, https://www.example.com/banking/faqs.html. Clique no ícone de edição para configurar o Número máximo de links a seguir a 0.

      O recurso de rastreamento dinâmico de sites na Web, controlado pelo alternador Execute JavaScript during crawl nas configurações de rastreamento, está obsoleto e será removido até setembro de 2025. Para obter mais informações, consulte Notas de versão.

    • Se o website que você deseja engatinhar usa JavaScript para customizar o conteúdo da página antes que ele seja exibido, você deve dar um passo extra.

      Depois de inserir o URL inicial e clicar em Add (Adicionar ), edite o URL clicando no ícone de edição Edit icon(Editar ). Defina Execute JavaScript during crawl switcher como On e clique em Save.

      Quando o processamento do JavaScript é ativado, ele leva de 3 4 vezes mais tempo para engatinhar uma página. Use-o apenas em páginas web individuais onde você sabe que é necessário porque a página renderiza seu conteúdo dinamicamente. Se você vir mensagens de tempo limite ou o crawl terminar sem adicionar conteúdo à coleção, diminua o número de páginas da web que estão incluídas no crawl. Por exemplo, você pode especificar a página exata para engatinhar no campo Iniciar URLs, e configurar Número máximo de links a seguir para 0.

    • Para se conectar a um site hospedado atrás de um firewall, configure o conector IBM Cloud Satellite primeiro.

      Especifique os Satellite detalhes do conector.

      Para especificar os detalhes, conclua as etapas a seguir:

      1. Expanda Mais configurações de conexãoe, em seguida, configure Conectar-se à rede no local para On.
      2. Selecione IBM Cloud Satellite® Connector como o tipo de conexão. Por padrão, essa opção está selecionada.
      3. Especifique o ponto de extremidade do conector Satellite URL.

      Mostra os detalhes do conector Satellite
      Satellite Detalhes do conector

  8. Opcional: Adicie outro endereço web para o campo Iniciar URLs.

    O número de URLs de partida para uma única coleção deve ser inferior a 100. Se você tem um requisito para engatinhar um grande número de websites, veja Eu preciso engatinhar muitos sites. Qual é o meu limite?.

    O número de páginas web que são rastejadas é limitado a 250.000, portanto, o web crawler pode não arrastar todos os websites especificados.

    O número de URLs filhos por URL que são rastreados é limitado a 10.000. Se o número de URLs filhas dentro de qualquer URL submetida a crawl exceder 10.000, o crawler não poderá processar nenhum conteúdo nas URLs filhas.

  9. Se você deseja limitar os tipos de arquivos a serem incluídos na coleção, é possível listar as extensões de arquivo para os tipos de arquivo a serem incluídos ou excluídos

    Se as URLs para as páginas do website não terminarem em .html, use o filtro de exclusão em vez do filtro de inclusão.. Deve-se incluir pelo menos uma extensão de arquivo para excluir

    Para obter uma lista de tipos de arquivos suportados, consulte Tipos de Arquivos Suportados

  10. Se você deseja que o web rasteje para extrair texto a partir de imagens no site, expanda Mais configurações de processamentoe configure Aplicar reconhecimento de caracteres ópticos (OCR) a On.

    Quando o OCR é ativado e seus documentos contêm imagens, o processamento demora mais. Para obter mais informações, consulte Reconhecimento de caracteres Ópticos.

  11. Clique em Finish.

A coleção é criada rapidamente. É preciso mais tempo para que os dados sejam processados conforme ele é adicionado à coleção.

Se você quiser verificar o progresso, acesse a página Atividade. A partir da pane de navegação, clique em Gerenciar coleções e, em seguida, clique para abrir a coleção.

Preciso engatinhar muitos sites. Qual é o meu limite?

O serviço pode suportar um total de 500 conexões de crawler por instância de serviço Discovery. Todas as fontes de dados, exceto Web crawl, usam uma conexão de crawler cada. Para Web crawl, uma conexão é necessária para cada 5 URLs iniciantes. Se você adicionar 10 iniciando URLS, por exemplo, Discovery gera a conexão de crawler extra que é necessária para suportar as 5 URLs extras. Portanto, o número máximo de URLs iniciantes que você pode usar depende das outras coleções de dados configuradas em sua instância de serviço. Você pode calcular o limite você mesmo.

Para calcular o limite inicial de URL, conclua as etapas a seguir:

  1. Calcule o número de coleções de outras fontes de dados na instância de serviço, significando este projeto e quaisquer outros projetos na mesma instância Discovery.

    Por exemplo, você pode ter 2 IBM Cloud Coleções de Loja de Objetos em um projeto e 2 Salesforce coleções e 1 SharePoint Coleção Online em outro projeto. Neste exemplo, o número total de coletas de outras fontes de dados é de 5.

  2. Subtraia o número de coleções de outras fontes de dados do número máximo permitido de conexões de crawler, que é de 500.

    Por exemplo, 500-5 = 495.

  3. Multiplique o restante por 5 para determinar o número total de URLs iniciantes que você pode usar.

    Por exemplo, 495 x 5 = 2.475.

Para usar o número máximo permitido de URLs de partida no exemplo, você precisaria de 25 coleções de web crawl porque cada coleção permite que um máximo de 100 URLs iniciantes sejam configurados. No entanto, não configure sua instância para usar o número máximo absoluto permitido. Se uma ou mais fontes de dados adicionais forem adicionadas posteriormente a um projeto nesta instância de serviço, ele irá impactar o número de URLs de início que a instância pode engatinhar com sucesso.

Resolução de problemas de crawler

Um erro 403 proibido é retornado
O website que você deseja engatinhar pode bloquear solicitações de todos mas um conjunto específico de entidades denominadas. Se possível, adicire o crawler na lista de allowlist para o site. O cabeçalho de identificação para o crawler é User-Agent: IBM-AppConnect/V1.