IBM Cloud Object Storage
Crawl documentos que são armazenados em uma fonte de dados IBM Cloud® Object Storage.
IBM Cloud IBM Cloud somente
Essas informações se aplicam apenas a implementações gerenciadas.
Quais documentos estão engatinados
Durante o crawl inicial do conteúdo, os documentos de todo o conteúdo que pode ser acessado no terminal de armazenamento são engatinhado e adicionados à sua coleção. Você não pode rastrear pontos de extremidade privados.
Durante os recritos programados subsequentes, apenas documentos novos e modificados são engatinados e quaisquer alterações são refletidas em sua coleção. Os documentos que são excluídos da fonte de dados externos não são excluídos da coleção.
Todos os conectores de origem de dados Discovery são de leitura. Independentemente das permissões que são concedidas à conta de crawl, Discovery nunca grava, atualiza ou exclui qualquer conteúdo na origem de dados original.
A tabela a seguir ilustra os objetos que Discovery podem engatinhar.
| Origem de dados | Objetos que são rastejados |
|---|---|
| IBM Cloud Object Storage | Depósitos, arquivos |
O que você precisa antes de começar
Obtenha quaisquer licenças de serviço necessárias para o conteúdo no website do qual você deseja se conectar. Para obter mais informações sobre licenças, entre em contato com o administrador do sistema da fonte de dados.
- Terminal
-
O
endpointpara seus dados IBM Cloud Object Storage. Por exemplo,s3.us-south.cloud-object-storage.appdomain.cloud.Não inclua
http://ouhttps://no valor do ponto final. Para obter mais informações, consulte Terminais regionais.
Além do terminal, você deve fornecer credenciais para habilitar a autenticação com a loja de objetos. Você pode optar por utilizar um dos seguintes métodos de autenticação:
- HMAC
- Usa um código de autenticação de mensagens baseado em hash para autenticar usuários. HMAC é uma técnica de autenticação criptográfica que usa uma função hash e uma chave secreta. Os dados são embaralados antes de ser enviado pela internet. Em seguida, o destinatário pretendido usa a chave secreta para desembaralar os dados. Para obter mais informações, consulte Autenticação HMAC.
- IAM
- Usa o serviço IBM Cloud Identity and Access Management (IAM) para autenticar usuários. A vantagem desse tipo de autenticação é que o usuário pode usar o mesmo processo para acessar todos os recursos na IBM Cloud Platform. Para obter mais informações, consulte autenticação IAM.
Para acessar as informações da credencial, acesse a página de credenciais de serviço da sua instância de serviço IBM Cloud Object Storage. Expanda a credencial de serviço para ver os detalhes da credencial.
Para obter mais informações, consulte Credenciamento de serviço na documentação do produto Object Storage.
Autenticação HMAC
Se você deseja usar a autenticação HMAC, você deve ter as seguintes informações prontas:
- ID da chave de acesso
- O
access_key_idque foi gerado quando a instância IBM Cloud Object Storage foi criada. Por exemplo,347aa3a4b34344f8bc7c7cccdf856e4c. - Chave de acesso secreta
- O
secret_access_keya usar para assinar solicitações. Essa chave foi gerada quando a instância IBM Cloud Object Storage foi criada. Por exemplo,gvurfb82712ad14W7a7915h763a6i87155d30a1234364f61.
Autenticação IAM
Se você deseja usar a autenticação IAM, você deve ter as seguintes informações prontas:
- chave de API do IAM
- Por exemplo,
0viPHOY7LbLNa9eLftrtHPpTjoGv6hbLD1QalRXikliJ - ID da instância de recurso
- Por exemplo,
cloud-object-storage:global:a/3ag0e9402tyfd5d29761c3e97696b71n:d6f74k03-6k4f-4a82-b165-697354o63903::
Conectando-se à fonte de dados
Em seu projeto Discovery, conclua as seguintes etapas:
-
A partir da pane de navegação, escolha Gerenciar coleções.
-
Clique em New collection (Nova coleção ).
-
Clique no link ao lado do campo Need to connect to a data source?, clique em IBM Cloud Object Storage e, em seguida, clique em Next.
-
Escolha um tipo de credencial e, em seguida, complete os campos com as informações coletadas anteriormente.
- IAM
- HMAC
Clique em Próximo.
-
Nomeia a coleção.
-
Se a linguagem dos documentos em armazenamento não for o inglês, selecione a linguagem apropriada.
Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.
-
Opcional: Alterar o cronograma de sincronização.
Para obter mais informações, consulte Opções de planejamento de Crawl.
-
Escolha os buckets que você deseja rastrear.
Quanto mais baldes você selecionar, mais tempo o processamento dos documentos leva.
-
Se você deseja limitar os tipos de arquivos a serem incluídos na coleção, é possível listar as extensões de arquivo para os tipos de arquivo a serem incluídos ou excluídos
Ao escolher listar extensões para tipos de arquivo a serem excluídos, deve-se incluir pelo menos uma extensão de arquivo.
Para obter uma lista de tipos de arquivos suportados, consulte Tipos de Arquivos Suportados
-
Se você deseja que o crawler extraia texto a partir de imagens no site, expanda Mais configurações de processamentoe configure Aplicar reconhecimento de caracteres ópticos (OCR) a
On.Quando o OCR é ativado e seus documentos contêm imagens, o processamento demora mais. Para obter mais informações, consulte Reconhecimento de caracteres Ópticos.
-
Clique em Finish.
A coleção é criada rapidamente. É preciso mais tempo para que os dados sejam processados conforme ele é adicionado à coleção.
Se você quiser verificar o progresso, acesse a página Atividade. A partir da pane de navegação, clique em Gerenciar coleções e, em seguida, clique para abrir a coleção.