IBM Cloud Object Storage

Esegui la ricerca per indicizzazione dei documenti memorizzati in una origine dati IBM Cloud® Object Storage.

IBM Cloud IBM Cloud solo

Queste informazioni si applicano solo alle installazioni gestite.

Documenti sottoposti a ricerca per indicizzazione

Durante la ricerca per indicizzazione iniziale del contenuto, i documenti di tutto il contenuto a cui è possibile accedere dall'endpoint di archiviazione vengono sottoposti a ricerca per indicizzazione e aggiunti alla tua raccolta. Non è possibile eseguire la ricerca per indicizzazione degli endpoint privati.

Durante le successive ricerche per indicizzazione pianificate, viene eseguita la ricerca per indicizzazione solo sui documenti nuovi e modificati e le eventuali modifiche vengono riportate nella propria raccolta. I documenti eliminati dall'origine dati esterna non vengono eliminati dalla raccolta.

Tutti i connettori dell'origine dati Discovery sono di sola lettura. Indipendentemente dalle autorizzazioni concesse all'account di ricerca per indicizzazione, Discovery non scrive, aggiorna o elimina mai alcun contenuto nell'origine dati originale.

La seguente tabella illustra gli oggetti su cui Discovery può eseguire la ricerca per indicizzazione.

Supporto per il crawling delle fonti di dati
Origine dati Oggetti sottoposti a ricerca per indicizzazione
IBM Cloud Object Storage Bucket, file

Cosa ti serve prima di iniziare

Ottenere le licenze di servizio richieste per il contenuto sul sito Web a cui si desidera connettersi. Per ulteriori informazioni sulle licenze, contattare l'amministratore di sistema dell'origine dati.

Endpoint

Il endpoint per i tuoi dati IBM Cloud Object Storage. Ad esempio, s3.us-south.cloud-object-storage.appdomain.cloud.

Non includere http:// o https:// nel valore dell'endpoint. Per ulteriori informazioni, vedi Endpoint regionali.

Oltre all'endpoint, è necessario fornire le credenziali per abilitare l'autenticazione con l'archivio oggetti. È possibile scegliere di utilizzare uno dei seguenti metodi di autenticazione:

HMAC
Utilizza un codice di autenticazione dei messaggi basato su hash per autenticare gli utenti. HMAC è una tecnica di autenticazione crittografica che utilizza una funzione hash e una chiave segreta. I dati vengono criptati prima che vengano inviati su Internet. Quindi, il destinatario desiderato utilizza la chiave segreta per decodificare i dati. Per ulteriori informazioni, vedi Autenticazione HMAC.
IAM
Utilizza il servizio IBM Cloud Identity and Access Management (IAM) per autenticare gli utenti. Il vantaggio di questo tipo di autenticazione è che l'utente può utilizzare lo stesso processo per accedere a tutte le risorse della IBM Cloud Platform. Per ulteriori informazioni, vedi Autenticazione IAM.

Per accedere alle informazioni sulle credenziali, vai alla pagina delle credenziali del servizio della tua istanza del servizio IBM Cloud Object Storage. Espandere la credenziale del servizio per visualizzare i relativi dettagli.

Per ulteriori informazioni, vedi Credenziali del servizio nella documentazione del prodotto Object Storage.

Autenticazione HMAC

Se si desidera utilizzare l'autenticazione HMAC, è necessario disporre delle seguenti informazioni pronte:

ID chiave di accesso
Il access_key_id generato quando è stata creata l'istanza IBM Cloud Object Storage. Ad esempio, 347aa3a4b34344f8bc7c7cccdf856e4c.
Chiave di accesso segreta
Il secret_access_key da utilizzare per firmare le richieste. Questa chiave è stata generata quando è stata creata l'istanza IBM Cloud Object Storage. Ad esempio, gvurfb82712ad14W7a7915h763a6i87155d30a1234364f61.

Autenticazione IAM

Se si desidera utilizzare l'autenticazione IAM, è necessario disporre delle seguenti informazioni pronte:

Chiave API IAM
Ad esempio, 0viPHOY7LbLNa9eLftrtHPpTjoGv6hbLD1QalRXikliJ
ID istanza di risorsa
Ad esempio, cloud-object-storage:global:a/3ag0e9402tyfd5d29761c3e97696b71n:d6f74k03-6k4f-4a82-b165-697354o63903::

Connessione all'origine dati

Dal tuo progetto Discovery, completa la seguente procedura:

  1. Dal riquadro di spostamento, scegliere Gestisci raccolte.

  2. Fare clic su Nuova raccolta.

  3. Fare clic sul collegamento accanto al campo Necessità di connettersi a un'origine dati?, fare clic su IBM Cloud Object Storage e quindi su Avanti.

  4. Scegliere un tipo di credenziale e completare i campi con le informazioni raccolte in precedenza.

    • IAM
    • HMAC

    Fare clic su Avanti.

  5. Denominare la raccolta.

  6. Se la lingua dei documenti in memoria non è l'inglese, selezionare la lingua appropriata.

    Per un elenco delle lingue supportate, vedi Supporto linguistico.

  7. Facoltativo: modificare la pianificazione della sincronizzazione.

    Per ulteriori informazioni, vedi Opzioni di pianificazione della ricerca per indicizzazione.

  8. Scegliere i bucket su cui si desidera eseguire la ricerca per indicizzazione.

    Più bucket selezioni, più tempo impiega l'elaborazione dei documenti.

  9. Se si desidera limitare i tipi di file da aggiungere alla raccolta, è possibile elencare le estensioni file per i tipi di file da includere o escludere.

    Quando si sceglie di elencare le estensioni per i tipi di file da escludere, è necessario aggiungere almeno un'estensione file.

    Per un elenco dei tipi di file supportati, vedere Tipi di file supportati.

  10. Se si desidera che il crawler estragga il testo dalle immagini sul sito, espandere Ulteriori impostazioni di elaborazionee impostare Applica OCR (optical character recognition) su On.

    Quando OCR è abilitato e i tuoi documenti contengono immagini, l'elaborazione richiede più tempo. Per ulteriori informazioni, consultare Riconoscimento dei caratteri ottici.

  11. Fai clic su Finish.

La raccolta viene creata rapidamente. È necessario più tempo per l'elaborazione dei dati man mano che vengono aggiunti alla raccolta.

Se si desidera controllare l'avanzamento, andare alla pagina Attività. Dal riquadro di navigazione, fare clic su Gestisci raccolte, quindi fare clic per aprire la raccolta.