Backup e ripristino di dati
Utilizzare le seguenti procedure per eseguire il backup e il ripristino dei dati in IBM Watson® Discovery.
IBM Cloud Pak for Data IBM Software Hub
Queste informazioni si applicano solo alle distribuzioni installate.
Utilizzare la stessa serie di script di backup e di ripristino per eseguire il backup e il ripristino dei dati in uno dei percorsi di aggiornamento supportati. Lo script di backup memorizza il numero di versione del servizio con i dati di cui eseguire il backup dalla distribuzione esistente. Lo script di ripristino rileva la versione del servizio installata nella nuova distribuzione e quindi segue i passaggi appropriati per ripristinare i dati alla versione rilevata.
La seguente tabella elenca i percorsi di aggiornamento supportati dagli script.
| Versione in uso | Versione a cui è possibile eseguire l'aggiornamento |
|---|---|
| 5.1.x | Versioni successive di 5.1.x, 5.2.0 |
| 5.0.x | Versioni successive di 5.0.x, 5.1.x, 5.2.0 |
| 4.8.8, 4.8.9 | 5.1.1 o versioni successive |
| 4.8.7 | Versioni successive di 4.8.x, 5.1.x, 5.2.0 |
| 4.8.6 | Versioni successive di 4.8.x, 5.0.3, 5.1.x, 5.2.0 |
| 4.8.x | Versioni successive di 4.8.x, 5.0.x, 5.1.x, 5.2.0 |
| 4.7.x | 4.8.x, 5.0.x, 5.1.x |
| 4.6.x | 4.8.x, 5.0.x, 5.1.x |
| 4.5.x | 4.8.x, 5.0.x, 5.1.x |
| 4.0.x | 4.8.x tranne 4.8.0 |
Se si sta eseguendo l'aggiornamento a 5.2.x, un modo più semplice per completare l'aggiornamento è descritto nei seguenti argomenti:
- Aggiornamento di Watson Discovery dalla versione 5.1.
- Aggiornamento Watson Discovery dalla versione 5.0.
- Aggiornamento Watson Discovery dalla versione 4.8.
Se si sta effettuando l'aggiornamento a 5.1.x, nei seguenti argomenti è descritto un modo più semplice per completare l'aggiornamento:
- Aggiornamento Watson Discovery dalla versione 5.0.
- Aggiornamento Watson Discovery dalla versione 4.8.
Se si sta eseguendo l'aggiornamento a 5.0.x, nei seguenti argomenti viene descritto un modo più semplice per completare l'aggiornamento:
- Aggiornamento di Watson Discovery dalla versione 4.8.x.
- Aggiornamento di Watson Discovery dalla versione 4.7.
Se utilizzi il programma di utilità di backup e ripristino IBM Cloud Pak for Data Red Hat OpenShift APIs for Data Protection (OADP) per eseguire il backup non in linea e ripristinare un intero cluster, sono necessari alcuni passi aggiuntivi. Per ulteriori informazioni, consulta Utilizzo di OADP per eseguire il backup di un cluster in cui è installato Discovery. Per informazioni sul backup e ripristino online di OADP, consultare Cloud Pak for Data online backup and restore.
È possibile eseguire un aggiornamento sul posto da una versione 4.8.x a una versione 4.8.y successiva. Per ulteriori informazioni, vedi Upgrade di Watson Discovery dalla Versione 4.8.x a un successivo 4.8 refresh.
È possibile eseguire un aggiornamento sul posto da una versione 4.7.x a una versione 4.7.y successiva. Per ulteriori informazioni, vedi Upgrade di Watson Discovery dalla versione 4.7.x a un successivo 4.7 aggiornamento.
È possibile eseguire un aggiornamento sul posto da una versione di 4.6.x a una versione 4.6.y successiva. Per ulteriori informazioni, vedi Upgrading Watson Discovery dalla versione 4.6.x a un successivo 4.6 refresh.
È possibile eseguire un aggiornamento sul posto da una versione 4.5.x a una versione 4.5.y successiva. Per ulteriori informazioni, vedi Upgrade di Watson Discovery all'ultima versione 4.5 refresh.
È possibile eseguire un aggiornamento sul posto da una versione di 4.0.x a una versione 4.0.y successiva. Per ulteriori informazioni, vedi Upgrade di Watson Discovery a un aggiornamento 4.0 più recente.
Panoramica sul processo
Ad un alto livello, il processo comprende le seguenti fasi:
- Eseguire il backup dei dati Discovery utilizzando lo script di backup.
- Installa la versione più recente di IBM Cloud Pak for Data.
- Installa la versione più recente del servizio Discovery nel cluster.
- Ripristinare i dati di backup Discovery utilizzando lo script di ripristino.
Limitazioni di backup e ripristino
Non è possibile migrare i seguenti dati:
- Modelli di suggerimenti del dizionario. Questi modelli vengono creati quando si crea un dizionario. Il dizionario è incluso nel backup, ma il modello di suggerimenti del termine non lo è. Rielaborare le raccolte migrate per consentire i suggerimenti dei termini del dizionario.
- Non è possibile eseguire il backup e ripristinare le curazioni o migrarle perché le curazioni sono una funzione beta.
È possibile eseguire il back up e ripristinare alcuni dati utilizzando gli script di backup e ripristino, ma è necessario eseguire il backup e ripristinare altri dati manualmente. Il backup dei seguenti dati deve essere eseguito manualmente:
- Cartelle e documenti del file system locale che si possono strisciare utilizzando l'origine dati File system locale.
I seguenti aggiornamenti vengono apportati quando vengono ripristinate le tue raccolte:
- Qualsiasi raccolta che contiene documenti che sono stati creati caricando i dati viene automaticamente rieseguita la ricerca per indicizzazione e reindicizzata quando viene ripristinata. A questi documenti vengono assegnati nuovi numeri identificativi nelle raccolte ripristinate.
- Le raccolte utilizzate nei progetti Content Mining vengono automaticamente reindicizzate e reindicizzate quando ripristinate. Solo ai documenti aggiunti tramite il caricamento dei dati vengono assegnati nuovi numeri ID documento nelle raccolte ripristinate.
Metodi di backup e ripristino
Puoi eseguire il backup e il ripristino della tua istanza di Discovery manualmente o utilizzando gli script.
- Utilizzo di script di backup
- Utilizzo di script di ripristino
- Backup manuale dei dati
- Ripristino manuale dei dati
Devi disporre dell'accesso amministrativo all'istanza Discovery sul tuo cluster Discovery (dove sono archiviati i dati di cui eseguire il backup) e dell'accesso amministrativo alla nuova istanza (dove verranno ripristinati i dati).
Gli script di backup e ripristino completano molte operazioni e possono richiedere un po' di tempo per essere eseguiti. Per evitare problemi di timeout, eseguire uno strumento che impedisca i timeout, ad esempio nohup.
Utilizzo degli script di backup
Poiché le modifiche ai dati memorizzati in IBM Watson® Discovery durante un backup possono causare il danneggiamento del backup stesso e renderlo inutilizzabile, non sono consentite richieste in volo durante il periodo di backup.
Una richiesta incompleta è qualsiasi azione IBM Watson® Discovery che elabora i dati, incluse le seguenti azioni:
- Ricerca per indicizzazione origine (pianificata o non pianificata)
- L'inserimento di documenti
- L'addestramento di un modello di query addestrato
La quantità di memoria disponibile nel nodo in cui si esegue lo script di backup deve essere 3 volte maggiore del file di backup più grande nell'archivio dati di cui si intende eseguire il backup. Se il tuo archivio dati è grande, considera l'utilizzo di un'attestazione del volume persistente invece di affidarti all'archiviazione effimera del nodo. Per ulteriori informazioni, vedi Configurazione dei lavori per l'utilizzo della PVC.
Completa la seguente procedura per eseguire il back up dei dati IBM Watson® Discovery utilizzando gli script di backup:
-
Immetti il seguente comando per impostare lo spazio dei nomi corrente in cui è distribuita la tua istanza Discovery:
oc project <namespace> -
Ottieni lo script di backup dal repositoryGitHub.
Sono richiesti tutti i file nel repository per completare un backup e un ripristino. Seguire le istruzioni della Guida di GitHub per clonare o scaricare un file compresso del repository.
-
Rendere ogni script un file eseguibile eseguendo il seguente comando:
chmod +x <name-of-script>Sostituire
<name-of-script>con il nome dello script. -
Eseguire lo script
all-backup-restore.sh../all-backup-restore.sh backup [ -f backup_file_name ] [--pvc]Il parametro
-f backup_file_nameè facoltativo. Il nomewatson_discovery_<timestamp>.backupviene utilizzato se non si specifica un nome.Il parametro
--pvcè facoltativo. Per ulteriori informazioni su quando utilizzarlo, consulta Configurazione dei lavori per l'utilizzo della PVC. Per impostazione predefinita, gli script di backup e ripristino creano una directorytmpnella directory corrente che lo script utilizza per estrarre o comprimere i file di backup.Se si verificano dei problemi con il backup, eseguire nuovamente il comando di backup e includere il parametro
--use-job. Questo parametro indica allo script di backup di utilizzare un lavoro Kubernetes per eseguire il backup di ElasticSearch e di MinIO in aggiunta a Postgres, che utilizza un job Kubernetes per impostazione predefinita. Se la dimensione dei dati in ElasticSearch e MinIO è elevata e la memoria temporanea non è sufficiente, includere l'opzione--pvc. In questo caso, lo script utilizza l'attestazione del volume persistente specificata con l'opzione--pvcinvece dell'archivio temporaneoemptyDircome directory di lavoro temporanea per il lavoro.
Estrazione dei file dal file di archivio di backup
Gli script generano un file di archiviazione, inclusi i file di backup dei servizi elencati al passo 1.
-
È possibile estrarre i file dal file di archiviazione eseguendo il seguente comando:
tar xvf <backup_file_name>
Configurazione dei lavori per l'utilizzo della PVC
Il processo di backup e ripristino utilizza lavori Kubernetes. I lavori utilizzano volumi effimeri che utilizzano memoria effimera. Si tratta di un montaggio di archiviazione temporanea sul pod che utilizza l'archiviazione locale di un nodo.
In rari casi, l'archiviazione effimera non è abbastanza grande. Puoi facoltativamente indicare al lavoro di montare una PVC (Persistent Volume Claim) sul suo pod da utilizzare per archiviare i dati di backup. Per fare ciò, specificare l'opzione
--pvc quando si esegue lo script. Gli script utilizzano emptyDir di Kubernetes in caso contrario.
Nella maggior parte dei casi, non è necessario utilizzare un volume persistente. Se si sceglie di utilizzare un volume persistente, il volume deve essere 3 volte più grande del file di backup più grande nell'archivio dati. La dimensione del file di backup dell'archivio dati dipende dall'utilizzo. Dopo aver creato un backup, è possibile estrarre i file dal file di archivio per verificare le dimensioni dei file.
Inoltre, è necessario avere 2 volte lo spazio su disco disponibile sul sistema locale rispetto alla dimensione dell'archivio dati poiché l'archivio dei dati viene suddiviso e quindi ricombinato per evitare problemi che potrebbero verificarsi quando si copiano file di grandi dimensioni dal nodo cluster al sistema locale.
Associazione di cluster multitenant
Quando ripristini i dati di cui è stato eseguito il backup da una versione precedente a 4.0.6 a una release successiva e la distribuzione di cui è stato eseguito il backup aveva più di una istanza del servizio di cui è stato eseguito il provisioning, è richiesto un passo aggiuntivo. Devi creare un file JSON che associ gli ID dell'istanza del servizio tra il cluster di cui è stato eseguito il backup e il cluster in cui vengono ripristinati i dati.
Questo passo di associazione non è richiesto se gli ID istanza non sono stati modificati tra i passi di backup e ripristino. Ad esempio, puoi ignorare questo passo se stai ripristinando i dati nello stesso cluster da cui è stato eseguito il backup o se stai ripristinando i dati in un nuovo cluster che non ha alcuna istanza Discovery.
Per creare una mappatura, completare i seguenti passaggi:
-
Estrarre il file template di associazione dal file di archivio di backup.
tar xf <backup_file_name> tmp/instance_mapping.json -O > <mapping_file_name> -
Crea un elenco dei nomi e degli ID istanza delle istanze del servizio di cui viene eseguito il provisioning nel cluster in cui vengono ripristinati i dati.
L'ID dell'istanza fa parte del sito URL specificato nella pagina di riepilogo dell'istanza. Dal menu principale del client Web IBM Cloud Pak for Data, espandere Servizi, quindi fare clic su Istanze. Trova la tua istanza e fai clic su di essa per aprirne la pagina di riepilogo. Spostarsi nella sezione Informazioni sull'accesso della pagina e cercare l'ID dell'istanza nel campo URL campo.
Ad esempio,
https://<host_name>/wd/<namespace>-wd/instances/<instance_id>/api.Ripeti questo passo per prendere nota dell'ID istanza per ogni istanza di cui viene eseguito il provisioning.
-
Modificare il file di associazione.
Aggiungi gli ID istanza per le istanze del servizio di destinazione elencate nel passo precedente. Il seguente snippet è un esempio di file di mappatura.
{ "instance_mappings": [ { "display_name": "discovery-1", "source_instance_id": "1644822491506334", "dest_instance_id": "<new_instance_id>" }, { "display_name": "discovery-2", "source_instance_id": "1644822552830325", "dest_instance_id": "<new_instance_id>" } ] }
Quando si esegue lo script di ripristino, includere il parametro --mapping facoltativo per applicare questo file di associazione quando i dati vengono ripristinati.
Backup manuale dei dati
Eseguire manualmente il backup dei dati di cui non viene eseguito il backup utilizzando gli script.
Per eseguire manualmente il backup dei dati da un'istanza di Discovery, eseguire i seguenti passaggi:
-
Immetti il seguente comando per accedere al tuo cluster Discovery:
oc login https://<OpenShift administrative console URL> \ -u <cluster administrator username> -p <password> -
Immetti il seguente comando per passare allo spazio dei nomi corretto:
oc project <discovery-install namespace> -
Immetti
oc get pods|grep crawler. -
Immetti il seguente comando:
oc cp <crawler pod>:/mnt <path-to-backup-directory>
Utilizzo degli script di ripristino
Se si stanno ripristinando i dati da una versione precedente a 4.0.6 e si sta ripristinando un cluster multitenant in un cluster multitenant, è necessario eseguire un ulteriore passo prima di iniziare. Per ulteriori informazioni, consultare Associazione di cluster multitenant.
Completa la seguente procedura per ripristinare i dati in IBM Watson® Discovery utilizzando gli script di ripristino:
-
Immetti il seguente comando per impostare lo spazio dei nomi corrente in cui è distribuita la tua istanza Discovery:
oc project <namespace> -
Se non lo hai già fatto, ottieni lo script di ripristino dal repositoryGitHub.
Sono necessari tutti i file nel repository per completare un backup e un ripristino. Seguire le istruzioni della Guida di GitHub per clonare o scaricare un file compresso del repository.
-
Rendere ogni script un file eseguibile eseguendo il seguente comando:
chmod +x <name-of-script>Sostituire
<name-of-script>con il nome dello script. -
Ripristinare i dati dal file di backup sul sistema locale alla nuova distribuzione Discovery eseguendo il seguente comando:
./all-backup-restore.sh restore -f backup_file_name [--pvc] [--mapping]Il parametro
--pvcè facoltativo. Per ulteriori informazioni su quando utilizzarlo, consulta Configurazione dei lavori per l'utilizzo della PVC.Il parametro
--mappingè facoltativo. Per ulteriori informazioni su quando utilizzarlo, consultare Associazione di cluster multitenant.Per impostazione predefinita, gli script di backup e ripristino creano una directory
tmpnella directory corrente che lo script utilizza per estrarre o comprimere i file di backup. Se è stato utilizzato il parametro--use-jobquando è stato eseguito il backup dei dati, specificarlo nuovamente quando si ripristinano i dati. Questo parametro indica allo script di backup di utilizzare un lavoro Kubernetes per eseguire il backup di ElasticSearch e MinIO.I pod
gateway,ingestion,orchestrator,hadoop workerecontrollersi riavviano automaticamente.
Ripristino manuale dei dati
Ripristinare manualmente i dati che non possono essere ripristinati utilizzando lo script.
Per ripristinare manualmente i tuoi dati da un'istanza di Discovery, completa la seguente procedura:
-
Immetti il seguente comando per accedere al tuo cluster Discovery:
oc login https://<OpenShift administrative console URL> \ -u <cluster administrator username> -p <password> -
Immetti il seguente comando per passare allo spazio dei nomi corretto:
oc project <discovery-install namespace> -
Immetti
oc get pods|grep crawler. -
Immetti il seguente comando:
oc cp <path-to-backup-directory> <crawler pod>:/mnt
Utilizzo di OADP per il backup offline di un cluster in cui è installato Discovery
Se intendi eseguire il backup e il ripristino offline di un'intera istanza IBM Cloud Pak for Data utilizzando il programma di utilità di backup e ripristino IBM Cloud Pak for Data Red Hat OpenShift APIs for Data Protection (OADP), devi eseguire alcuni passi aggiuntivi nell'ordine corretto affinché il programma di utilità funzioni correttamente quando è presente Discovery. Vedi Cloud Pak for Data offline backup and restore(programma di utilitàOADP).
Backup di un cluster non in linea
Per eseguire un backup non in linea di un cluster, completare la seguente procedura:
-
Esegui lo script di backup Discovery.
-
Utilizzare il programma di utilità di backup OADP per eseguire il backup del cluster.
Ripristino di un cluster non in linea
Per ripristinare offline un cluster, completare i seguenti passaggi:
-
Utilizzare il programma di utilità di backupOADP per ripristinare il cluster.
-
Disinstalla Discoverye quindi installa nuovamente Discovery sul cluster ripristinato.
La reinstallazione è richiesta perché il programma di utilità non sempre reinstalla Discovery correttamente.
-
Esegui lo script di ripristino Discovery per ripristinare i dati.