Metadati di risposta
Il servizio IBM Watson® Speech to Text può restituire tre tipi di metadati sui risultati della trascrizione. È possibile richiedere il massimo di alternative per vedere più possibili risultati finali di trascrizione. Puoi anche richiedere i timestamp delle parole e la confidenza delle parole per ricevere le misure di confidenza e i timestamp per ogni parola dell'audio.
Numero massimo di alternative
Il parametro max_alternatives accetta un valore numerico intero che indica al servizio di restituire le n migliori ipotesi alternative per i risultati. Per impostazione predefinita, il servizio restituisce un solo risultato
di trascrizione, che equivale a impostare il parametro su 1. Impostando max_alternatives su un numero maggiore di 1, si chiede al servizio di restituire quel numero delle migliori trascrizioni alternative. (Se specifichi
un valore di 0, il servizio utilizza il valore predefinito 1.)
Il servizio notifica un punteggio di attendibilità solo per la migliore alternativa che restituisce. Nella maggior parte dei casi, questa è l'alternativa da scegliere.
Le modifiche interne e i miglioramenti al servizio possono influire sulle trascrizioni e sui punteggi di affidabilità. Ad esempio, il riconoscimento vocale può essere migliorato per restituire risultati di trascrizione più precisi. Allo stesso modo, i punteggi di trascrizione e di affidabilità delle parole potrebbero cambiare leggermente a seguito di un miglioramento del riconoscimento vocale. Si prevede che tali cambiamenti saranno modesti, ma non aspettatevi che le trascrizioni e i punteggi di confidenza rimangano invariati nel tempo.
Esempio di numero massimo di alternative
La seguente richiesta di esempio imposta il parametro max_alternatives su 3:
IBM Cloud
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?max_alternatives=3"
IBM Cloud Pak for Data IBM Software Hub
curl -X POST \
--header "Authorization: Bearer {token}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?max_alternatives=3"
Il servizio riporta una fiducia solo per la più probabile delle tre alternative:
{
"result_index": 0,
"results": [
{
"alternatives": [
{
"confidence": 0.96,
"transcript": "several tornadoes touch down as a line of
severe thunderstorms swept through Colorado on Sunday "
},
{
"transcript": "several tornadoes touched down as a line of
severe thunderstorms swept through Colorado on Sunday "
},
{
"transcript": "several tornadoes touch down as a line of
severe thunderstorms swept through Colorado and Sunday "
}
],
"final": true
}
]
}
Attendibilità delle parole
Il parametro word_confidence indica al servizio se fornire misure di attendibilità per le parole della trascrizione. Per impostazione predefinita, il servizio notifica una misura di attendibilità solo per la trascrizione finale
nel suo insieme. L'impostazione di word_confidence su true indica al servizio di notificare una misura di attendibilità per ogni singola parola della trascrizione.
Una misura di attendibilità indica la stima del servizio che la parola trascritta sia corretta in base alla prova acustica. I punteggi di attendibilità vanno da 0.0 a 1.0.
- Un punteggio di 1.0 indica che la trascrizione corrente della parola riflette il risultato più probabile.
- Un punteggio di 0.5 significa che la parola ha una probabilità del 50 percento di essere corretta.
Le modifiche interne e i miglioramenti al servizio possono influire sulle trascrizioni e sui punteggi di affidabilità. Ad esempio, il riconoscimento vocale può essere migliorato per restituire risultati di trascrizione più precisi. Allo stesso modo, i punteggi di trascrizione e di affidabilità delle parole potrebbero cambiare leggermente a seguito di un miglioramento del riconoscimento vocale. Si prevede che tali cambiamenti saranno modesti, ma non aspettatevi che le trascrizioni e i punteggi di confidenza rimangano invariati nel tempo.
Esempio di attendibilità delle parole
L'esempio seguente richiede i punteggi di confidenza delle parole per le parole della trascrizione:
IBM Cloud
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?word_confidence=true"
IBM Cloud Pak for Data IBM Software Hub
curl -X POST \
--header "Authorization: Bearer {token}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?word_confidence=true"
Il servizio restituisce un punteggio di affidabilità per ogni parola dell'audio:
{
"result_index": 0,
"results": [
{
"alternatives": [
{
"confidence": 0.96,
"transcript": "several tornadoes touch down as a line of
severe thunderstorms swept through Colorado on Sunday ",
"word_confidence": [
[
"several",
1.0
],
[
"tornadoes",
1.0
],
[
"touch",
0.52
],
[
"down",
0.90
],
. . .
[
"on",
0.31
],
[
"Sunday",
0.99
]
]
}
],
"final": true
}
]
}
Date/ore delle parole
Il parametro timestamps indica al servizio se produrre date/ore per le parole che trascrive. Per impostazione predefinita, il servizio non notifica alcuna data/ora. L'impostazione di timestamps su true indica al servizio di notificare il tempo di inizio e fine in secondi per ciascuna parola relativamente all'inizio dell'audio.
I timestamp vengono abilitati automaticamente quando si richiedono le etichette degli altoparlanti. Per ulteriori informazioni, vedi Etichette del parlante.
Esempio di date/ore di parole
L'esempio seguente richiede i timestamp per le parole della trascrizione:
IBM Cloud
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?timestamps=true"
IBM Cloud Pak for Data IBM Software Hub
curl -X POST \
--header "Authorization: Bearer {token}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?timestamps=true"
Il servizio restituisce un timestamp per ogni parola dell'audio:
{
"result_index": 0,
"results": [
{
"alternatives": [
{
"timestamps": [
[
"several",
1.01,
1.52
],
[
"tornadoes",
1.52,
2.15
],
[
"touch",
2.15,
2.5
],
[
"down",
2.5,
2.81
],
. . .
[
"on",
5.62,
5.74
],
[
"Sunday",
5.74,
6.34
]
],
"confidence": 0.96,
"transcript": "several tornadoes touch down as a line of
severe thunderstorms swept through Colorado on Sunday "
}
],
"final": true
}
]
}