Mito 1: Una voce perfetta non ha bisogno di pause per respirare
Ciò che è vero.
Molti sviluppatori di software eliminano sistematicamente ogni sospiro e respiro dai loro file audio. Pensano che una registrazione pulita senza rumori di fondo sia lo standard ultimo. La realtà è diversa. Una voce senza respiro è come una tastiera senza barra spaziatrice. Senza quei piccoli punti di riposo, tutte le parole si attaccano e un testo diventa illeggibile. Nel linguaggio parlato funziona esattamente allo stesso modo.
Respirare non è un errore nella registrazione, è la punteggiatura naturale del nostro discorso. Dà all'ascoltatore il tempo di elaborare la frase appena pronunciata. Quando un computer salta quei punti di riposo o li interrompe artificialmente, il cervello umano deve lavorare il doppio per capire il messaggio.
Mito 2: La voce AI più recente suona esattamente come una persona
Ciò che è vero.
Le voci sintetiche sono migliorate negli ultimi anni nell'imitare le tonalità, ma mancano della logica fisica di un corpo reale. Un'attrice vocale umana come Christina o un attore vocale come Mark adatta intuitivamente la respirazione al contenuto della frase. Se registrano un messaggio eccitato, la respirazione è più corta e alta. Con una spiegazione calma e affidabile, il respiro è più profondo e lento.
Un algoritmo calcola le probabilità statistiche dei suoni, ma non sente il testo. La macchina non sa che una certa frase ha bisogno di peso extra e che un piccolo respiro subito prima della parola più importante crea tensione. Questa mancanza di logica emotiva fa sì che gli ascoltatori, dopo trenta secondi, capiscano comunque che c'è qualcosa che non va.