Cosa succede al linguaggio quando le macchine iniziano a rispondere?

Qualche mese fa, un'amica ha pubblicato qualcosa sui social media che ha attirato la mia attenzione. Faceva fatica ad ascoltare quelle che definiva "voci di intelligenza artificiale (letteralmente) senza fiato per gli audiolibri".
Quando le ho chiesto quale parte avesse trovato più sgradevole, ha risposto che aveva dovuto interrompere l'ascolto perché mancava la naturalezza del respiro e le variazioni: era tutto troppo schematico.
Potrebbe sembrare una piccola lamentela. Ma mette in luce una questione ben più ampia riguardante il linguaggio e l'intelligenza artificiale: cosa succede quando progettiamo sistemi per produrre linguaggio senza prestare sufficiente attenzione alle persone che lo ascoltano o lo leggono?
La comunicazione non inizia e finisce con chi parla. Anche chi ascolta si impegna a fondo: presta attenzione non solo a ciò che viene detto, ma anche a come viene detto, a ciò che è appena accaduto e a ciò che ci si aspetta possa accadere in seguito. Persino quelle che consideriamo imperfezioni nel linguaggio possono veicolare informazioni.
Le disfluenze hanno un significato
I linguisti usano spesso il termine "disfluenze" per riferirsi a esitazioni, ripetizioni, false partenze e altre deviazioni da un discorso "fluido".
L'etichetta può farli sembrare difetti da eliminare. Ma nella conversazione umana, fanno parte del messaggio .
Una voce sintetica che elimina le disfluenze può essere grammaticalmente corretta e acusticamente impeccabile, ma risultare impoverita all'ascoltatore, che ha a disposizione meno elementi su cui lavorare.
Non ci limitiamo a decodificare i segni
Il linguaggio non esiste nella nostra mente semplicemente come un catalogo di parole e di come vengono pronunciate e utilizzate. È intrecciato con la memoria, l'esperienza e la nostra conoscenza del mondo, plasmato dal luogo in cui siamo cresciuti, dalle persone con cui siamo cresciuti, dalle attività che abbiamo svolto e dagli scopi che abbiamo perseguito.
La pluripremiata autrice Arundhati Roy coglie in parte questo concetto nel suo libro di memorie Mother Mary Comes To Me, quando descrive la maggior parte di noi come "un brodo vivente e pulsante di memoria e immaginazione".
La frase di Roy è utile per riflettere sul linguaggio, perché la comunicazione umana non è un semplice trasferimento di informazioni da un contenitore cognitivo all'altro. Le parole si scontrano con i ricordi, le aspettative e le supposizioni di un'altra persona. Si scontrano anche con le altre lingue dell'ascoltatore, nonché con questioni meno tangibili come il suo stato d'animo del momento.
Questo è uno dei motivi per cui due persone possono ascoltare la stessa frase e comprenderla in modo diverso, e perché l'umorismo è così ricco di sfumature. Ed è anche il motivo per cui le caratteristiche sociali di una voce contano.
La ricerca della linguista di Berkeley Nicole Holliday mostra come gli ascoltatori formulino giudizi sociali sulle voci, comprese quelle generate dall'IA, e come tali giudizi interagiscano con la percezione della personalità e dell'identità . L'ascoltatore è fondamentale per la comunicazione, e questo crea un problema interessante per l'IA generativa.
Abbiamo sviluppato l'intelligenza artificiale attorno all'altoparlante
Gran parte dello sviluppo dell'intelligenza artificiale generativa si è concentrato sulla capacità del sistema di produrre linguaggio. Molta meno attenzione è stata dedicata a coloro che lo ascoltano.
Questo è importante perché i sistemi di intelligenza artificiale generativa sono diventati nuove entità con cui comunichiamo.
Se trascorriamo ore ogni giorno a porre domande a una piattaforma di intelligenza artificiale, a scrivere e-mail o a parlare con assistenti vocali, stiamo partecipando a un nuovo tipo di ambiente comunicativo, e gli esseri umani hanno una spiccata capacità di adattarsi ai nuovi ambienti.
Il futuro delle voci basate sull'intelligenza artificiale
Molte aziende tecnologiche stanno già cercando di rendere le voci sintetiche meno meccaniche , introducendo disfluenze e marcatori conversazionali tratti dall'interazione umana.
Con lo sviluppo della robotica e la progressiva interazione con le macchine, le voci sintetiche potrebbero acquisire un ritmo e una prosodia più convincenti. Potrebbero essere in grado di riconoscere quando un ascoltatore ha bisogno di chiarimenti, quando una battuta richiede una pausa o quando l'incertezza di chi parla dovrebbe trasparire nel suo modo di esprimersi.
In alternativa, le caratteristiche meccanicistiche – la voce "senza fiato" del mio amico, la risposta perfettamente strutturata, l'assenza di esitazione – potrebbero arrivare a definire il suono di un modello di intelligenza artificiale generativa: una firma linguistica che funziona come una sorta di filigrana. Potremmo smettere di considerarle difetti e iniziare a trattarle come un registro.
Linguaggio da IA ad IA
Uno sviluppo particolarmente intrigante riguarda ciò che accade quando i sistemi artificiali comunicano tra loro. Nel settembre 2026, una ricerca ha scoperto che agenti di intelligenza artificiale autonomi sviluppavano un vocabolario insolito , metafore ed espressioni codificate in ambienti sperimentali. I ricercatori hanno descritto il linguaggio risultante come difficile da interpretare per gli esseri umani, paragonandolo all'emergere di un linguaggio innovativo nelle comunità umane.
Il linguaggio è stato storicamente plasmato dall'interazione tra gli esseri umani. Le comunità sviluppano nuovi modi di dire o di comunicare, le persone prendono in prestito espressioni le une dalle altre, le fraintendono, le rielaborano e le tramandano.
Ora, in questo ambiente è presente un altro tipo di partecipante. I sistemi sintetici possono generare linguaggio, elaborarlo e interagire con altri sistemi sintetici a una scala e velocità ineguagliabili dagli esseri umani.
L'intelligenza artificiale dovrebbe avere una voce umana o assomigliare all'intelligenza artificiale?
Tornando alla lamentela del mio amico: l'intelligenza artificiale dovrebbe avere una voce simile a quella umana?
Se le voci sintetiche mantengono caratteristiche riconoscibili, gli ascoltatori sanno di avere a che fare con una macchina, e questa consapevolezza può avere un valore. Tuttavia, rendere una voce palesemente artificiale non risolve tutti i problemi.
Una voce sintetica può suonare in modo riconoscibilmente artificiale pur riproducendo stereotipi sociali o presupposti limitati su come dovrebbe suonare un determinato tipo di parlante.
La questione, quindi, non è solo se l'IA suoni umana. È anche quale tipo di linguaggio umano la macchina sia addestrata a rappresentare, quale linguaggio venga considerato come modello e cosa accada a tutto ciò che ne è al di fuori, comprese le voci dei gruppi minoritari . L'ascoltatore deve essere al centro di questo processo di progettazione.
Il futuro dell'intelligenza artificiale – e del linguaggio – dipenderà da come gli esseri umani reagiranno al linguaggio prodotto dalle macchine e da come le interazioni tra esseri umani e macchine continueranno a plasmare la comunicazione. Solo il tempo potrà dirlo.
(Celeste Rodriguez Louro - Professoressa associata di linguistica e direttrice del Laboratorio linguistico presso l'Università dell'Australia Occidentale - su The Conversation del 07/10/2026)