La voce, senza compromessi. Nulla lascia la tua macchina.
WHO è uno strumento di voice conversion e text-to-speech costruito per il giornalismo. Ventitré lingue, registrazione diretta nell'app, clonazione vocale, tutto elaborato localmente. La storia resta in redazione. La fonte resta protetta.
Converti una registrazione sorgente in una voce target preservando cadenza, intonazione, contorno emotivo. Proteggi l'identità di una fonte, o rendi lo stesso copione in voci diverse.
Dal copione all'audio pronto in ventitré lingue. Prosodia di qualità nativa, controllo su pacing, enfasi e pause. La redazione ottiene una lettura finita in minuti.
Registri direttamente nell'app, applichi conversione o cleanup, esporti. Nessun DAW esterno richiesto, nessun upload. L'intera catena dal microfono al file vive su una sola macchina.
Non servono ore di studio. Con da 30 a 60 secondi di registrazione pulita — ambiente silenzioso, microfono vicino, lettura naturale e continua — WHO genera un voice model personalizzato pronto per conversione e text-to-speech.
La qualità del campione è tutto. Niente rumore di fondo, niente compressione aggressiva, niente riverbero di stanza. Più il segnale è pulito, più il clone preserva timbro, cadenza e intonazione.
Registra direttamente nell'app con Registra preset, oppure importa un file audio dalla tua postazione. Il modello resta sulla macchina: nessun upload in cloud. Ogni preset è un asset della redazione, riutilizzabile su tutti i progetti.
Nel software è inclusa una voce dimostrativa per provare subito conversione e text-to-speech. È concessa solo a scopo demo: non può essere ridistribuita, propagata né utilizzata in contenuti pubblicati. Per il lavoro reale, crea i tuoi preset con voci di cui hai i diritti.
Trascina il file nella zona SOURCE oppure usa Sfoglia. WHO accetta audio e video: dai video estrae automaticamente la traccia audio. Questo è il materiale a cui verrà applicata la nuova voce.
Nella sezione TARGET scegli un preset oppure crea il tuo. Il tempo necessario è poco: bastano da 30 a 60 secondi di parlato pulito — stanza silenziosa, microfono vicino, lettura naturale e continua. Premi Registra preset, leggi, e il modello è pronto da riusare in tutti i progetti.
La voce che ti serve è in un video o in uno streaming? WHO può catturare l'audio in riproduzione sul computer e usarlo come riferimento o come sorgente, senza strumenti esterni.
Puoi registrare sia la voce di riferimento sia la voce da modificare, direttamente dal microfono: registrazione, conversione ed export vivono nella stessa finestra, senza DAW esterni.
Controlla il percorso di output suggerito e premi CONVERT. La barra di avanzamento mostra lo stato dell'elaborazione; alla fine trovi il file pronto, con il watermark di conformità già integrato.
Con Testo in voce scrivi il testo e lo trasformi in voce, in ventitré lingue. Se una parola viene pronunciata male — nomi propri, sigle, termini stranieri — aggiungi i fonemi nel dizionario di pronuncia: da quel momento WHO la leggerà sempre correttamente.
Il text-to-speech accetta parametri di intonazione diversi: più neutra per un notiziario, più espressiva per un podcast. Regola tono, ritmo ed enfasi finché la lettura non suona come la vuoi.
Con il controllo della velocità rallenti l'anteprima dell'intero file o riascolti al rallentatore i passaggi del file generato che vuoi verificare, parola per parola. Il time-stretch integrato può mantenere la velocità scelta anche nell'export.
Il lavoro editoriale ha regole. Le fonti sono riservate. Il materiale pre-pubblicazione è privilegiato. La voce è un dato biometrico — e un dato biometrico caricato su un server estero è un dato biometrico soggetto a giurisdizione estera.
WHO non carica nulla. Ogni modello AI gira interamente sulla workstation — pesi, inferenza, elaborazione. Ogni conversione avviene dietro il firewall della redazione. L'architettura è la conformità.
Una sola eccezione, dichiarata: all'avvio WHO verifica la licenza con una connessione a Confluence Engineers. È l'unica trasmissione — dura pochi secondi. Nessun audio, nessuna voce, nessun contenuto editoriale lascia mai la macchina.
Il Regolamento europeo sull'Intelligenza Artificiale (AI Act, Reg. UE 2024/1689) impone obblighi di trasparenza per i sistemi di IA che generano contenuti sintetici — incluso l'audio. L'articolo 50 richiede che gli output siano contrassegnati in formato machine-readable e rilevabili come artificialmente generati o manipolati.
WHO integra il motore Chatterbox di Resemble AI. Il modello incorpora automaticamente in ogni file generato un watermark digitale Perth — impercettibile all'ascolto, non disattivabile, parte integrante del flusso di sintesi. Non è un'opzione dell'utente: è generato dal modello stesso. Questo marchio rende l'audio riconoscibile come prodotto di sintesi vocale e supporta gli obblighi di marcatura previsti dall'AI Act.
Per le redazioni questo significa che ogni export da WHO porta con sé una firma di provenienza verificabile dagli strumenti di detection. La conformità tecnica è nel prodotto. Chi pubblica contenuti sintetici ha inoltre l'obbligo di disclosure verso il pubblico — la marcatura è a carico di WHO; la dichiarazione editoriale resta responsabilità della testata.
I doppiatori hanno scioperato contro le liberatorie che cedevano la voce «per sempre, in tutto l'universo». I giornalisti si fanno la stessa domanda, a bassa voce: se do la mia voce a un software, poi chi la controlla?
WHO risponde con l'architettura. Il modello vocale è un file sulla vostra macchina — non un account su un server altrui. Ma la tecnologia da sola non basta a creare fiducia: per questo WHO arriva con un modello di accordo, il Patto della Voce, che mette nero su bianco cosa si può fare con quella voce e cosa no.
Un atto dedicato e specifico, non una riga annegata in una liberatoria generica. Chi presta la voce sa esattamente a cosa acconsente.
La voce sintetica legge solo i contenuti concordati — ad esempio gli articoli firmati dallo stesso giornalista. Niente pubblicità, niente terzi.
L'accordo indica su quale macchina risiede il modello e chi può usarlo. Il file è identificato da un'impronta SHA-256 verificabile.
Il consenso è revocabile in ogni momento. A fine rapporto il modello viene cancellato, con attestazione scritta. Un file locale si cancella davvero.
Incluso nel rapporto o pattuito a parte, ma mai «gratis per sempre». La voce ha un valore, e l'accordo lo riconosce.
La voce non alimenta altri modelli e non viene ceduta a terzi. Se il modello viene rigenerato, l'impronta cambia e la verifica lo rivela.
Ogni audio è dichiarato sintetico, in linea con l'art. 50 dell'AI Act e la legge 132/2025. Il watermark Perth è integrato in ogni export.
La redazione tiene traccia di chi ha prestato la voce, per quali contenuti e fino a quando. Trasparenza verso chi ha dato fiducia.
Un modello di accordo pronto da adattare: quindici articoli e quattro allegati — scheda tecnica con impronta del modello, modulo di revoca, verbale di cancellazione, registro degli usi. È una bozza da far validare dal vostro legale prima della firma: non costituisce consulenza legale.
Anonimizza l'intervista a una fonte senza perdere la verità emotiva di ciò che è stato detto. La voice conversion preserva ciò che conta e sostituisce ciò che identifica.
Pubblica la stessa inchiesta come audio in cinque lingue la mattina dell'uscita. Il copione è tuo, la voce è tua, il timing è tuo.
Trasforma ogni articolo pubblicato in una versione audio automaticamente. Ventitré lingue, niente prezzo per carattere, niente limiti API.
| WHO | ElevenLabs | Murf AI | OpenAI TTS | Google Cloud TTS | Azure Speech | Amazon Polly | |
|---|---|---|---|---|---|---|---|
| Elaborazione | 100% locale, sulla tua workstation | Cloud | Cloud | Cloud (API) | Cloud (API) | Cloud (API) | Cloud (API) |
| Limiti di generazione | Nessuno — uso illimitato | A crediti — circa 100 minuti al mese col piano da $22 | A ore — 24 ore l'anno col piano Creator | A consumo — circa $0,015 al minuto | A consumo — pagamento per carattere | A consumo — pagamento per carattere | A consumo — pagamento per carattere |
| Prezzo | €9,99/mese · €95,99/anno · €199 una tantum | Da $5 a $330/mese in base ai crediti | Da $19 a $99/mese | Pay-per-use: cresce con l'uso | Da $4 a $160 per 1M di caratteri, secondo la voce | Da $15 a $22 per 1M di caratteri | Da $4,80 a $100 per 1M di caratteri, secondo la voce |
| Licenza perpetua | Sì — €199, per sempre | No | No | No | No | No | No |
| Voice cloning | Incluso e illimitato, in locale, da 30–60 secondi di audio | Nei piani a pagamento, elaborato in cloud | Solo piano Enterprise | Non disponibile | Accesso limitato, su approvazione | Su approvazione, con costi extra di training | Solo progetti su misura (Brand Voice) |
| Uso offline | Sì — solo verifica licenza all'avvio | No | No | No | No | No | No |
| Privacy e giurisdizione | Voce e contenuti non lasciano mai la macchina | Audio caricato su server (USA) | Audio caricato su server (USA) | Audio caricato su server (USA) | Audio caricato su server (USA) | Audio caricato su server (USA) | Audio caricato su server (USA) |
| Watermark AI Act | Perth integrato in ogni export | A discrezione del fornitore | A discrezione del fornitore | A discrezione del fornitore | A discrezione del fornitore | A discrezione del fornitore | A discrezione del fornitore |
Nota. Prezzi e caratteristiche rilevati dai listini pubblici dei produttori a giugno 2026 e soggetti a variazione. ElevenLabs, Murf AI e OpenAI sono marchi dei rispettivi proprietari, citati esclusivamente a scopo comparativo.
Solo verifica licenza all'avvio — nient'altro lascia la tua macchina.
La responsabilità legale dell'utilizzo del voice cloning ricade sull'utilizzatore e sulla sua organizzazione — giornalista, redazione, editore, azienda — non su Confluence Engineers in qualità di produttore del software.
Chi usa WHO si impegna a non impersonare persone reali senza il loro consenso esplicito, a non produrre contenuti fuorvianti o fraudolenti e a rispettare le leggi locali su diritti dell'immagine e della voce, il GDPR, l'AI Act e ogni vincolo contrattuale con talent, fonti e collaboratori.
Il file vocale dimostrativo incluso nel software è fornito al solo scopo di prova: non può essere propagato, ridistribuito né impiegato in produzioni pubblicate, in nessuna forma.
Confluence Engineers fornisce WHO così com'è, senza garanzie. Il software è uno strumento neutro: come viene impiegato — consenso delle persone clonate, disclosure verso il pubblico, veridicità del contenuto, conformità alle policy editoriali — è decisione e obbligo di chi lo usa in redazione.
Prima di pubblicare audio sintetico, la testata dovrebbe definire linee guida interne, procedure di compliance e, se necessario, pareri legali. WHO non sostituisce il giudizio editoriale né la consulenza legale della vostra organizzazione.
Disclaimer. Le informazioni su questa pagina hanno scopo informativo e non costituiscono consulenza legale. Per valutazioni specifiche sulla conformità dell'AI Act, del GDPR o della normativa nazionale in materia di deepfake e diritti della personalità, rivolgersi al proprio consulente legale.