ElevenLabs Scribe v2: API per trascrizione Speech-to-Text

Oltre 90 lingue supportate con accuratezza state-of-art

ElevenLabs Scribe v2: API per trascrizione Speech-to-Text
Condividi:

ElevenLabs, nota soprattutto per i prodotti Text-to-Speech (TTS), ha presentato Scribe v2, una famiglia di modelli Speech-to-Text (STT) per trascrizione generale e audio in tempo reale. Il rilascio si colloca nello stesso spazio di strumenti come Whisper di OpenAI, Gemini e Deepgram.

Scribe v2 si concentra sulla latenza nelle applicazioni in tempo reale e sull'accuratezza in scenari rumorosi o multilingue.

Scribe v2: modelli e casi d'uso

Scribe v2 è disponibile in due varianti, pensate per esigenze diverse:

  • Scribe v2: il modello general purpose per trascrizione e analisi di contenuti audio/video, quando la latenza è meno importante del controllo dell'output.
  • Scribe v2 Realtime: progettato per lo streaming e le applicazioni interattive. ElevenLabs dichiara una latenza inferiore ai 150 ms in condizioni specifiche; il valore effettivo dipende da rete, formato e infrastruttura.

Scribe v2: caratteristiche tecniche

Precisione e "negative latency"

Il modello Realtime utilizza un meccanismo predittivo che ElevenLabs descrive come "negative latency", con l'obiettivo di ridurre il tempo di risposta percepito. Nei benchmark interni, tra cui FLEURS, l'azienda dichiara un Word Error Rate (WER) inferiore rispetto a Gemini Flash 2.5 e GPT-4o Mini in alcune condizioni; il confronto va verificato usando lo stesso audio e la stessa procedura.

Speaker diarization e audio tagging

Tra le funzionalità dichiarate ci sono la Speaker Diarization, con supporto fino a 48 interlocutori in una singola traccia, e il Dynamic Audio Tagging, che può annotare eventi sonori come [laughter], [footsteps] o [applause]. Accuratezza e numero di interlocutori distinguibili dipendono dalla qualità dell'audio.

Multilinguismo e keyterm prompting

Il supporto copre oltre 90 lingue, inclusa l'italiano. Una funzione utile in ambito professionale è il Keyterm Prompting: gli sviluppatori possono passare al modello fino a 100 termini specifici, come nomi propri, acronimi tecnici e gergo aziendale, per orientare la trascrizione in un dominio preciso.

Scribe v2: integrazione e sicurezza

L'integrazione avviene tramite API REST o WebSocket per lo streaming in tempo reale. ElevenLabs fornisce SDK ufficiali per Python e Node.js, con supporto ai formati audio PCM e μ-law.

Esempio di codice Python:

import os
from elevenlabs.client import ElevenLabs

client = ElevenLabs(
    api_key=os.getenv("ELEVENLABS_API_KEY")
)

def transcribe_audio(file_path):
    # Verifica esistenza file
    if not os.path.exists(file_path):
        print(f"Errore: Il file {file_path} non esiste.")
        return

    print(f"Trascrizione in corso per: {file_path}...")
    
    with open(file_path, "rb") as audio_file:
        transcription = client.speech_to_text.convert(
            file=audio_file,
            # Specifichiamo esplicitamente il modello Scribe v2
            model_id="scribe_v2", 
            # Abilita l'identificazione di eventi sonori (es. [laughter])
            tag_audio_events=True,
            # Abilita la distinzione tra i parlanti
            diarize=True,
            # Opzionale: timestamp per ogni parola
            timestamps_granularity="word"
        )

    # Output del risultato
    print("\n--- Risultato Trascrizione ---\n")
    print(transcription.text)
    
    # Esempio di accesso ai metadati (se disponibili nella risposta strutturata)
    if hasattr(transcription, 'language_code'):
        print(f"\nLingua rilevata: {transcription.language_code}")

# Esegui la funzione
if __name__ == "__main__":
    # Sostituisci con il path del tuo file audio
    transcribe_audio("meeting_recording.mp3")

Link alla doc ufficiale.

La documentazione commerciale cita supporto a requisiti e standard come SOC 2, GDPR e HIPAA; l'applicabilità dipende da piano, endpoint, regione e contratto. Anche la Zero Retention Mode va verificata nella documentazione e nelle condizioni del piano scelto prima di usarla con dati sensibili.

Questo video mostra la demo ufficiale di lancio, evidenziando la velocità di risposta in tempo reale e la capacità del modello di gestire interruzioni e cambi di lingua fluidi. Scribe v2 Realtime Launch

Mauro Sciancalepore - Notizie AI, Deep Learning e Ricerca

Resta aggiornato sulle ultime notizie di Intelligenza Artificiale e Deep Learning. Approfondimenti completi sulla ricerca e stato dell'arte.

© 2026 mauroscia.it
Tutti i diritti riservati.