Liquid LFM-2.5-1.2B-Thinking: Novità e Guida completa
Local AI per tutti!

Liquid AI ha rilasciato LFM2.5-1.2B-Thinking, un modello da 1,2 miliardi di parametri orientato all'esecuzione locale. La documentazione del rilascio indica un'occupazione di circa 900 MB in una configurazione specifica; memoria, latenza e possibilità di funzionamento offline dipendono da quantizzazione e hardware.
Ragionamento e prestazioni
Rispetto alle varianti standard basate su istruzioni, il modello è descritto come capace di generare passaggi intermedi prima dell'output finale. Il benchmark MATH-500 è riportato a 88, contro 63 della versione Instruct; il confronto va letto usando la stessa versione del dataset, lo stesso prompt e la stessa procedura di valutazione.
Prestazioni sui dispositivi locali
L'architettura è descritta per processori consumer, incluse NPU Qualcomm Snapdragon, chip Apple Silicon e AMD Ryzen. I test tecnici riportano picchi superiori a 4.000 token al secondo in fase di prefill su hardware mobile specifico; questo dato non rappresenta una prestazione generale e non coincide necessariamente con la velocità di generazione. Il supporto a contesti fino a 32k token va verificato nel runtime scelto.
Addestramento ibrido
Secondo la descrizione del rilascio, l'addestramento combina fine-tuning supervisionato su dati sintetici e Reinforcement Learning. L'azienda riporta inoltre una riduzione del tasso di ripetizione dal 15% a meno dello 0,4% dopo interventi mirati contro il doom looping; il significato del dato dipende dalla metrica e dal set di valutazione usati.
Distribuzione e compatibilità dei runtime
LFM2.5-1.2B-Thinking è distribuito come modello "open-weight" ed è indicato per l'uso con llama.cpp, MLX, vLLM e ONNX Runtime. La compatibilità effettiva e le ottimizzazioni per le NPU dipendono dalle versioni dei runtime, dai formati dei pesi e dagli accordi di distribuzione.