EN
en direct
tag

#inference-locale

Transformers exécute nativement les quants GGUF de llama.cpp

Le 22 septembre 2026, Hugging Face a ajouté à Transformers la prise en charge native des modèles GGUF, le format quantifié de llama.cpp qui alimente Ollama, LM Studio et Jan. Si vous faites tourner des modèles locaux sur Apple Silicon en Python, adoptez `from_pretrained` avec un fichier GGUF et oubliez les conversions maison.

Perplexity lance son agent local sur Windows et exige 24 Go de VRAM

Perplexity porte son agent Portable Computer sur Windows après Linux et macOS, mais le réserve aux cartes NVIDIA RTX dotées d’au moins 24 Go de VRAM. Les tâches simples tournent en local, le modèle bascule vers le cloud quand il en a besoin — et les données sensibles peuvent rester sur la machine.

Tapez au moins deux caractères.

↑ ↓ naviguer ↵ ouvrir esc fermer