Saltar al contenido
Código abiertoAvanzado

llama.cpp

llama.cpp es el motor de inferencia ligero en C/C++ que ejecuta LLMs abiertos con eficiencia en CPUs y GPUs de consumo, sirviendo de base a muchas herramientas locales como Ollama y LM Studio. Sus formatos de cuantización GGUF permiten que modelos grandes quepan en hardware modesto sin aceleradores dedicados.

Descripción general

"llama.cpp" es un recurso de tipo "Código abierto" seleccionado por AI Resource Hub, clasificado en la categoría Herramientas y adecuado para estudiantes de nivel Avanzado. Lo proporciona ggml community, se actualizó por última vez el 2026-07-24 y tiene una puntuación editorial de 4.8/5 de nuestro equipo. Haz clic en "Visitar recurso" a la derecha para abrir la página original.

Etiquetas

Local LLMInferenciaGGUF

Características clave

  • Inferencia eficiente en CPU/GPU para modelos GGUF
  • Cuantización para caber en hardware modesto
  • Modo servidor con API compatible con OpenAI

Ventajas

  • +Corre prácticamente en cualquier sitio, sin Python
  • +El motor de referencia sobre el que se apoyan muchas herramientas
  • +El motor de referencia en el que se basan muchas herramientas locales

Desventajas

  • Primero línea de comandos; las GUIs viven en otro lado
  • Primero la línea de comandos; la interfaz la montas tú
  • Los modelos cuantizados cambian algo de calidad por tamaño

Preguntas frecuentes