LocalAI setup
Install LocalAI with Docker and define models under models/ as YAML files. Each file’s name becomes the OpenAI model parameter clients pass.
Hub: LocalAI.
Docker run
docker run -p 8080:8080 \
--mount type=bind,src=$PWD/models,dst=/models \
--mount type=bind,src=$PWD/config,dst=/config \
localai/localai:latestMount paths:
| Path | Purpose |
|---|---|
/models | YAML configs + weight files |
/config | Optional global config |
First model (llama.cpp backend)
# models/llama3.yaml
name: llama3
backend: llama-cpp
parameters:
model: models/llama-3.2-8b-instruct.Q4_K_M.gguf
context_size: 8192
f16: truecurl http://localhost:8080/v1/modelsMultiple models
Add separate YAML files per capability — route cheap models for classify, larger for codegen:
# models/codellama.yaml
name: codellama
backend: llama-cpp
parameters:
model: models/codellama-13b.Q5_K_M.gguf
gpu_layers: 99Backend selection details: Backends.
Warm-up and ops
| Issue | Fix |
|---|---|
| Slow first request | Model load — send warm-up request |
| Model not found | Client model must match YAML name exactly |
| OOM | Reduce concurrent backends or dedicated nodes |
Related
Last updated on