Model builder
Build a task-specific model on top of an open base: pick a base model and a governed dataset, set the LoRA adapter and training config, then export as adapters, a merged model or GGUF.
Unsloth 2.1× faster
Training speed
2.1×
vs. stock HF + PEFT
VRAM used
−68%
11.4 GB peak on one A100
Tokens / sec
4,820
packed sequences
Context length
4× longer
at the same VRAM
Base model
4-bit QLoRA, loaded through Unsloth.
Llama 3.1 8B Instruct
8B · ctx 128k · Llama 3.1
Qwen2.5 7B Instruct
7B · ctx 32k · Apache 2.0
Mistral 7B v0.3
7B · ctx 32k · Apache 2.0
Phi-4 14B
14B · ctx 16k · MIT
Gemma 2 9B
9B · ctx 8k · Gemma
Dataset
Governed training data from the catalog.
kyc-policy-qa
18,420 rows · ShareGPT · 6.1M
onboarding-conversations
42,130 rows · ShareGPT · 14.8M
credit-memo-summaries
7,860 rows · Alpaca · 3.4M
nl2sql-warehouse
12,040 rows · Alpaca · 2.2M
Training curve
teal = train loss · violet = eval loss · onboarding-conversations on Llama 3.1 8B Instruct
Unsloth loader
Generated from the settings on this page.
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
model_name = "unsloth/Meta-Llama-3.1-8B-Instruct",
max_seq_length = 4096,
load_in_4bit = True,
)
model = FastLanguageModel.get_peft_model(
model,
r = 16, lora_alpha = 32, lora_dropout = 0,
target_modules = ["q_proj","k_proj","v_proj","o_proj",
"gate_proj","up_proj","down_proj"],
use_gradient_checkpointing = "unsloth",
random_state = 3407,
)LoRA adapter
Rank and alpha drive capacity vs. overfitting.
lora_alpha32
lora_dropout0
max_seq_length4096
load_in_4bittrue
checkpointingunsloth
q_projk_projv_projo_projgate_projup_projdown_proj
Training
Effective batch 8.
batch_size2
grad_accum4
learning_rate2e-4
schedulerlinear
optimizeradamw_8bit
seed3407
Resource use
One A100 80GB, packed sequences.
VRAM14%
GPU utilisation91%
Dataset consumed100%
Export
Ship the adapter wherever it runs.
LoRA adapters
safetensors · smallest
safetensors · smallest
Merged 16-bit
drop-in replacement
drop-in replacement
GGUF q4_k_m
llama.cpp / Ollama
llama.cpp / Ollama
vLLM runtime
served from RaboAurora Core
served from RaboAurora Core