Text Generation
PEFT
Safetensors
lora
qwen3.5
qwen3.6
spanish
espanol
chile
fine-tuned
Mixture of Experts
Instructions to use jpalmae/qwen35b-espanol-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use jpalmae/qwen35b-espanol-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.6-35B-A3B") model = PeftModel.from_pretrained(base_model, "jpalmae/qwen35b-espanol-lora") - Notebooks
- Google Colab
- Kaggle
Qwen3.6-35B-A3B — Español Neutro/Chileno 🇨🇱 (LoRA adapter)
Adapter LoRA r=64 (64MB) para Qwen/Qwen3.6-35B-A3B: fine-tune orientado a español neutro con sesgo chileno, eliminando el voseo/modismos rioplatenses que Qwen arrastra al hablar español.
¿Qué contiene?
| Archivo | Descripción |
|---|---|
adapter_model.safetensors |
Pesos LoRA (64MB) |
adapter_config.json |
Config PEFT (r=64, target modules) |
config_merged.json |
Config del modelo ya mergeado |
train_35b_a100.py |
Script de entrenamiento (Trainer directo, A100) |
merge_35b.py |
Script de merge LoRA→bf16 |
Entrenamiento
| Parámetro | Valor |
|---|---|
| Base | Qwen/Qwen3.6-35B-A3B (MoE 35B/3B activos, híbrido Mamba/SSM+atención) |
| Método | LoRA r=64, bf16 |
| Pasos | 750 (corrida de validación) |
| Dataset | 200k ejemplos: 100k C4 filtrado .cl + 100k español neutro, con filtro anti-rioplatense (5,249 ejemplos descartados por voseo/argentismos) |
| Hardware | A100 SXM4 80GB |
| Trainer | transformers.Trainer directo (NO SFTTrainer — el chunked CE de TRL rompe con esta arquitectura MoE) |
| Detalles | gradient_checkpointing + use_reentrant=True, attn_implementation="sdpa", merge con peft 0.15.1 (0.19.x es incompatible con transformers 5.x para el merge) |
Uso
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained(
"Qwen/Qwen3.6-35B-A3B", torch_dtype="bfloat16", device_map="auto",
trust_remote_code=True,
)
model = PeftModel.from_pretrained(base, "jpalmae/qwen35b-espanol-lora")
tok = AutoTokenizer.from_pretrained("Qwen/Qwen3.6-35B-A3B")
Para servir sin GPU grande, usa el GGUF Q4_K_M ya mergeado y parcheado en jpalmae/qwen35b-espanol-gguf — corre a ~169 tok/s en una RTX 3090 con llama.cpp.
Pipeline completo reproducible
train_35b_a100.py→ LoRA (este repo)merge_35b.py→ bf16 mergeado (~65GB)convert_hf_to_gguf.py→ F16 GGUFllama-quantize→ Q4_K_M- Parche binario del header GGUF (
block_count 41→40,nextn_predict_layers 1→0) — obligatorio o llama.cpp falla conmissing tensor 'blk.39.nextn.eh_proj.weight'
Licencia
MIT.
- Downloads last month
- 6
Model tree for jpalmae/qwen35b-espanol-lora
Base model
Qwen/Qwen3.6-35B-A3B