Qwen3.6-35B-A3B — Español Neutro/Chileno 🇨🇱 (LoRA adapter)

Adapter LoRA r=64 (64MB) para Qwen/Qwen3.6-35B-A3B: fine-tune orientado a español neutro con sesgo chileno, eliminando el voseo/modismos rioplatenses que Qwen arrastra al hablar español.

¿Qué contiene?

Archivo Descripción
adapter_model.safetensors Pesos LoRA (64MB)
adapter_config.json Config PEFT (r=64, target modules)
config_merged.json Config del modelo ya mergeado
train_35b_a100.py Script de entrenamiento (Trainer directo, A100)
merge_35b.py Script de merge LoRA→bf16

Entrenamiento

Parámetro Valor
Base Qwen/Qwen3.6-35B-A3B (MoE 35B/3B activos, híbrido Mamba/SSM+atención)
Método LoRA r=64, bf16
Pasos 750 (corrida de validación)
Dataset 200k ejemplos: 100k C4 filtrado .cl + 100k español neutro, con filtro anti-rioplatense (5,249 ejemplos descartados por voseo/argentismos)
Hardware A100 SXM4 80GB
Trainer transformers.Trainer directo (NO SFTTrainer — el chunked CE de TRL rompe con esta arquitectura MoE)
Detalles gradient_checkpointing + use_reentrant=True, attn_implementation="sdpa", merge con peft 0.15.1 (0.19.x es incompatible con transformers 5.x para el merge)

Uso

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained(
    "Qwen/Qwen3.6-35B-A3B", torch_dtype="bfloat16", device_map="auto",
    trust_remote_code=True,
)
model = PeftModel.from_pretrained(base, "jpalmae/qwen35b-espanol-lora")
tok = AutoTokenizer.from_pretrained("Qwen/Qwen3.6-35B-A3B")

Para servir sin GPU grande, usa el GGUF Q4_K_M ya mergeado y parcheado en jpalmae/qwen35b-espanol-gguf — corre a ~169 tok/s en una RTX 3090 con llama.cpp.

Pipeline completo reproducible

  1. train_35b_a100.py → LoRA (este repo)
  2. merge_35b.py → bf16 mergeado (~65GB)
  3. convert_hf_to_gguf.py → F16 GGUF
  4. llama-quantize → Q4_K_M
  5. Parche binario del header GGUF (block_count 41→40, nextn_predict_layers 1→0) — obligatorio o llama.cpp falla con missing tensor 'blk.39.nextn.eh_proj.weight'

Licencia

MIT.

Downloads last month
6
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for jpalmae/qwen35b-espanol-lora

Adapter
(275)
this model