Un MoE de 35B a más de 45 tok/s en una GPU de $170: mi experiencia con FreeToken y Qwen3.6
Crónica de un día empujando una NVIDIA Quadro RTX 4000 de 8 GB con FreeToken y Qwen3.6-35B-A3B: parches para Turing, pruebas de quants, trampas del harness y la decisión pragmática final.