El objetivo de TakeOnMe 3.8 Flash Next nace de una necesidad práctica: disponer de un único modelo local que pudiera afrontar razonamiento, programación, trabajo de terminal y uso de herramientas sin tener que alternar entre varios modelos con tiempos de carga elevados.
En vez de construir un modelo desde cero, el punto de partida fue Qwen3.8-Flash-Next, una arquitectura especialmente interesante para inferencia local por su contexto largo, su sistema de embeddings n-gram y su orientación multimodal. Sobre esa base se combinaron dos derivados que destacaban en capacidades diferentes.
Qué aporta cada modelo
Swift 1.5 Qwen3.8-Flash-Next aporta un enfoque centrado en la eficiencia del razonamiento. Su objetivo es reducir el sobrepensamiento y la cantidad de tokens de razonamiento sin perder demasiada capacidad de resolución. Tinfield 1, por otro lado, está orientado a programación, uso de terminal, trabajo prolongado sobre repositorios y llamadas a herramientas.
La idea de TakeOnMe fue combinar ambos enfoques en una sola variante equilibrada.
La fusión de pesos
La fusión se realizó con una mezcla lineal normalizada de los pesos:
W_takeonme = 0,60 × W_swift + 0,40 × W_tinfield
La proporción del 60 % para Swift busca conservar su contribución a un razonamiento más contenido y eficiente. El 40 % de Tinfield incorpora una parte significativa de su orientación hacia programación, terminal y flujos agentic.
Los tres checkpoints —Qwen3.8-Flash-Next, Swift 1.5 y Tinfield 1— compartían la misma estructura: mismos nombres de tensor, mismas formas, mismos tipos de datos y la misma distribución de shards. Esto permitió verificar compatibilidad antes de hacer la mezcla.
La fusión se realizó tensor a tensor en BF16. Como Swift y Tinfield son derivados del mismo modelo base, esta operación equivale a combinar sus diferencias respecto a Qwen con pesos 60/40. No se sumaron ambos deltas completos, porque eso habría incrementado el riesgo de producir un modelo inestable o impredecible.
Para el tokenizer y el chat template se mantuvo la variante de Tinfield. Es compatible con la base Qwen y resultaba especialmente adecuada para tool calling.
El resultado BF16 se convirtió posteriormente a GGUF F16, conservando esa versión como artefacto de trabajo para futuras recuantizaciones o posibles experimentos de LoRA. La variante publicada no es un fine-tuning adicional ni un LoRA: es una fusión de pesos seguida de una cuantización.
Cuantización mixta Q4/Q8
La cuantización se diseñó para mantener un equilibrio entre memoria, calidad y uso real en hardware local. El modelo principal usa un perfil mixto de cuantización Q4 inspirado en una configuración local de Tinfield, pero no todo se redujo a Q4.
Los tensores más sensibles se mantuvieron en Q8_0:
per_layer_token_embd.weight
token_embd.weight
output.weight
Esto incluye la tabla de n-grams, los embeddings de token y la salida del modelo. Mantener estas partes en Q8 ayuda a proteger capacidades importantes que podrían degradarse más con una cuantización agresiva.
Además, los embeddings tradicionales y los n-grams se descargan a memoria RAM del sistema en lugar de ocupar VRAM. Esto permite reservar la VRAM de las GPU para el resto de las capas del transformer y hace viable el uso de un modelo de este tamaño en una configuración multi-GPU local.
Para mejorar la cuantización se utilizó una matriz de importancia, o imatrix, procedente de una cuantización de Qwen3.8-Flash-Next realizada por Unsloth. La imatrix ayuda al cuantizador a decidir qué valores son más importantes durante la reducción de precisión.
Es importante matizar que la matriz de importancia no se calculó específicamente sobre la fusión Swift/Tinfield. Por tanto, es una aproximación útil, no una garantía de mejora medida. Por este motivo, TakeOnMe se mantiene como una variante experimental: la experiencia de uso es positiva, pero las mejoras exactas frente a otros modelos deben medirse con una batería de evaluación reproducible.
Visión y projector F16
También se preparó un projector de visión F16. En lugar de reutilizar directamente un projector de otro derivado, se convirtió desde el checkpoint oficial Qwen3.8-Flash-Next utilizando llama.cpp. El archivo resultante contiene 334 tensores de visión y se ha probado correctamente en uso multimodal local.
Configuración de pruebas locales
- CPU: AMD Ryzen 9 7950X3D
- RAM: 94,99 GB
- GPU: 2× NVIDIA CMP 170HX (64 GiB + 40 GiB = 104 GiB VRAM)
El modelo se sirve mediante llama.cpp con reparto por capas entre ambas GPU, utilizando una división 64,40. La configuración probada usa contexto de 348.160 tokens con YaRN, flash attention, caché KV en Q8 y offload de los embeddings de token y n-grams a CPU.
También se utiliza el chat template Jinja compatible con Qwen, razonamiento habilitado con esfuerzo bajo y un presupuesto de razonamiento de 16.384 tokens. Estos parámetros no son requisitos mínimos: son una configuración de referencia probada sobre este hardware concreto. En otras máquinas deberán ajustarse el contexto, los tamaños de batch, el reparto de GPU y las opciones de caché.
Resultados en uso real
En uso local real, TakeOnMe ha resuelto satisfactoriamente la gran mayoría de las tareas de programación planteadas. En algunos casos concretos, el resultado fue mejor que el obtenido con GPT-5.6 Sol. En otros, necesitó más indicaciones o una descomposición más clara de la tarea para alcanzar un buen resultado.
Estas observaciones son cualitativas y proceden de uso real, no de un benchmark controlado. No sería correcto atribuir a TakeOnMe las puntuaciones de Swift, Tinfield o Qwen sin ejecutar las mismas evaluaciones sobre esta fusión exacta.
Respecto al exceso de razonamiento, la experiencia práctica es positiva. Frente al comportamiento de Qwen3.8-Flash-Next original, TakeOnMe mantiene un nivel de razonamiento más contenido y usable en tareas reales. Esto sugiere que la contribución de Swift sigue presente después de la fusión, aunque esta conclusión deberá validarse con mediciones de tokens, latencia y tasa de éxito en tareas equivalentes.
Distribución y licencias
TakeOnMe 3.8 Flash Next se publica en formato GGUF dividido en cinco partes para facilitar su distribución en Hugging Face. Para usarlo con llama.cpp es necesario descargar todas las partes en el mismo directorio e indicar el primer archivo; llama.cpp detectará automáticamente las partes restantes.
El repositorio también incluye el projector F16, el manifiesto de fusión, las licencias y los avisos de atribución correspondientes. El modelo está disponible en:
Pedro-TakeOnMe/TakeOnMe-Qwen3.8-Flash-Next-GGUF
TakeOnMe 3.8 Flash Next es una fusión comunitaria experimental basada en Qwen3.8-Flash-Next. Combina un 60 % de Swift 1.5 y un 40 % de Tinfield 1. No es un modelo oficial de Qwen, UkisAI ni Bad Theory Labs, y su publicación respeta las condiciones aplicables de Swift Open License v1.0 y Qwen Community License 1.0.
Próximos pasos
El siguiente paso será crear una evaluación A/B reproducible frente a las variantes originales y construir un corpus propio de casos reales de programación, terminal y herramientas. Si ese proceso demuestra una mejora medible, la siguiente evolución natural será un LoRA conservador sobre el checkpoint fusionado BF16, manteniendo la identidad de TakeOnMe y reforzando las capacidades que mejor encajen con el uso real.