Modelos del clúster.
Modelos de la comunidad. A todos se accede con la misma API compatible con
OpenAI y la misma base URL.
glm5.3 - 753B MoE
generación de texto multimodal y chat · coding agéntico
Tier premium: solo se puede llamar con una key de la membresía premium GLM 5.3. Modelo MoE de ~753B parámetros, enfocado a coding y a tareas agénticas de largo recorrido. Contexto de 1M tokens. Multimodal: acepta imágenes, audio y vídeo además de texto. Tool calling y razonamiento (emite una traza de razonamiento). Cuota de 3.000M tokens por miembro, y el contador vuelve a cero cuando empieza tu periodo de facturación. Además tiene un tope de 400M tokens por ventana móvil de 4h, que es el límite con el que topa antes una sesión intensiva de agente de código.
- Tipo
- MoE (~753B total)
- Cuantización
- NVFP4
- Atención
- Sparse attention
- Contexto
- 1M tokens
- Modalidades de entrada
- texto · imagen · audio · vídeo
- Modalidades de salida
- texto
- Cuota / periodo de facturación
- 3.000M tokens / miembro
- Ventana móvil de 4h
- 400M tokens
capacidades
- Tool calling (function calling)
- Modo razonamiento (traza de razonamiento)
- Visión (entrada de imagen)
- Audio (entrada de audio)
- Vídeo (entrada de vídeo)
- Coding y tareas agénticas de largo recorrido
- Contexto de 1M tokens
- Generación en streaming (SSE)
- Requiere el tier premium GLM 5.3
deepseek-v4-flash - 305B MoE
generación de texto, chat y visión
Modelo MoE de 305B parámetros, servido en su variante Vision-Exp: acepta imágenes de entrada. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 3B tokens al mes por miembro. Salida estructurada: response_format json_object es compatible (el prompt debe contener la palabra JSON; si no, se rechaza con un 400), json_schema no y se rechaza con un 400. json_object solo garantiza JSON sintácticamente válido, no su forma: describe el esquema en el prompt. Para salida restringida a un esquema, usa qwen3.6 o gemma4, donde json_schema con strict restringe campos, tipos y claves obligatorias; o, en este modelo, fuerza una única herramienta de tipo función cuyo parameters sea tu esquema (ver Ejemplos). Un max_tokens por debajo de 16384 se sube a 16384 para que quepa el razonamiento, así que un prompt a menos de 16384 tokens de la ventana de 1.048.576 se rechaza con un 400 aunque pidas un max_tokens pequeño (normalmente Context length exceeded, a veces un Invalid request genérico).
- Tipo
- MoE (305B total)
- Cuantización
- FP8
- Contexto
- 1M tokens
- Modalidades de entrada
- texto · imagen
- Modalidades de salida
- texto
- Cuota mensual
- 3B tokens / miembro
capacidades
- Tool calling
- Modo razonamiento
- Visión (entrada de imagen)
- Modo JSON (
json_object, el prompt debe mencionar JSON) ·json_schemano soportado (400) - Contexto de 1M tokens
- Generación en streaming (SSE)
glm5.3-flash - 320B-18B
generación de texto y chat multimodal
Modelo MoE de 320B parámetros (18B activos), multimodal de forma nativa, con tool calling y razonamiento. Contexto de 1M tokens. Cuota de 2B tokens al mes por miembro. Licencia MIT.
- Tipo
- MoE (320B total · 18B activos)
- Cuantización
- FP8
- Contexto
- 1M tokens
- Modalidades de entrada
- texto · imagen
- Modalidades de salida
- texto
- Cuota mensual
- 2B tokens / miembro
- Licencia
- MIT
capacidades
- Tool calling (function calling)
- Modo razonamiento
- Visión (entrada de imagen)
- Contexto de 1M tokens
- Generación en streaming (SSE)
qwen3.8-flash - 125B-6B
generación de texto, chat y visión
Modelo MoE de 125B parámetros (6B activos), multimodal con visión, tool calling y razonamiento activado por defecto. Contexto de 1M tokens (1.048.576 tokens). Cuota de 500M tokens al mes por miembro.
- Tipo
- MoE (125B total · 6B activos)
- Contexto
- 1M tokens
- Respuesta máxima
- 131K tokens
- Modalidades de entrada
- texto · imagen
- Modalidades de salida
- texto
- Cuota mensual
- 500M tokens / miembro
- Licencia
- qwen-community-1.0
capacidades
- Tool calling (formato XML)
- Modo razonamiento (activado por defecto)
- Visión (entrada de imagen)
- Contexto de 1M tokens
- Generación en streaming (SSE)
mimo-v2.6-flash - omnimodal
omnimodal: texto, visión y audio
El Xiaomi MiMo más nuevo, omnimodal de forma nativa con entrada de visión y audio. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 1.0B tokens al mes por miembro.
- Contexto
- 1M tokens
- Modalidades de entrada
- texto · imagen · audio
- Modalidades de salida
- texto
- Cuota mensual
- 1.0B tokens / miembro
capacidades
- Tool calling (function calling)
- Modo razonamiento (se recomienda
max_tokens ≥ 300) - Visión (entrada de imagen)
- Audio (entrada de audio)
- Contexto de 1M tokens
- Generación en streaming (SSE)
gemma4 - 26B-A4B
generación de texto y chat
Modelo MoE de 26B parámetros (4B activos), multimodal con visión. Tool calling y razonamiento.
- Tipo
- MoE (26B total · 4B activos)
- Cuantización
- FP8
- Contexto
- 262K tokens
- Muestreo
- temp=0.6, top_p=0.95
- Razonamiento
- reasoning_config={}
capacidades
- Tool calling (formato XML)
- Modo razonamiento
- Multimodal (visión / imágenes)
- Generación en streaming (SSE)
qwen3.6 - 35B-A3B
generación de texto y chat
La generación anterior. MoE de 35B parámetros, multimodal, con tool calling y razonamiento. Sigue respondiendo para que las configuraciones que lo nombran no se rompan, pero hoy se empieza por deepseek-v4-flash.
- Tipo
- MoE (35B total)
- Activos por token
- 3B
- Cuantización
- FP8
- Contexto
- 262K tokens
- Decodificación especulativa
- MTP → ~2x de rendimiento
- Muestreo
- temp=0.6, top_p=0.95
- Razonamiento
- reasoning_config={}
capacidades
- Tool calling (formato XML)
- Modo razonamiento
- Multimodal (visión / imágenes)
- Generación en streaming (SSE)
qwen3-embedding - 8B
embeddings vectoriales
Modelo de embeddings vectoriales. Puntuación MMTEB de 70.58, entre los mejores modelos abiertos. Admite más de 100 idiomas, incluidos el español y el código.
- Dimensión
- 4096
- Precisión
- Float32 (CPU)
- RPM
- 60
- Tamaño de lote
- 32
casos de uso
- Similitud entre idiomas (ES↔EN: 0.915)
- Búsqueda semántica
- Clasificación de texto
- RAG / recuperación aumentada
rerank - Qwen3-Reranker-8B
reordenado semántico
Modelo de reordenado de 8B parámetros (BF16). Reordena una lista de documentos por relevancia frente a una consulta. Completa el stack de RAG junto a qwen3-embedding: primero recuperas los top-K con embeddings y después reordenas para ganar precisión. Admite más de 100 idiomas, incluidos el español, la recuperación de código y la búsqueda entre idiomas. De los mejores en los benchmarks de reranking de MTEB.
- Parámetros
- 8B
- Precisión
- BF16
- Endpoints
- /v1/rerank · /v2/rerank
- Idiomas
- 100+
casos de uso
- Reordenado en pipelines de RAG (embedding → rerank → LLM)
- Búsqueda entre idiomas (ES↔EN, etc.)
- Recuperación de código
- Puntuación de relevancia consulta-documento
kokoro - v1.0
texto a voz
TTS de 82M parámetros con 67 packs de voces. Latencia por debajo del segundo en CPU.
- Latencia
- < 1s
- Parámetros
- 82M
- RPM
- 15
voces disponibles
- af_heart · inglés (femenina)
- ef_dora · español (femenina)
- em_alex · español (masculina)
- 67 packs de voces en total (ver la lista completa)
whisper - large-v3
voz a texto
STT en CPU con CTranslate2 e INT8. Aproximadamente 1x tiempo real. Más de 99 idiomas.
- Tamaño
- ~3 GB (INT8)
- WER ES
- ~3.2%
- RPM
- 10
capacidades
- Transcripción de audio a texto
- Más de 99 idiomas
- Detección automática de idioma
- API compatible con OpenAI
limitaciones conocidas
- Tamaño máximo de fichero: 25 MB
- Tamaño máximo por petición. Los formatos comprimidos (OGG/Opus, MP3) aprovechan mucho mejor este límite que un WAV sin comprimir.
- Timeout: audios de más de 2 minutos
- Whisper procesa en CPU a aproximadamente 1x tiempo real. Con audios de más de 2 minutos, el proxy puede devolver un error
524(timeout) antes de que termine la transcripción. Usa formatos comprimidos como OGG/Opus y parte los ficheros largos en tramos de 2 minutos o menos para evitarlo. - Formatos recomendados
OGG/OpusyMP3: ficheros más pequeños con la misma calidad de transcripción. Un audio de 60 minutos en OGG/Opus a 48 kbps ocupa unos 20 MB frente a los ~550 MB del WAV.
flux-2-klein
generación de imágenes
Modelo de difusión FLUX para texto a imagen e imagen a imagen. Compatible con la API de Images de OpenAI (/v1/images/generations y /v1/images/edits). Requiere membresía del tier de inferencia.
- Tipo
- Difusión (FLUX)
- Modalidades
- texto→imagen · imagen→imagen
- Resolución
- 256 a 1536 px (múltiplos de 16)
- Imágenes / petición
- 1 a 4 (n)
- Cuota mensual
- 100 peticiones / miembro
capacidades
- Texto a imagen (
/v1/images/generations) - Imagen a imagen con hasta 4 referencias (
/v1/images/edits) - Salida como URL temporal (R2, ~60 min) o base64
- Reproducibilidad con
seedy control deguidance
qwen-image-2.1
generación de imágenes
Modelo de imagen Qwen para texto a imagen con buena adherencia al prompt y texto legible dentro de la imagen. Compatible con la API de Images de OpenAI (/v1/images/generations). Requiere membresía del tier de inferencia.
- Tipo
- Difusión (Qwen-Image)
- Modalidades
- texto→imagen
- Resolución
- 512–1280 px (múltiplos de 16)
- Imágenes / petición
- 1–4 (n)
- Cuota mensual
- 100 peticiones / miembro (compartidas con flux-2-klein)
capacidades
- Texto a imagen (
/v1/images/generations) - Salida como URL temporal (R2, ~60 min) o base64
- Reproducibilidad vía
seed(0–2147483647)
Controlar el razonamiento.
Todos los modelos de chat de arriba razonan antes de responder, y el
razonamiento llega separado de la respuesta, en message.reasoning_content.
Cuánto puede pensar cada modelo se elige por petición con el parámetro
reasoning_effort, y cada modelo lo aplica distinto: la tabla es el contrato.
Un valor que un modelo no puede aplicar nunca es un error.
| Modelo | valores de reasoning_effort | Qué hace |
|---|---|---|
glm5.3 · glm5.3-flash | low, medium, high, max | Control total. Valores más altos dejan que el modelo razone más antes de responder; max es el más profundo. |
qwen3.6 | none, minimal, low, medium, high, max | none y minimal se saltan por completo la fase de razonamiento. Los otros cuatro la acotan: low 2.048, medium 8.192, high 16.384, max 32.768 tokens. |
gemma4 | none, minimal, low, medium, high, max | Igual que qwen3.6: apagado, o un presupuesto de razonamiento entre 2.048 y 32.768 tokens. |
deepseek-v4-flash | cualquier valor (sin efecto) | El modelo decide por petición cuánto razona; el parámetro nunca cambia eso. |
qwen3.8-flash · mimo-v2.6-flash | aceptado, profundidad no ajustable | El parámetro se acepta y nunca se rechaza, pero estos modelos gestionan su propia profundidad de razonamiento. |
Sin parámetro, cada modelo usa su propio valor por defecto (razonamiento
activo en qwen3.6 y gemma4, con presupuesto de 16.384 tokens). Más
razonamiento cuesta latencia y cuenta dentro de max_tokens; nunca cuesta
configuración adicional.
curl https://api.nan.builders/v1/chat/completions \
-H "Authorization: Bearer $NAN_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm5.3-flash",
"reasoning_effort": "low",
"messages": [{"role": "user", "content": "Write a one-line summary of the CAP theorem."}]
}'
Límite de stream solo-razonamiento.
Los prompts que exigen mucho razonamiento pueden dejar al modelo pensando
mucho tiempo antes de escribir nada. Cuando un turno en streaming produjo
solo razonamiento — sin content ni tool calls — durante 420 segundos,
la plataforma cierra el turno en lugar de dejarlo correr hacia un callejón
sin salida. Un turno que demuestra que está pensando — ya produjo más de
45.000 caracteres de razonamiento — tiene hasta 600 segundos. El
presupuesto de caracteres de razonamiento también escala con el tamaño de
tu prompt: unos 150.000 caracteres de margen más la mitad del tamaño del
prompt en caracteres, con un tope de 300.000. Cuando la plataforma cierra
el turno recibís finish_reason: "length" sobre un delta vacío, seguido de
un chunk de usage.
Ese chunk de usage es una estimación de lo que consumió el intento hasta el
corte (tokens de prompt y de razonamiento), marcada con
"estimated": true, "billed": false — los turnos cerrados así no se cobran
de tu cuota — y lleva un marcador nan_truncation para que los clientes
puedan distinguir este cierre de un corte real por longitud de contexto.
Pedilo con stream_options: {"include_usage": true}.
Dos cosas que conviene saber:
- El límite no acota tu output. El primer token visible de contenido o cualquier tool call lo desarma por el resto del turno: las respuestas que escriben sobre la marcha nunca se cortan, por largas que sean.
- Si un turno se cierra así, el modelo seguía planificando cuando tocó el
techo. Bajá
reasoning_effortdonde el modelo lo soporte (tabla de arriba), o reestructurá el prompt para que empiece a escribir temprano.
El límite existe para acotar un modo de fallo conocido de los modelos con thinking: a veces planifican sin converger durante 10–25 minutos y queman todo su presupuesto de output sin output visible. Los topes están por encima de las trazas de razonamiento de los turnos sanos que convergen en nuestro tráfico de producción, y solo se endurecen cuando un stream está atascado.
Límites de peticiones
límites por API key
- Peticiones / min
- 60 rpm
- Peticiones en paralelo
- por modelo — ver los límites por modelo abajo
- En todos los modelos
- 7 (plan base) · 10 (plan premium) peticiones simultáneas por key
peticiones concurrentes por modelo
La concurrencia se aplica por modelo, no por API key.
- glm5.3
- 7 (plan base) · 10 (plan premium)
- glm5.3-flash
- 7 (plan base) · 10 (plan premium)
- deepseek-v4-flash
- 7 (plan base) · 10 (plan premium)
- qwen3.8-flash
- 7 (plan base) · 10 (plan premium)
- mimo-v2.6-flash
- 5
- qwen3.6
- 5
- gemma4
- 5
Los endpoints de audio, embeddings y rerank no tienen límite de concurrencia.
glm5.3 · límites del tier premium
- Ventana móvil de 4h
- 400M tokens
- Cuota / periodo de facturación
- 3.000M tokens
- Contexto
- 1M tokens
- Peticiones concurrentes
- 10
400M tokens por ventana móvil de 4 horas es el límite con el que topa antes una sesión intensiva de agente de código, mucho antes que la cuota. Cuando lo alcanzas, las peticiones a glm5.3 se rechazan hasta que la ventana avanza: es una ventana móvil, no un reinicio diario. El contador de la cuota vuelve a cero cuando empieza tu periodo de facturación, y si subes de plan a mitad de periodo esa primera cuota se prorratea a la parte del periodo que has pagado.
tokens / min por modelo
- deepseek-v4-flash
- 1.5M tpm
- mimo-v2.6-flash
- 1.5M tpm
- qwen3.6
- 1.5M tpm
- gemma4
- 1.5M tpm
peticiones / min por modelo
- rerank
- 1000 rpm