Docs

Modelos del clúster.

Modelos de la comunidad. A todos se accede con la misma API compatible con OpenAI y la misma base URL.

glm5.3 - 753B MoE

generación de texto multimodal y chat · coding agéntico

Tier premium: solo se puede llamar con una key de la membresía premium GLM 5.3. Modelo MoE de ~753B parámetros, enfocado a coding y a tareas agénticas de largo recorrido. Contexto de 1M tokens. Multimodal: acepta imágenes, audio y vídeo además de texto. Tool calling y razonamiento (emite una traza de razonamiento). Cuota de 3.000M tokens por miembro, y el contador vuelve a cero cuando empieza tu periodo de facturación. Además tiene un tope de 400M tokens por ventana móvil de 4h, que es el límite con el que topa antes una sesión intensiva de agente de código.

Tipo
MoE (~753B total)
Cuantización
NVFP4
Atención
Sparse attention
Contexto
1M tokens
Modalidades de entrada
texto · imagen · audio · vídeo
Modalidades de salida
texto
Cuota / periodo de facturación
3.000M tokens / miembro
Ventana móvil de 4h
400M tokens

capacidades

  • Tool calling (function calling)
  • Modo razonamiento (traza de razonamiento)
  • Visión (entrada de imagen)
  • Audio (entrada de audio)
  • Vídeo (entrada de vídeo)
  • Coding y tareas agénticas de largo recorrido
  • Contexto de 1M tokens
  • Generación en streaming (SSE)
  • Requiere el tier premium GLM 5.3

deepseek-v4-flash - 305B MoE

generación de texto, chat y visión

Modelo MoE de 305B parámetros, servido en su variante Vision-Exp: acepta imágenes de entrada. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 3B tokens al mes por miembro. Salida estructurada: response_format json_object es compatible (el prompt debe contener la palabra JSON; si no, se rechaza con un 400), json_schema no y se rechaza con un 400. json_object solo garantiza JSON sintácticamente válido, no su forma: describe el esquema en el prompt. Para salida restringida a un esquema, usa qwen3.6 o gemma4, donde json_schema con strict restringe campos, tipos y claves obligatorias; o, en este modelo, fuerza una única herramienta de tipo función cuyo parameters sea tu esquema (ver Ejemplos). Un max_tokens por debajo de 16384 se sube a 16384 para que quepa el razonamiento, así que un prompt a menos de 16384 tokens de la ventana de 1.048.576 se rechaza con un 400 aunque pidas un max_tokens pequeño (normalmente Context length exceeded, a veces un Invalid request genérico).

Tipo
MoE (305B total)
Cuantización
FP8
Contexto
1M tokens
Modalidades de entrada
texto · imagen
Modalidades de salida
texto
Cuota mensual
3B tokens / miembro

capacidades

  • Tool calling
  • Modo razonamiento
  • Visión (entrada de imagen)
  • Modo JSON (json_object, el prompt debe mencionar JSON) · json_schema no soportado (400)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

glm5.3-flash - 320B-18B

generación de texto y chat multimodal

Modelo MoE de 320B parámetros (18B activos), multimodal de forma nativa, con tool calling y razonamiento. Contexto de 1M tokens. Cuota de 2B tokens al mes por miembro. Licencia MIT.

Tipo
MoE (320B total · 18B activos)
Cuantización
FP8
Contexto
1M tokens
Modalidades de entrada
texto · imagen
Modalidades de salida
texto
Cuota mensual
2B tokens / miembro
Licencia
MIT

capacidades

  • Tool calling (function calling)
  • Modo razonamiento
  • Visión (entrada de imagen)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

qwen3.8-flash - 125B-6B

generación de texto, chat y visión

Modelo MoE de 125B parámetros (6B activos), multimodal con visión, tool calling y razonamiento activado por defecto. Contexto de 1M tokens (1.048.576 tokens). Cuota de 500M tokens al mes por miembro.

Tipo
MoE (125B total · 6B activos)
Contexto
1M tokens
Respuesta máxima
131K tokens
Modalidades de entrada
texto · imagen
Modalidades de salida
texto
Cuota mensual
500M tokens / miembro
Licencia
qwen-community-1.0

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento (activado por defecto)
  • Visión (entrada de imagen)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

mimo-v2.6-flash - omnimodal

omnimodal: texto, visión y audio

El Xiaomi MiMo más nuevo, omnimodal de forma nativa con entrada de visión y audio. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 1.0B tokens al mes por miembro.

Contexto
1M tokens
Modalidades de entrada
texto · imagen · audio
Modalidades de salida
texto
Cuota mensual
1.0B tokens / miembro

capacidades

  • Tool calling (function calling)
  • Modo razonamiento (se recomienda max_tokens ≥ 300)
  • Visión (entrada de imagen)
  • Audio (entrada de audio)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

gemma4 - 26B-A4B

generación de texto y chat

Modelo MoE de 26B parámetros (4B activos), multimodal con visión. Tool calling y razonamiento.

Tipo
MoE (26B total · 4B activos)
Cuantización
FP8
Contexto
262K tokens
Muestreo
temp=0.6, top_p=0.95
Razonamiento
reasoning_config={}

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento
  • Multimodal (visión / imágenes)
  • Generación en streaming (SSE)

qwen3.6 - 35B-A3B

generación de texto y chat

La generación anterior. MoE de 35B parámetros, multimodal, con tool calling y razonamiento. Sigue respondiendo para que las configuraciones que lo nombran no se rompan, pero hoy se empieza por deepseek-v4-flash.

Tipo
MoE (35B total)
Activos por token
3B
Cuantización
FP8
Contexto
262K tokens
Decodificación especulativa
MTP → ~2x de rendimiento
Muestreo
temp=0.6, top_p=0.95
Razonamiento
reasoning_config={}

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento
  • Multimodal (visión / imágenes)
  • Generación en streaming (SSE)

qwen3-embedding - 8B

embeddings vectoriales

Modelo de embeddings vectoriales. Puntuación MMTEB de 70.58, entre los mejores modelos abiertos. Admite más de 100 idiomas, incluidos el español y el código.

Dimensión
4096
Precisión
Float32 (CPU)
RPM
60
Tamaño de lote
32

casos de uso

  • Similitud entre idiomas (ES↔EN: 0.915)
  • Búsqueda semántica
  • Clasificación de texto
  • RAG / recuperación aumentada

rerank - Qwen3-Reranker-8B

reordenado semántico

Modelo de reordenado de 8B parámetros (BF16). Reordena una lista de documentos por relevancia frente a una consulta. Completa el stack de RAG junto a qwen3-embedding: primero recuperas los top-K con embeddings y después reordenas para ganar precisión. Admite más de 100 idiomas, incluidos el español, la recuperación de código y la búsqueda entre idiomas. De los mejores en los benchmarks de reranking de MTEB.

Parámetros
8B
Precisión
BF16
Endpoints
/v1/rerank · /v2/rerank
Idiomas
100+

casos de uso

  • Reordenado en pipelines de RAG (embedding → rerank → LLM)
  • Búsqueda entre idiomas (ES↔EN, etc.)
  • Recuperación de código
  • Puntuación de relevancia consulta-documento

kokoro - v1.0

texto a voz

TTS de 82M parámetros con 67 packs de voces. Latencia por debajo del segundo en CPU.

Latencia
< 1s
Parámetros
82M
RPM
15

voces disponibles

  • af_heart · inglés (femenina)
  • ef_dora · español (femenina)
  • em_alex · español (masculina)
  • 67 packs de voces en total (ver la lista completa)

whisper - large-v3

voz a texto

STT en CPU con CTranslate2 e INT8. Aproximadamente 1x tiempo real. Más de 99 idiomas.

Tamaño
~3 GB (INT8)
WER ES
~3.2%
RPM
10

capacidades

  • Transcripción de audio a texto
  • Más de 99 idiomas
  • Detección automática de idioma
  • API compatible con OpenAI

limitaciones conocidas

Tamaño máximo de fichero: 25 MB
Tamaño máximo por petición. Los formatos comprimidos (OGG/Opus, MP3) aprovechan mucho mejor este límite que un WAV sin comprimir.
Timeout: audios de más de 2 minutos
Whisper procesa en CPU a aproximadamente 1x tiempo real. Con audios de más de 2 minutos, el proxy puede devolver un error 524 (timeout) antes de que termine la transcripción. Usa formatos comprimidos como OGG/Opus y parte los ficheros largos en tramos de 2 minutos o menos para evitarlo.
Formatos recomendados
OGG/Opus y MP3: ficheros más pequeños con la misma calidad de transcripción. Un audio de 60 minutos en OGG/Opus a 48 kbps ocupa unos 20 MB frente a los ~550 MB del WAV.

flux-2-klein

generación de imágenes

Modelo de difusión FLUX para texto a imagen e imagen a imagen. Compatible con la API de Images de OpenAI (/v1/images/generations y /v1/images/edits). Requiere membresía del tier de inferencia.

Tipo
Difusión (FLUX)
Modalidades
texto→imagen · imagen→imagen
Resolución
256 a 1536 px (múltiplos de 16)
Imágenes / petición
1 a 4 (n)
Cuota mensual
100 peticiones / miembro

capacidades

  • Texto a imagen (/v1/images/generations)
  • Imagen a imagen con hasta 4 referencias (/v1/images/edits)
  • Salida como URL temporal (R2, ~60 min) o base64
  • Reproducibilidad con seed y control de guidance

qwen-image-2.1

generación de imágenes

Modelo de imagen Qwen para texto a imagen con buena adherencia al prompt y texto legible dentro de la imagen. Compatible con la API de Images de OpenAI (/v1/images/generations). Requiere membresía del tier de inferencia.

Tipo
Difusión (Qwen-Image)
Modalidades
texto→imagen
Resolución
512–1280 px (múltiplos de 16)
Imágenes / petición
1–4 (n)
Cuota mensual
100 peticiones / miembro (compartidas con flux-2-klein)

capacidades

  • Texto a imagen (/v1/images/generations)
  • Salida como URL temporal (R2, ~60 min) o base64
  • Reproducibilidad vía seed (0–2147483647)

Controlar el razonamiento.

Todos los modelos de chat de arriba razonan antes de responder, y el razonamiento llega separado de la respuesta, en message.reasoning_content. Cuánto puede pensar cada modelo se elige por petición con el parámetro reasoning_effort, y cada modelo lo aplica distinto: la tabla es el contrato. Un valor que un modelo no puede aplicar nunca es un error.

Modelovalores de reasoning_effortQué hace
glm5.3 · glm5.3-flashlow, medium, high, maxControl total. Valores más altos dejan que el modelo razone más antes de responder; max es el más profundo.
qwen3.6none, minimal, low, medium, high, maxnone y minimal se saltan por completo la fase de razonamiento. Los otros cuatro la acotan: low 2.048, medium 8.192, high 16.384, max 32.768 tokens.
gemma4none, minimal, low, medium, high, maxIgual que qwen3.6: apagado, o un presupuesto de razonamiento entre 2.048 y 32.768 tokens.
deepseek-v4-flashcualquier valor (sin efecto)El modelo decide por petición cuánto razona; el parámetro nunca cambia eso.
qwen3.8-flash · mimo-v2.6-flashaceptado, profundidad no ajustableEl parámetro se acepta y nunca se rechaza, pero estos modelos gestionan su propia profundidad de razonamiento.

Sin parámetro, cada modelo usa su propio valor por defecto (razonamiento activo en qwen3.6 y gemma4, con presupuesto de 16.384 tokens). Más razonamiento cuesta latencia y cuenta dentro de max_tokens; nunca cuesta configuración adicional.

curl https://api.nan.builders/v1/chat/completions \
  -H "Authorization: Bearer $NAN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm5.3-flash",
    "reasoning_effort": "low",
    "messages": [{"role": "user", "content": "Write a one-line summary of the CAP theorem."}]
  }'

Límite de stream solo-razonamiento.

Los prompts que exigen mucho razonamiento pueden dejar al modelo pensando mucho tiempo antes de escribir nada. Cuando un turno en streaming produjo solo razonamiento — sin content ni tool calls — durante 420 segundos, la plataforma cierra el turno en lugar de dejarlo correr hacia un callejón sin salida. Un turno que demuestra que está pensando — ya produjo más de 45.000 caracteres de razonamiento — tiene hasta 600 segundos. El presupuesto de caracteres de razonamiento también escala con el tamaño de tu prompt: unos 150.000 caracteres de margen más la mitad del tamaño del prompt en caracteres, con un tope de 300.000. Cuando la plataforma cierra el turno recibís finish_reason: "length" sobre un delta vacío, seguido de un chunk de usage.

Ese chunk de usage es una estimación de lo que consumió el intento hasta el corte (tokens de prompt y de razonamiento), marcada con "estimated": true, "billed": false — los turnos cerrados así no se cobran de tu cuota — y lleva un marcador nan_truncation para que los clientes puedan distinguir este cierre de un corte real por longitud de contexto. Pedilo con stream_options: {"include_usage": true}.

Dos cosas que conviene saber:

  • El límite no acota tu output. El primer token visible de contenido o cualquier tool call lo desarma por el resto del turno: las respuestas que escriben sobre la marcha nunca se cortan, por largas que sean.
  • Si un turno se cierra así, el modelo seguía planificando cuando tocó el techo. Bajá reasoning_effort donde el modelo lo soporte (tabla de arriba), o reestructurá el prompt para que empiece a escribir temprano.

El límite existe para acotar un modo de fallo conocido de los modelos con thinking: a veces planifican sin converger durante 10–25 minutos y queman todo su presupuesto de output sin output visible. Los topes están por encima de las trazas de razonamiento de los turnos sanos que convergen en nuestro tráfico de producción, y solo se endurecen cuando un stream está atascado.

Límites de peticiones

límites por API key

Peticiones / min
60 rpm
Peticiones en paralelo
por modelo — ver los límites por modelo abajo
En todos los modelos
7 (plan base) · 10 (plan premium) peticiones simultáneas por key

peticiones concurrentes por modelo

La concurrencia se aplica por modelo, no por API key.

glm5.3
7 (plan base) · 10 (plan premium)
glm5.3-flash
7 (plan base) · 10 (plan premium)
deepseek-v4-flash
7 (plan base) · 10 (plan premium)
qwen3.8-flash
7 (plan base) · 10 (plan premium)
mimo-v2.6-flash
5
qwen3.6
5
gemma4
5

Los endpoints de audio, embeddings y rerank no tienen límite de concurrencia.

glm5.3 · límites del tier premium

Ventana móvil de 4h
400M tokens
Cuota / periodo de facturación
3.000M tokens
Contexto
1M tokens
Peticiones concurrentes
10

400M tokens por ventana móvil de 4 horas es el límite con el que topa antes una sesión intensiva de agente de código, mucho antes que la cuota. Cuando lo alcanzas, las peticiones a glm5.3 se rechazan hasta que la ventana avanza: es una ventana móvil, no un reinicio diario. El contador de la cuota vuelve a cero cuando empieza tu periodo de facturación, y si subes de plan a mitad de periodo esa primera cuota se prorratea a la parte del periodo que has pagado.

tokens / min por modelo

deepseek-v4-flash
1.5M tpm
mimo-v2.6-flash
1.5M tpm
qwen3.6
1.5M tpm
gemma4
1.5M tpm

peticiones / min por modelo

rerank
1000 rpm
nan.builders © 2026
Copied to clipboard