Docs

Modelos del clúster.

Modelos de la comunidad. A todos se accede con la misma API compatible con OpenAI y la misma base URL.

deepseek-v4-flash - 284B-21B

generación de texto y chat

Modelo MoE de 284B parámetros (21B activos). Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 2B tokens al mes por miembro.

Tipo
MoE (284B total · 21B activos)
Cuantización
FP8
Contexto
1M tokens
Cuota mensual
2B tokens / miembro

capacidades

  • Tool calling
  • Modo razonamiento
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

mimo-v2.5 - 310B-15B

omnimodal: texto, visión y audio

Modelo MoE de 310B parámetros (15B activos), omnimodal de forma nativa con codificadores dedicados de visión y audio. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 1.0B tokens al mes por miembro. Licencia MIT.

Tipo
MoE (310B total · 15B activos)
Cuantización
FP8
Contexto
1M tokens
Modalidades de entrada
texto · imagen · audio
Modalidades de salida
texto
Cuota mensual
1.0B tokens / miembro
Licencia
MIT

capacidades

  • Tool calling (function calling)
  • Modo razonamiento (se recomienda max_tokens ≥ 300)
  • Visión (entrada de imagen)
  • Audio (entrada de audio)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

glm5.2 - 753B MoE

generación de texto y chat: coding agéntico

Tier premium: solo se puede llamar con una key de la membresía premium GLM 5.2. Modelo MoE de ~753B parámetros, enfocado a coding y a tareas agénticas de largo recorrido. Contexto de 500K tokens. Tool calling y razonamiento (emite una traza de razonamiento). Solo texto. Cuota de 3.000M tokens por miembro, y el contador vuelve a cero cuando empieza tu periodo de facturación. Además tiene un tope de 400M tokens por ventana móvil de 4h, que es el límite con el que topa antes una sesión intensiva de agente de código.

Tipo
MoE (~753B total)
Cuantización
FP8
Atención
Sparse attention
Contexto
500K tokens
Modalidades de entrada
texto
Modalidades de salida
texto
Cuota / periodo de facturación
3.000M tokens / miembro
Ventana móvil de 4h
400M tokens

capacidades

  • Tool calling (function calling)
  • Modo razonamiento (traza de razonamiento)
  • Coding y tareas agénticas de largo recorrido
  • Contexto de 500K tokens
  • Generación en streaming (SSE)
  • Requiere el tier premium GLM 5.2

gemma4 - 26B-A4B

generación de texto y chat

Modelo MoE de 26B parámetros (4B activos), multimodal con visión. Tool calling y razonamiento.

Tipo
MoE (26B total · 4B activos)
Cuantización
FP8
Contexto
256K tokens
Muestreo
temp=0.6, top_p=0.95
Razonamiento
reasoning_config={}

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento
  • Multimodal (visión / imágenes)
  • Generación en streaming (SSE)

qwen3.6 - 35B-A3B

generación de texto y chat

El modelo insignia. MoE de 35B parámetros, multimodal, con tool calling y razonamiento.

Tipo
MoE (35B total)
Activos por token
3B
Cuantización
FP8
Contexto
256K tokens
Decodificación especulativa
MTP → ~2x de rendimiento
Muestreo
temp=0.6, top_p=0.95
Razonamiento
reasoning_config={}

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento
  • Multimodal (visión / imágenes)
  • Generación en streaming (SSE)

qwen3-embedding - 8B

embeddings vectoriales

Modelo de embeddings vectoriales. Puntuación MMTEB de 70.58, entre los mejores modelos abiertos. Admite más de 100 idiomas, incluidos el español y el código.

Dimensión
4096
Precisión
Float32 (CPU)
RPM
60
Tamaño de lote
32

casos de uso

  • Similitud entre idiomas (ES↔EN: 0.915)
  • Búsqueda semántica
  • Clasificación de texto
  • RAG / recuperación aumentada

rerank - Qwen3-Reranker-8B

reordenado semántico

Modelo de reordenado de 8B parámetros (BF16). Reordena una lista de documentos por relevancia frente a una consulta. Completa el stack de RAG junto a qwen3-embedding: primero recuperas los top-K con embeddings y después reordenas para ganar precisión. Admite más de 100 idiomas, incluidos el español, la recuperación de código y la búsqueda entre idiomas. De los mejores en los benchmarks de reranking de MTEB.

Parámetros
8B
Precisión
BF16
Endpoints
/v1/rerank · /v2/rerank
Idiomas
100+

casos de uso

  • Reordenado en pipelines de RAG (embedding → rerank → LLM)
  • Búsqueda entre idiomas (ES↔EN, etc.)
  • Recuperación de código
  • Puntuación de relevancia consulta-documento

kokoro - v1.0

texto a voz

TTS de 82M parámetros con 67 packs de voces. Latencia por debajo del segundo en CPU.

Latencia
< 1s
Parámetros
82M
RPM
15

voces disponibles

  • af_heart · inglés (femenina)
  • ef_dora · español (femenina)
  • em_alex · español (masculina)
  • 67 packs de voces en total (ver la lista completa)

whisper - large-v3

voz a texto

STT en CPU con CTranslate2 e INT8. Aproximadamente 1x tiempo real. Más de 99 idiomas.

Tamaño
~3 GB (INT8)
WER ES
~3.2%
RPM
10

capacidades

  • Transcripción de audio a texto
  • Más de 99 idiomas
  • Detección automática de idioma
  • API compatible con OpenAI

limitaciones conocidas

Tamaño máximo de fichero: 25 MB
Tamaño máximo por petición. Los formatos comprimidos (OGG/Opus, MP3) aprovechan mucho mejor este límite que un WAV sin comprimir.
Timeout: audios de más de 2 minutos
Whisper procesa en CPU a aproximadamente 1x tiempo real. Con audios de más de 2 minutos, el proxy puede devolver un error 524 (timeout) antes de que termine la transcripción. Usa formatos comprimidos como OGG/Opus y parte los ficheros largos en tramos de 2 minutos o menos para evitarlo.
Formatos recomendados
OGG/Opus y MP3: ficheros más pequeños con la misma calidad de transcripción. Un audio de 60 minutos en OGG/Opus a 48 kbps ocupa unos 20 MB frente a los ~550 MB del WAV.

flux-2-klein

generación de imágenes

Modelo de difusión FLUX para texto a imagen e imagen a imagen. Compatible con la API de Images de OpenAI (/v1/images/generations y /v1/images/edits). Requiere membresía del tier de inferencia.

Tipo
Difusión (FLUX)
Modalidades
texto→imagen · imagen→imagen
Resolución
256 a 1536 px (múltiplos de 16)
Imágenes / petición
1 a 4 (n)
Cuota mensual
100 peticiones / miembro

capacidades

  • Texto a imagen (/v1/images/generations)
  • Imagen a imagen con hasta 4 referencias (/v1/images/edits)
  • Salida como URL temporal (R2, ~60 min) o base64
  • Reproducibilidad con seed y control de guidance

límites por API key

Peticiones / min
60 rpm
Máximo en paralelo
5 concurrentes

glm5.2 · límites del tier premium

Ventana móvil de 4h
400M tokens
Cuota / periodo de facturación
3.000M tokens
Contexto
500K tokens
Peticiones concurrentes
5

400M tokens por ventana móvil de 4 horas es el límite con el que topa antes una sesión intensiva de agente de código, mucho antes que la cuota. Cuando lo alcanzas, las peticiones a glm5.2 se rechazan hasta que la ventana avanza: es una ventana móvil, no un reinicio diario. El contador de la cuota vuelve a cero cuando empieza tu periodo de facturación, y si subes de plan a mitad de periodo esa primera cuota se prorratea a la parte del periodo que has pagado.

tokens / min por modelo

deepseek-v4-flash
1.5M tpm
mimo-v2.5
1.5M tpm
qwen3.6
1.5M tpm
gemma4
1.5M tpm

peticiones / min por modelo

rerank
1000 rpm
nan.builders © 2026
Copied to clipboard