Modelos del clúster.
Modelos de la comunidad. A todos se accede con la misma API compatible con
OpenAI y la misma base URL.
deepseek-v4-flash - 284B-21B
generación de texto y chat
Modelo MoE de 284B parámetros (21B activos). Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 2B tokens al mes por miembro.
- Tipo
- MoE (284B total · 21B activos)
- Cuantización
- FP8
- Contexto
- 1M tokens
- Cuota mensual
- 2B tokens / miembro
capacidades
- Tool calling
- Modo razonamiento
- Contexto de 1M tokens
- Generación en streaming (SSE)
mimo-v2.5 - 310B-15B
omnimodal: texto, visión y audio
Modelo MoE de 310B parámetros (15B activos), omnimodal de forma nativa con codificadores dedicados de visión y audio. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 1.0B tokens al mes por miembro. Licencia MIT.
- Tipo
- MoE (310B total · 15B activos)
- Cuantización
- FP8
- Contexto
- 1M tokens
- Modalidades de entrada
- texto · imagen · audio
- Modalidades de salida
- texto
- Cuota mensual
- 1.0B tokens / miembro
- Licencia
- MIT
capacidades
- Tool calling (function calling)
- Modo razonamiento (se recomienda
max_tokens ≥ 300) - Visión (entrada de imagen)
- Audio (entrada de audio)
- Contexto de 1M tokens
- Generación en streaming (SSE)
glm5.2 - 753B MoE
generación de texto y chat: coding agéntico
Tier premium: solo se puede llamar con una key de la membresía premium GLM 5.2. Modelo MoE de ~753B parámetros, enfocado a coding y a tareas agénticas de largo recorrido. Contexto de 500K tokens. Tool calling y razonamiento (emite una traza de razonamiento). Solo texto. Cuota de 3.000M tokens por miembro, y el contador vuelve a cero cuando empieza tu periodo de facturación. Además tiene un tope de 400M tokens por ventana móvil de 4h, que es el límite con el que topa antes una sesión intensiva de agente de código.
- Tipo
- MoE (~753B total)
- Cuantización
- FP8
- Atención
- Sparse attention
- Contexto
- 500K tokens
- Modalidades de entrada
- texto
- Modalidades de salida
- texto
- Cuota / periodo de facturación
- 3.000M tokens / miembro
- Ventana móvil de 4h
- 400M tokens
capacidades
- Tool calling (function calling)
- Modo razonamiento (traza de razonamiento)
- Coding y tareas agénticas de largo recorrido
- Contexto de 500K tokens
- Generación en streaming (SSE)
- Requiere el tier premium GLM 5.2
gemma4 - 26B-A4B
generación de texto y chat
Modelo MoE de 26B parámetros (4B activos), multimodal con visión. Tool calling y razonamiento.
- Tipo
- MoE (26B total · 4B activos)
- Cuantización
- FP8
- Contexto
- 256K tokens
- Muestreo
- temp=0.6, top_p=0.95
- Razonamiento
- reasoning_config={}
capacidades
- Tool calling (formato XML)
- Modo razonamiento
- Multimodal (visión / imágenes)
- Generación en streaming (SSE)
qwen3.6 - 35B-A3B
generación de texto y chat
El modelo insignia. MoE de 35B parámetros, multimodal, con tool calling y razonamiento.
- Tipo
- MoE (35B total)
- Activos por token
- 3B
- Cuantización
- FP8
- Contexto
- 256K tokens
- Decodificación especulativa
- MTP → ~2x de rendimiento
- Muestreo
- temp=0.6, top_p=0.95
- Razonamiento
- reasoning_config={}
capacidades
- Tool calling (formato XML)
- Modo razonamiento
- Multimodal (visión / imágenes)
- Generación en streaming (SSE)
qwen3-embedding - 8B
embeddings vectoriales
Modelo de embeddings vectoriales. Puntuación MMTEB de 70.58, entre los mejores modelos abiertos. Admite más de 100 idiomas, incluidos el español y el código.
- Dimensión
- 4096
- Precisión
- Float32 (CPU)
- RPM
- 60
- Tamaño de lote
- 32
casos de uso
- Similitud entre idiomas (ES↔EN: 0.915)
- Búsqueda semántica
- Clasificación de texto
- RAG / recuperación aumentada
rerank - Qwen3-Reranker-8B
reordenado semántico
Modelo de reordenado de 8B parámetros (BF16). Reordena una lista de documentos por relevancia frente a una consulta. Completa el stack de RAG junto a qwen3-embedding: primero recuperas los top-K con embeddings y después reordenas para ganar precisión. Admite más de 100 idiomas, incluidos el español, la recuperación de código y la búsqueda entre idiomas. De los mejores en los benchmarks de reranking de MTEB.
- Parámetros
- 8B
- Precisión
- BF16
- Endpoints
- /v1/rerank · /v2/rerank
- Idiomas
- 100+
casos de uso
- Reordenado en pipelines de RAG (embedding → rerank → LLM)
- Búsqueda entre idiomas (ES↔EN, etc.)
- Recuperación de código
- Puntuación de relevancia consulta-documento
kokoro - v1.0
texto a voz
TTS de 82M parámetros con 67 packs de voces. Latencia por debajo del segundo en CPU.
- Latencia
- < 1s
- Parámetros
- 82M
- RPM
- 15
voces disponibles
- af_heart · inglés (femenina)
- ef_dora · español (femenina)
- em_alex · español (masculina)
- 67 packs de voces en total (ver la lista completa)
whisper - large-v3
voz a texto
STT en CPU con CTranslate2 e INT8. Aproximadamente 1x tiempo real. Más de 99 idiomas.
- Tamaño
- ~3 GB (INT8)
- WER ES
- ~3.2%
- RPM
- 10
capacidades
- Transcripción de audio a texto
- Más de 99 idiomas
- Detección automática de idioma
- API compatible con OpenAI
limitaciones conocidas
- Tamaño máximo de fichero: 25 MB
- Tamaño máximo por petición. Los formatos comprimidos (OGG/Opus, MP3) aprovechan mucho mejor este límite que un WAV sin comprimir.
- Timeout: audios de más de 2 minutos
- Whisper procesa en CPU a aproximadamente 1x tiempo real. Con audios de más de 2 minutos, el proxy puede devolver un error
524(timeout) antes de que termine la transcripción. Usa formatos comprimidos como OGG/Opus y parte los ficheros largos en tramos de 2 minutos o menos para evitarlo. - Formatos recomendados
OGG/OpusyMP3: ficheros más pequeños con la misma calidad de transcripción. Un audio de 60 minutos en OGG/Opus a 48 kbps ocupa unos 20 MB frente a los ~550 MB del WAV.
flux-2-klein
generación de imágenes
Modelo de difusión FLUX para texto a imagen e imagen a imagen. Compatible con la API de Images de OpenAI (/v1/images/generations y /v1/images/edits). Requiere membresía del tier de inferencia.
- Tipo
- Difusión (FLUX)
- Modalidades
- texto→imagen · imagen→imagen
- Resolución
- 256 a 1536 px (múltiplos de 16)
- Imágenes / petición
- 1 a 4 (n)
- Cuota mensual
- 100 peticiones / miembro
capacidades
- Texto a imagen (
/v1/images/generations) - Imagen a imagen con hasta 4 referencias (
/v1/images/edits) - Salida como URL temporal (R2, ~60 min) o base64
- Reproducibilidad con
seedy control deguidance
límites por API key
- Peticiones / min
- 60 rpm
- Máximo en paralelo
- 5 concurrentes
glm5.2 · límites del tier premium
- Ventana móvil de 4h
- 400M tokens
- Cuota / periodo de facturación
- 3.000M tokens
- Contexto
- 500K tokens
- Peticiones concurrentes
- 5
400M tokens por ventana móvil de 4 horas es el límite con el que topa antes una sesión intensiva de agente de código, mucho antes que la cuota. Cuando lo alcanzas, las peticiones a glm5.2 se rechazan hasta que la ventana avanza: es una ventana móvil, no un reinicio diario. El contador de la cuota vuelve a cero cuando empieza tu periodo de facturación, y si subes de plan a mitad de periodo esa primera cuota se prorratea a la parte del periodo que has pagado.
tokens / min por modelo
- deepseek-v4-flash
- 1.5M tpm
- mimo-v2.5
- 1.5M tpm
- qwen3.6
- 1.5M tpm
- gemma4
- 1.5M tpm
peticiones / min por modelo
- rerank
- 1000 rpm