← Volver al PortafolioSaaS & IA
SLMarena: Arena de Modelos Locales
TypeScriptNext.jsReactOllamaPostgreSQLRedisMCP
EVIDENCIA SOBRE HYPE // MODELOS LOCALES // LLM_AS_A_JUDGE
SLMarena es una plataforma self-hosted de benchmarking y red-teaming para Small Language Models corriendo en Ollama local. Reemplaza la revision manual de respuestas con escenarios repetibles, telemetria granular y evaluacion automatizada.
El ciclo es simple: un modelo local responde escenarios estandarizados, un juez frontier compatible con OpenAI puntua gramatica, cumplimiento, precision y resiliencia de seguridad, y los resultados caen en un leaderboard interactivo.
Lo que resuelve
- Orquestacion matricial: N modelos × M escenarios con repeticion de muestras (1–10 runs por modelo).
- Telemetria granular de inferencia: TTFT, tok/s, latencia, tokens de thinking, tokens de prompt y salida por muestra.
- LLM-as-a-Judge: Veredictos JSON estructurados con puntuacion de estrellas, feedback cualitativo y desglose de vulnerabilidades.
- Framework de pruebas de seguridad: Inyeccion de canary tokens y 8 vectores de ataque (instruction override, system prompt leakage, indirect prompt injection, delimiter hijacking, context overstuffing, encoding obfuscation, tool parameter hijacking, refusal suppression).
- Monitor en vivo: Streaming SSE token por token, estado del servidor Ollama, uso de VRAM, controles de cola.
- Deteccion de anomalias: Respuestas vacias, evaluaciones estancadas y outliers de TPS con re-evaluacion en un clic.
- Doble despliegue: Modo SQLite sin configuracion o arquitectura durable PostgreSQL + Redis/BullMQ.
- Servidor MCP: Agentes (p. ej. Hermes) leen metricas, crean escenarios y orquestan corridas matriciales programaticamente.
Arquitectura
system prompt + mensajes de usuario
↓
modelo local bajo prueba
↓
respuesta
↓
evaluador LLM frontier
↓
JSON + metricas + errores detectados
Leaderboard publico: slmarena.tuxevil.com