SLMarena: Arena de Modelos Locales

TypeScriptNext.jsReactOllamaPostgreSQLRedisMCP

EVIDENCIA SOBRE HYPE // MODELOS LOCALES // LLM_AS_A_JUDGE

SLMarena es una plataforma self-hosted de benchmarking y red-teaming para Small Language Models corriendo en Ollama local. Reemplaza la revision manual de respuestas con escenarios repetibles, telemetria granular y evaluacion automatizada.

El ciclo es simple: un modelo local responde escenarios estandarizados, un juez frontier compatible con OpenAI puntua gramatica, cumplimiento, precision y resiliencia de seguridad, y los resultados caen en un leaderboard interactivo.

Lo que resuelve

  • Orquestacion matricial: N modelos × M escenarios con repeticion de muestras (1–10 runs por modelo).
  • Telemetria granular de inferencia: TTFT, tok/s, latencia, tokens de thinking, tokens de prompt y salida por muestra.
  • LLM-as-a-Judge: Veredictos JSON estructurados con puntuacion de estrellas, feedback cualitativo y desglose de vulnerabilidades.
  • Framework de pruebas de seguridad: Inyeccion de canary tokens y 8 vectores de ataque (instruction override, system prompt leakage, indirect prompt injection, delimiter hijacking, context overstuffing, encoding obfuscation, tool parameter hijacking, refusal suppression).
  • Monitor en vivo: Streaming SSE token por token, estado del servidor Ollama, uso de VRAM, controles de cola.
  • Deteccion de anomalias: Respuestas vacias, evaluaciones estancadas y outliers de TPS con re-evaluacion en un clic.
  • Doble despliegue: Modo SQLite sin configuracion o arquitectura durable PostgreSQL + Redis/BullMQ.
  • Servidor MCP: Agentes (p. ej. Hermes) leen metricas, crean escenarios y orquestan corridas matriciales programaticamente.

Arquitectura

system prompt + mensajes de usuario

      modelo local bajo prueba

            respuesta

      evaluador LLM frontier

  JSON + metricas + errores detectados

Leaderboard publico: slmarena.tuxevil.com