L2 PvP Bot RL: Aprendizaje por Refuerzo en MMORPG
L2J_MOBIUS_RL: ACTIVE // GYMNASIUM_1V1: Dion, Giran, Gludin // PETTINGZOO_7V7: Aden Coliseum // STATUS: STABLE
Los bots tradicionales en MMORPGs se limitan a rotaciones estáticas e inertes. L2 PvP Bot RL es un sistema de aprendizaje por refuerzo (RL) que entrena personajes completos de Lineage 2 (instanciados como personajes reales en el servidor sin un cliente conectado) para combatir de forma táctica y cooperar en grupo. El entrenamiento ocurre de manera permanente en el servidor sin alterar el hilo de ejecución principal del juego.
Arquitectura de Entrenamiento Desacoplada
El sistema desacopla el motor físico en tiempo real de la computación pesada de IA:
[ L2J GameServer (Java) ] (Inferencia / Captura)
│
▼ (Episodios y Transiciones)
[ Base de Datos ] ◄──► [ Entrenador RL (Python) ]
▲ │
└──────────────────────────┴─► Inyección de Modelos (Q-Tables / TorchScript)
1. Inferencia Local y Captura de Episodios
El GameServer corre el ciclo de combate. Un administrador de tareas especializado llama periódicamente al cerebro de los bots. Toda acción relevante (daño, curación, controles, fallos y resultados) es registrada asíncronamente en la base de datos como episodios y transiciones.
2. Laboratorio Neural Aislado
Para el aprendizaje profundo, un servidor paralelo avanza combates de forma sincronizada libre de interferencias de jugadores humanos:
- Duelos 1v1: Modelados con Gymnasium en múltiples arenas.
- Peleas 7v7 (Multiagente): Modelados con PettingZoo en el Coliseo de Aden. El optimizador ejecuta PPO (Proximal Policy Optimization) sobre Ray/RLlib entrenando el modelo a partir de un vector de observación de 177 valores por personaje (sin exponer datos secretos de rivales, respetando rangos, líneas de visión e invisibilidad).
3. Alternancia Automática de Modelos
El planificador del servidor alterna de forma automática el tipo de entrenamiento por generación: tablas de decisión (tabular) y redes neuronales (neural). Durante la transición neural, el pipeline exporta el actor a TorchScript y un servicio de inferencia local en CPU maneja las decisiones.
Seguridad y Resiliencia en Producción
Las políticas no pueden romper el servidor:
- Validación Legal: El servidor en Java valida que cada acción seleccionada pertenezca al árbol original de habilidades de la clase del bot antes de castear, previniendo el aprendizaje de habilidades cruzadas.
- Fallback y Rollback: Ante desconexiones o baja tasa de aceptación de acciones por la IA, los bots caen a un cerebro artesanal programado a mano en Java. Si el fallo persiste, ocurre un rollback automático restaurando la última versión tabular estable.
Entrenamiento Humano y Desafío
El proyecto está en constante evolución y se beneficia directamente del comportamiento humano real.
Únete al servidor y pon a prueba tus habilidades contra la IA en combates 1v1, 2v1 o en party 7v7. Tu participación registrada en los episodios de combate ayuda a entrenar nuevas generaciones de bots frente a estilos de juego humanos diversos.
Regístrate y juega en: https://lineage2.tuxevil.com