
Construyendo un Bot de Scalping con IA — Episodio 1: Los Cimientos
Serie de entradas donde documento el proceso de construir un sistema de trading algorítmico desde cero, combinando aprendizaje por refuerzo, análisis…
Serie de entradas donde documento el proceso de construir un sistema de trading algorítmico desde cero, combinando aprendizaje por refuerzo, análisis institucional y una arquitectura diseñada para sobrevivir en mercados reales.
¿De qué va este proyecto?
La idea es simple en concepto y compleja en ejecución: construir un bot de scalping para BTC/USDT que opere de forma autónoma, aprenda de sus errores, y sea capaz de sobrevivir los costos de transacción que normalmente destruyen a los bots tradicionales basados en reglas fijas.
No es un bot que sigue señales de un indicador. Es un sistema donde una red neuronal toma las decisiones de entrada, calibrada por meses de entrenamiento en datos reales de mercado, con los fees de Binance incluidos desde el primer día de entrenamiento.
Por qué Aprendizaje por Refuerzo
La mayoría de bots funcionan con lógica condicional: "si RSI cruza X y EMA apunta arriba, compra". El problema es que los mercados cambian. Una regla que funcionó en 2023 puede destruir capital en 2026.
El aprendizaje por refuerzo (RL) aborda esto de forma diferente. El modelo no recibe reglas — recibe un entorno de simulación y una función de recompensa. Aprende qué funciona por prueba y error, millones de veces, hasta que converge en una política que maximiza las ganancias netas.
El algoritmo elegido es SAC (Soft Actor-Critic), que tiene una característica clave para trading: por diseño, favorece la incertidumbre controlada. Cuando no está seguro, prefiere no operar. Eso en scalping es oro — un modelo que sabe cuándo quedarse en HOLD es tan valioso como uno que sabe cuándo entrar.
El problema de los fees
Este fue el primer principio de diseño del sistema: los fees lo son todo en scalping.
En Binance Futures, una operación completa (entrada + salida) con órdenes market cuesta aproximadamente 0.10% del notional. Con apalancamiento 5×, eso equivale a 0.5% del margen por trade. Un bot que opera 20 veces al día necesita generar más de 10% diario solo para cubrir costos — algo imposible de sostener.
La solución fue hacer que el modelo entrenara con fees reales desde el inicio. Cada simulación penaliza al modelo exactamente lo que costaría esa operación en el exchange real, incluyendo slippage. Esto fuerza al modelo a desarrollar paciencia — solo entra cuando la señal es lo suficientemente fuerte para justificar el costo del round trip.
Los 14 ojos del modelo
El modelo no ve el precio directamente. Ve una ventana de 60 velas (1 hora de historia) a través de 14 indicadores calculados para cada vela. Estos son los "sentidos" del sistema:
Indicadores clásicos (los que todo trader conoce):
- RSI — detecta zonas de sobrecompra y sobreventa
- EMA Spread — la diferencia entre dos medias móviles, indica dirección de tendencia
- ATR — volatilidad actual, calibra el tamaño del stop loss dinámicamente
- Bandas de Bollinger — ancho y posición dentro de las bandas
- ADX — fuerza de la tendencia, filtra mercados laterales sin dirección
- Volume Ratio — volumen actual vs promedio, confirma liquidez
Indicadores de contexto multi-timeframe:
- RSI en 5 minutos — el momentum desde un timeframe superior
- Tendencia en 1 hora — la dirección macro que contiene el movimiento de 1m
- Macro trend — posición del precio respecto a la media de 50 periodos
Los tres indicadores nuevos — la capa institucional:
Esta es la parte más interesante del episodio. Después de estudiar la metodología de traders institucionales, incorporamos tres conceptos que los market makers y fondos usan para tomar decisiones:
VWAP (Volume Weighted Average Price) — El precio promedio ponderado por volumen desde el inicio de la sesión. Es el nivel de referencia que usan los institucionales para evaluar si están comprando caro o barato. Un precio muy alejado del VWAP tiende a volver hacia él. El sistema ahora sabe qué tan extendido está el precio respecto a este nivel en cada momento.
Proximidad a Low Volume Nodes (LVNs) — El perfil de volumen divide el mercado en zonas de alto y bajo volumen por precio. Las zonas de bajo volumen son "agujeros" donde el precio se mueve rápido porque hay pocas órdenes esperando. El modelo ahora puede reconocer cuando está cerca de una de estas zonas de aceleración potencial.
Absorption Score — Cuando hay velas con volumen excepcionalmente alto pero rangos de precio muy pequeños, están ocurriendo dos cosas posibles: acumulación o distribución institucional. Alguien grande está comprando o vendiendo sin mover el precio, absorbiendo las órdenes del lado contrario. Detectar esto antes de que ocurra el movimiento subsecuente es una ventaja significativa.
Arquitectura de decisión
El sistema tiene capas de responsabilidad clara:
El modelo SAC tiene la última palabra sobre si entrar o no y en qué dirección. Su señal es un número continuo entre -1 y +1. Valores cercanos a los extremos indican alta convicción. La zona central es el "no tengo idea" del modelo, y el sistema simplemente no opera.
Los filtros de price action actúan como guardianes. No proponen — bloquean. Si el modelo quiere comprar pero el precio está demasiado extendido del VWAP, o si hay absorción institucional vendedora fuerte, el filtro veta la operación. El modelo puede ser brillante identificando patrones, pero los filtros lo protegen de entrar en condiciones macro desfavorables.
El Risk Manager opera en una capa superior a ambos. Si el sistema acumula tres pérdidas consecutivas, entra en pausa automática de dos horas. Si el drawdown del día supera un umbral, detiene las operaciones hasta el día siguiente. No negocia con el modelo ni con los filtros.
El estado actual
Al cierre de este episodio, el sistema está en su segundo ciclo de entrenamiento. El primer modelo entrenado (con 11 indicadores, 1 millón de pasos) alcanzó en validación fuera de muestra un win rate de 68% con un PnL de +18% sobre el capital inicial en los episodios de prueba.
Esos números suenan bien, pero hay que ser honesto: es un modelo en condiciones de laboratorio. Los datos históricos son limpios, los fills son instantáneos, y no hay eventos macro ni flash crashes inesperados. El mundo real es más complicado.
El modelo actual lleva 14 indicadores y 4 millones de pasos de entrenamiento programados — cuatro veces más experiencia simulada. La hipótesis es que la capa institucional (VWAP, LVNs, absorción) le dará mejores herramientas para distinguir señales reales de ruido.
Los próximos pasos
Episodio 2 cubrirá:
- Resultados del entrenamiento actual y qué dicen los números realmente
- Implementar la separación entre el modelo de entrada y el gestor de trade (por qué dejar que el SAC decida tanto la entrada como la salida es un error de diseño que afecta el rendimiento)
- El concepto de walk-forward validation y por qué el split train/test actual tiene un flaw que hay que corregir antes de ir a real
- Primeros pasos hacia ejecución con dinero real: qué infraestructura necesita el sistema que todavía no tiene
El proyecto está en paper trading activo. Antes de tocar dinero real, el criterio es simple: win rate sostenido por encima de 52% durante al menos cuatro semanas en condiciones de mercado en vivo. No en backtesting. En vivo.
El código, la arquitectura detallada y los modelos entrenados forman parte de un repositorio privado. Esta serie documenta el proceso de diseño y las decisiones tomadas, no la implementación específica.
Próximo episodio: cuando el entrenamiento termine y tengamos números reales.
Comentarios (0)