---
title: "Construyendo un Bot de Scalping con IA — Episodio 1: Los Cimientos"
description: ""
canonical: https://arbe.blog/logs/construyendo-un-bot-de-scalping-con-ia-episodio-1-los-cimientos
published: 2026-03-28
updated: 2026-03-28
language: es
content_type: technical-guide
tags: ["PYTHON","JAVASCRIPT","SSH","LLM","BTC","API"]
---

# Construyendo un Bot de Scalping con IA — Episodio 1: Los Cimientos

> *Serie de entradas donde documento el proceso de construir un sistema de trading
> algorítmico desde cero, combinando aprendizaje por refuerzo, análisis institucional
> y una arquitectura diseñada para sobrevivir en mercados reales.*

---

## ¿De qué va este proyecto?

La idea es simple en concepto y compleja en ejecución: construir un bot de scalping
para BTC/USDT que opere de forma autónoma, aprenda de sus errores, y sea capaz
de sobrevivir los costos de transacción que normalmente destruyen a los bots
tradicionales basados en reglas fijas.

No es un bot que sigue señales de un indicador. Es un sistema donde una red neuronal
toma las decisiones de entrada, calibrada por meses de entrenamiento en datos reales
de mercado, con los fees de Binance incluidos desde el primer día de entrenamiento.

---

## Por qué Aprendizaje por Refuerzo

La mayoría de bots funcionan con lógica condicional: *"si RSI cruza X y EMA apunta
arriba, compra"*. El problema es que los mercados cambian. Una regla que funcionó
en 2023 puede destruir capital en 2026.

El aprendizaje por refuerzo (RL) aborda esto de forma diferente. El modelo no recibe
reglas — recibe un entorno de simulación y una función de recompensa. Aprende qué
funciona por prueba y error, millones de veces, hasta que converge en una política
que maximiza las ganancias netas.

El algoritmo elegido es **SAC (Soft Actor-Critic)**, que tiene una característica
clave para trading: por diseño, favorece la *incertidumbre controlada*. Cuando no
está seguro, prefiere no operar. Eso en scalping es oro — un modelo que sabe cuándo
quedarse en HOLD es tan valioso como uno que sabe cuándo entrar.

---

## El problema de los fees

Este fue el primer principio de diseño del sistema: **los fees lo son todo en scalping**.

En Binance Futures, una operación completa (entrada + salida) con órdenes market
cuesta aproximadamente 0.10% del notional. Con apalancamiento 5×, eso equivale
a 0.5% del margen por trade. Un bot que opera 20 veces al día necesita generar
más de 10% diario solo para cubrir costos — algo imposible de sostener.

La solución fue hacer que el modelo entrenara con fees reales desde el inicio.
Cada simulación penaliza al modelo exactamente lo que costaría esa operación
en el exchange real, incluyendo slippage. Esto fuerza al modelo a desarrollar
**paciencia** — solo entra cuando la señal es lo suficientemente fuerte para
justificar el costo del round trip.

---

## Los 14 ojos del modelo

El modelo no ve el precio directamente. Ve una ventana de 60 velas (1 hora de
historia) a través de 14 indicadores calculados para cada vela. Estos son los
"sentidos" del sistema:

**Indicadores clásicos (los que todo trader conoce):**
- **RSI** — detecta zonas de sobrecompra y sobreventa
- **EMA Spread** — la diferencia entre dos medias móviles, indica dirección de tendencia
- **ATR** — volatilidad actual, calibra el tamaño del stop loss dinámicamente
- **Bandas de Bollinger** — ancho y posición dentro de las bandas
- **ADX** — fuerza de la tendencia, filtra mercados laterales sin dirección
- **Volume Ratio** — volumen actual vs promedio, confirma liquidez

**Indicadores de contexto multi-timeframe:**
- **RSI en 5 minutos** — el momentum desde un timeframe superior
- **Tendencia en 1 hora** — la dirección macro que contiene el movimiento de 1m
- **Macro trend** — posición del precio respecto a la media de 50 periodos

**Los tres indicadores nuevos — la capa institucional:**

Esta es la parte más interesante del episodio. Después de estudiar la metodología
de traders institucionales, incorporamos tres conceptos que los market makers y
fondos usan para tomar decisiones:

**VWAP (Volume Weighted Average Price)** — El precio promedio ponderado por volumen
desde el inicio de la sesión. Es el nivel de referencia que usan los institucionales
para evaluar si están comprando caro o barato. Un precio muy alejado del VWAP
tiende a volver hacia él. El sistema ahora sabe qué tan extendido está el precio
respecto a este nivel en cada momento.

**Proximidad a Low Volume Nodes (LVNs)** — El perfil de volumen divide el mercado
en zonas de alto y bajo volumen por precio. Las zonas de bajo volumen son
"agujeros" donde el precio se mueve rápido porque hay pocas órdenes esperando.
El modelo ahora puede reconocer cuando está cerca de una de estas zonas de
aceleración potencial.

**Absorption Score** — Cuando hay velas con volumen excepcionalmente alto pero
rangos de precio muy pequeños, están ocurriendo dos cosas posibles: acumulación
o distribución institucional. Alguien grande está comprando o vendiendo sin mover
el precio, absorbiendo las órdenes del lado contrario. Detectar esto antes de
que ocurra el movimiento subsecuente es una ventaja significativa.

---

## Arquitectura de decisión

El sistema tiene capas de responsabilidad clara:

El **modelo SAC** tiene la última palabra sobre si entrar o no y en qué dirección.
Su señal es un número continuo entre -1 y +1. Valores cercanos a los extremos
indican alta convicción. La zona central es el "no tengo idea" del modelo,
y el sistema simplemente no opera.

Los **filtros de price action** actúan como guardianes. No proponen — bloquean.
Si el modelo quiere comprar pero el precio está demasiado extendido del VWAP,
o si hay absorción institucional vendedora fuerte, el filtro veta la operación.
El modelo puede ser brillante identificando patrones, pero los filtros lo protegen
de entrar en condiciones macro desfavorables.

El **Risk Manager** opera en una capa superior a ambos. Si el sistema acumula
tres pérdidas consecutivas, entra en pausa automática de dos horas. Si el
drawdown del día supera un umbral, detiene las operaciones hasta el día siguiente.
No negocia con el modelo ni con los filtros.

---

## El estado actual

Al cierre de este episodio, el sistema está en su segundo ciclo de entrenamiento.
El primer modelo entrenado (con 11 indicadores, 1 millón de pasos) alcanzó en
validación fuera de muestra un **win rate de 68%** con un **PnL de +18%** sobre
el capital inicial en los episodios de prueba.

Esos números suenan bien, pero hay que ser honesto: es un modelo en condiciones
de laboratorio. Los datos históricos son limpios, los fills son instantáneos,
y no hay eventos macro ni flash crashes inesperados. El mundo real es más
complicado.

El modelo actual lleva 14 indicadores y 4 millones de pasos de entrenamiento
programados — cuatro veces más experiencia simulada. La hipótesis es que la
capa institucional (VWAP, LVNs, absorción) le dará mejores herramientas para
distinguir señales reales de ruido.

---

## Los próximos pasos

**Episodio 2** cubrirá:

- Resultados del entrenamiento actual y qué dicen los números realmente
- Implementar la separación entre el modelo de entrada y el gestor de trade
  (por qué dejar que el SAC decida tanto la entrada como la salida es un error
  de diseño que afecta el rendimiento)
- El concepto de walk-forward validation y por qué el split train/test
  actual tiene un flaw que hay que corregir antes de ir a real
- Primeros pasos hacia ejecución con dinero real: qué infraestructura
  necesita el sistema que todavía no tiene

El proyecto está en paper trading activo. Antes de tocar dinero real, el
criterio es simple: win rate sostenido por encima de 52% durante al menos
cuatro semanas en condiciones de mercado en vivo. No en backtesting. En vivo.

---

*El código, la arquitectura detallada y los modelos entrenados forman parte
de un repositorio privado. Esta serie documenta el proceso de diseño y las
decisiones tomadas, no la implementación específica.*

*Próximo episodio: cuando el entrenamiento termine y tengamos números reales.*

---
Fuente canónica: https://arbe.blog/logs/construyendo-un-bot-de-scalping-con-ia-episodio-1-los-cimientos
