Backtesting software per cryptovalute
|

Bot Crypto con Reinforcement Learning – Aggiornamento 4 Giugno 2026

Premessa

L’analisi seguente è frutto di un esperimento con un bot di trading sviluppato per l’ambito delle cripto valute. Tale strumento utilizza un motore costituito da un algoritmo di reinforcement learning per le azioni di acquisto, vendita e attesa. Il testo seguente è elaborato con una chiamata API a Claude e rielaborato successivamente per l’articolo. In ogni aggiornamento si specificano alcune variabili importanti e le eventuali modifiche al codice e ai parametri analizzando le sessioni di training.

La singolarità dell’esperimento è l’utilizzo di un strumento di IA per migliorare le performance di un algoritmo di machine learning.

Grando ruggero

Panoramica del Periodo

Nel periodo analizzato fino al 4 giugno 2026, il sistema di trading basato sull’algoritmo di reinforcement learning Rainbow DQN ha completato un totale di 6640 episodi distribuiti su 5 sessioni di training. Le sessioni attive con dati completi sono principalmente la sessione 1 (2171 episodi) e la sessione 4 (2099 episodi), mentre le sessioni 2 e 3 risultano prive di episodi registrati nei metadati principali pur avendo dati statistici sugli episodi caricati, suggerendo una possibile anomalia nel sistema di tracciamento o nel salvataggio dei checkpoint.

Il quadro generale dell’apprendimento mostra un agente in progressivo miglioramento su diversi fronti: il win rate nelle sessioni complete oscilla tra il 77.9% e l’86.5%, valori che indicano una capacità di classificazione delle operazioni in crescita rispetto alle fasi iniziali. Tuttavia, alcune metriche — in particolare il Max Drawdown — rimangono critiche in quasi tutte le sessioni recenti, segnalando che il guadagno in termini di accuratezza non si traduce ancora in una gestione del rischio affidabile.

La loss di training converge in modo consistente verso valori molto bassi (intorno a 0.003–0.005) in tutte le sessioni analizzate, e l’epsilon greedy raggiunge il suo minimo configurato di 0.08 in tutti i run, segno che l’agente ha completato la fase di esplorazione e opera principalmente in modalità sfruttamento della policy appresa.

Metriche Chiave

SessioneEpisodiWin RatePnL CumulativoMax DrawdownTrade TotaliHOLD / BUY / SELLLoss Finale
Sessione 1217177.9%1000.00%99.90%19032.3% / 42.2% / 25.6%0.0054
Sessione 20 (dati parziali)0.0%0.00%0.00%0dato non disponibile0.0045
Sessione 30 (dati parziali)0.0%0.00%0.00%0dato non disponibile0.0044
Sessione 4209986.5%378.85%99.91%17819.3% / 40.3% / 40.5%0.0032
Sessione 5237081.1%147.25%18.37%3714.6% / 51.8% / 33.6%0.0030

Tabella 1
(Metriche chiave)

I dati presenti nella tabella uno mostrano un quadro contrastante. Il win rate elevato (fino all’86.5% nella sessione 4) è un segnale positivo, ma il Max Drawdown vicino al 100% nelle sessioni 1 e 4 indica che l’agente, in simulazione, subisce perdite di portafoglio quasi totali prima di recuperare. La sessione 5 è l’unica che presenta un drawdown contenuto (18.37%), suggerendo che in quel contesto di mercato l’agente ha operato in modo più prudente. Il PnL cumulativo del 1000% nella sessione 1 va interpretato con cautela: in ambiente simulato con drawdown al 99.9%, significa che l’agente rischia il capitale quasi completamente e recupera, un comportamento non accettabile in produzione.

Modifiche Apportate

Dall’analisi comparativa dei file di configurazione disponibili, non emergono modifiche strutturali ai parametri tra le sessioni analizzate. Tutti i run condividono gli stessi iperparametri fondamentali: learning rate a 0.0003, batch size 64, tau 0.005, replay frequency 2 e lookback window di 100 candele. Anche i parametri della rete neurale (LSTM a due livelli con 96 e 48 unità, dropout 0.15, dense layer a 96 unità) risultano invariati.

Questo suggerisce che stiamo valutando il comportamento dell’agente in condizioni di mercato diverse senza variare l’architettura, una scelta metodologicamente corretta per isolare l’effetto del dato di mercato rispetto a quello dell’iperparametro. Tuttavia, alla luce dei problemi persistenti di drawdown, nelle prossime iterazioni potrebbero essere necessari interventi mirati sulla reward function o sui parametri di penalizzazione del rischio.

Analisi del Comportamento dell’Agente

Il comportamento dell’agente mostra pattern differenti a seconda della sessione. Nella sessione 4, la distribuzione delle azioni è quasi perfettamente bilanciata tra BUY (40.3%) e SELL (40.5%), con HOLD al 19.3%: un pattern che indica un agente attivo, che entra ed esce dal mercato con frequenza simmetrica. Nella sessione 1, invece, prevalgono i BUY (42.2%) rispetto ai SELL (25.6%), con un HOLD più elevato (32.3%), suggerendo un bias direzionale verso posizioni lunghe.

La sessione 5 è particolarmente interessante: con soli 37 trade totali e una predominanza di BUY (51.8%), l’agente ha mantenuto posizioni a lungo senza eccessivo turnover, ottenendo il drawdown più basso del gruppo (18.37%). Questo comportamento più conservativo potrebbe essere il risultato di condizioni di mercato specifiche o di una fase di convergenza della policy più stabile.

Il trend della reward è positivo in tutte le sessioni con dati completi: la sessione 4 passa da -27.35 a +37.95 (+65.30 di incremento), la sessione 5 da -18.61 a +34.70 (+53.31). La sessione 1 migliora da -31.14 a -14.73, rimanendo tuttavia in territorio negativo, il che indica che l’apprendimento è avvenuto ma la policy non ha ancora raggiunto redditività consistente in quella configurazione.

Problemi Aperti e Sfide

1. Max Drawdown estremo nelle sessioni recenti. Le sessioni 1 e 4 mostrano un Max Drawdown del 99.90% e 99.91% rispettivamente. Questo valore, in simulazione, indica che l’agente porta il portafoglio quasi a zero prima di recuperare. Sebbene il PnL finale possa essere positivo, questo comportamento è incompatibile con un deploy in produzione e suggerisce che la reward function non penalizza sufficientemente le perdite di capitale prolungate.

2. Anomalie nel tracciamento delle sessioni 2 e 3. Le sessioni 2 e 3 risultano con 0 episodi completati nei metadati principali, pur avendo statistiche di episodi caricate (reward, win rate, loss). Questo disallineamento rende difficile l’analisi longitudinale e potrebbe indicare un problema nel sistema di logging o nel salvataggio dei checkpoint di fine sessione.

3. Reward media ancora negativa nella sessione più recente. La sessione 1 (la più recente, terminata il 4 giugno 2026) chiude con una reward media finale di -14.73. Nonostante il miglioramento rispetto all’inizio (-31.14), il valore negativo indica che l’agente non ha ancora consolidato una policy stabile e profittevole in questo specifico contesto di mercato.

Prossimi Passi

Nel prossimo ciclo di sviluppo, previsto per i prossimi giorni successivi al 4 giugno 2026, si interverrà su tre fronti principali:

  • Revisione della reward per il rischio: introdurre o rafforzare una penalizzazione esplicita per drawdown elevati all’interno della reward function, ad esempio aggiungendo un termine negativo proporzionale alla perdita massima registrata durante l’episodio. L’obiettivo è ridurre il Max Drawdown al di sotto del 30% nelle sessioni simulate.
  • Diagnosi del sistema di logging: investigare e risolvere l’anomalia che ha prodotto sessioni con 0 episodi registrati nei metadati principali (sessioni 2 e 3), garantendo la continuità e affidabilità dei dati per le analisi future.
  • Sperimentazione con numero di trade ottimali: la sessione 5 ha mostrato il miglior drawdown con soli 37 trade; si valuterà se ridurre il parametro optimal_trades_per_episode dall’attuale 30 verso valori inferiori per spingere l’agente verso un comportamento più selettivo e meno esposto al rischio di overtrading.

Conclusioni

Il sistema Rainbow DQN per il trading crypto mostra segnali concreti di apprendimento un win rate in crescita, loss in convergenza, reward trend positivo, ma affronta ancora sfide significative che ne impediscono la maturazione verso un deploy produttivo. Il problema più critico rimane il Max Drawdown quasi totale nelle sessioni principali, un dato che deve essere risolto prima di qualsiasi considerazione operativa. La sessione 5 offre uno spunto interessante: con un comportamento più conservativo e selettivo, l’agente ha ottenuto risultati molto più bilanciati. Il percorso da seguire sembra quindi orientarsi verso una maggiore disciplina nella gestione del rischio, piuttosto che verso un ulteriore raffinamento dell’architettura neurale, che appare già adeguata alla complessità del problema.

In tutto ciò che ho scritto, spero di aver trattato l’argomento in modo esaustivo, ma se qualcuno volesse esporre una qualche perplessità o domanda non esitate a “postare” dei commenti o ad inviarmi un e-mail a webmaster@megalinux.cloud.

Sostenete The Megalinux: In un mare di siti web sovraccarichi di pubblicità invadente, The Megalinux si distingue come l’unico rifugio libero da annunci. Abbiamo scelto di offrirvi un’esperienza di navigazione pulita e ininterrotta, ma per fare ciò, abbiamo bisogno del vostro supporto. Considerate l’idea di contribuire alla nostra missione inviando Bitcoin al nostro indirizzo. Anche una piccola donazione può fare la differenza e ci aiuterà a mantenere il sito libero da pubblicità.

È davvero difficile immaginare che esista qualcuno che, indipendentemente dalle donazioni ricevute (che non ci sono), continui a scrivere in totale libertà, tutto ciò o quasi che trova interessante?

3LpoukFpvDHTZPn5qGbLwUzve3rX9zsSq6

QR Code donazione Bitcoin

Articoli simili

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

4 × 4 =

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.