← Torna ai progetti

Credit Card Fraud Detection (AWS SageMaker)

Completato

Pipeline ML end-to-end per il rilevamento delle frodi con carta di credito su AWS SageMaker, con focus sulla gestione dello sbilanciamento delle classi, l'ottimizzazione della soglia per le decisioni aziendali e lo sviluppo di framework ML riutilizzabili e agnostici al dominio.

Tecnologie

AWS SageMakerAWS S3AWS AthenaPythonXGBoostscikit-learnSHAPimbalanced-learnJupyter

Problema

I casi di frode rappresentano solo lo 0,17% delle transazioni. Un modello naïve raggiunge il 99,83% di accuratezza prevedendo sempre "legittimo" — l'accuratezza da sola è quindi fuorviante. La vera sfida è trovare il giusto compromesso precisione-richiamo basato sulle assunzioni di costo aziendali.

Approccio

Workflow ML in 7 fasi: Valutazione iniziale dei dati → Feature Engineering → EDA & Visualizzazione → Modellazione di base (pesi di classe, SMOTE, sottocampionamento) → Ottimizzazione della soglia. Script Python parametrizzati e prompt Claude agnostici al dominio per ogni fase.

Risultato

Modello di rilevamento frodi con soglia di classificazione ottimizzata e un framework di workflow ML completamente documentato e riutilizzabile, applicabile a qualsiasi compito di classificazione.

Apprendimenti

L'AUC-PR è più informativo dell'accuratezza per dataset sbilanciati; la selezione della soglia è una decisione aziendale, non un parametro del modello; generalizzare i framework da dominio-specifico ad agnostico aumenta il valore di riutilizzo a lungo termine.

Rilevanza

Dimostra ML engineering, integrazione AWS SageMaker, workflow di sviluppo assistiti da IA, progettazione di framework riutilizzabili e pensiero end-to-end dai dati grezzi alla decisione aziendale.