Deriva datelor (dataset shift)

by Mihaela Marinescu
4 minutes read
« Back to Glossary Index

(categorie: inteligență artificială, epidemiologie)

Deriva datelor este fenomenul prin care un model de predicție își pierde performanța în timp, pentru că populația, practicile medicale sau modul de colectare a datelor s-au schimbat față de momentul în care a fost construit.

Este una dintre cauzele pentru care modelele medicale eșuează după lansare, chiar dacă au funcționat bine la validare.

Cum funcționează

Un model de predicție nu învață biologia bolii în stare pură, ci biologia bolii așa cum a fost tratată la pacienții din datele de antrenament. Relațiile pe care le reține includ efectele îngrijirii de atunci.

Dacă practicile se schimbă, aceste relații se modifică. O complicație care era frecventă și devine rară nu mai apare cu aceeași probabilitate, iar modelul, care a învățat vechea frecvență, o supraestimează sistematic.

Există și alte forme de derivă. Populația se poate schimba — prin schimbări demografice, prin modificarea criteriilor de internare, prin apariția unor cauze noi de boală. Modul de măsurare se poate schimba — un laborator nou, o metodă de dozare diferită, alte valori de referință.

Efectul cel mai frecvent este pierderea calibrării, nu a discriminării. Modelul continuă să ordoneze corect pacienții după risc, dar cifrele afișate nu mai corespund frecvenței reale a evenimentelor.

Exemplul din pancreatita acută

Schimbarea practicii de hidratare

Datele de antrenament din MIMIC-IV acoperă 2008–2022, perioadă în care standardul era hidratarea agresivă, iar postul alimentar prelungit era frecvent.

Studiul WATERFALL

Publicat în septembrie 2022, a arătat că perfuziile masive cresc supraîncărcarea cu lichide fără beneficiu. Ghidul american care a consolidat noile recomandări a apărut în 2024.

Consecința pentru model

Insuficiența respiratorie, unul dintre rezultatele prezise, poate fi favorizată chiar de volumele mari administrate atunci. O parte din evenimentele învățate reflectă tratamentul de epocă.

Riscul de supraestimare

Dacă îngrijirea se îmbunătățește și aceste complicații devin mai rare, un model construit pe date vechi poate supraestima sistematic riscul.

Relevanță clinică

Acest exemplu este una dintre cele mai fine observații din studiul din 2026 și autorii o menționează explicit: practicile clinice și modul de colectare a datelor se schimbă odată cu ghidurile, iar acest lucru poate modifica performanța modelului.

Soluția nu este renunțarea la date istorice, ci monitorizarea continuă. Recalibrarea făcută de autori pe cohorta chineză este, de fapt, un exemplu de astfel de ajustare: probabilitățile au fost aliniate la frecvența reală a evenimentelor dintr-o populație nouă.

Un instrument folosit în practică ar avea nevoie de același lucru făcut periodic: verificarea regulată a calibrării pe pacienții actuali ai spitalului și actualizarea modelului atunci când îngrijirea sau populația se schimbă.

Reglementările europene pentru dispozitivele medicale și pentru sistemele de inteligență artificială cu risc ridicat cer tocmai această supraveghere după punerea în uz. Nu este o recomandare de bune practici, ci o obligație pentru instrumentele puse pe piață.

Consecința conceptuală este importantă: un model medical nu este un produs finit, ci un instrument care trebuie întreținut. Un algoritm care a funcționat acum cinci ani poate să nu mai funcționeze astăzi, fără ca nimeni să fi schimbat nimic în el.

Ce trebuie verificat

Perioada de colectare a datelor de antrenament și practicile din acea perioadă.

Schimbările majore de ghiduri survenite între timp.

Prezența unui plan de monitorizare a calibrării după punerea în uz.

Frecvența prevăzută pentru reevaluare și recalibrare.

Dacă modelul este destinat unei populații stabile sau în schimbare.

Factori care influențează riscul de derivă a datelor

Vechimea datelor de antrenament.

Schimbările de ghiduri și de practică terapeutică.

Modificările demografice ale populației.

Schimbările în criteriile de internare sau de includere.

Modificările metodelor de laborator.

Apariția unor cauze noi de boală.

Absența unei monitorizări periodice.

Deriva datelor în context Healthwise

Deriva datelor este problema care transformă un model medical din produs în serviciu: ceva care trebuie verificat și ajustat, nu instalat și uitat. Exemplul hidratării din pancreatita acută arată cât de subtil poate fi mecanismul — îngrijirea mai bună face modelul mai puțin exact.

Pe Healthwise, apare ca una dintre limitele structurale ale modelelor de predicție construite pe date istorice și ca argument pentru supravegherea după punerea în uz.

Concluzie

Deriva datelor este pierderea performanței unui model în timp, pentru că populația, practicile medicale sau metodele de măsurare s-au schimbat față de momentul construirii.

Ce trebuie reținut: un model învață biologia bolii așa cum a fost tratată, nu în stare pură — modelul din 2026 a fost antrenat pe o perioadă în care hidratarea agresivă era standardul; soluția este monitorizarea și recalibrarea periodică, cerută și de reglementările europene.

Synonyms:
deriva datelor, dataset shift, data drift, derivă a datelor, deplasare a distributiei datelor, model drift
« Back to Glossary Index
-
00:00
00:00
Update Required Flash plugin
-
00:00
00:00