Supraajustare (overfitting) by Mihaela Marinescu septembrie 27, 2026 written by Mihaela Marinescu septembrie 27, 2026 4 minutes read 0FacebookTwitterPinterestLinkedinWhatsappCopy LinkThreadsEmail 13 « Back to Glossary Index (categorie: statistică, inteligență artificială) Supraajustarea este situația în care un model învață nu doar relațiile reale din date, ci și zgomotul — particularitățile întâmplătoare ale pacienților din setul de antrenament, care nu se repetă la alți pacienți. Un model supraajustat pare excelent pe datele pe care a fost construit și dezamăgește pe date noi. Este principala capcană a inteligenței artificiale în medicină. Cum funcționează Orice set de date conține două componente: semnalul, adică relațiile reale dintre variabile și rezultat, și zgomotul, adică variația întâmplătoare. Un model prea flexibil are capacitatea de a reproduce ambele. Cu cât un algoritm are mai mulți parametri liberi raportat la numărul de exemple, cu atât riscul crește. Un model cu sute de arbori de decizie antrenat pe câteva sute de pacienți poate memora practic fiecare caz, în locul găsirii unei reguli generale. Semnul distinctiv este discrepanța: performanță foarte bună pe datele de antrenament și mult mai slabă pe date noi. De aceea evaluarea pe aceleași date pe care modelul a fost construit este lipsită de valoare. Antidotul este validarea. Validarea internă — de exemplu validarea încrucișată, în care datele sunt împărțite repetat în porțiuni de antrenament și de test — limitează supraajustarea, dar nu o exclude. Testul adevărat este validarea externă, pe pacienți dintr-un alt spital, dintr-o altă țară, dintr-o altă perioadă. Semne și mecanisme Performanță prea bună O arie sub curbă foarte mare este adesea un semnal de alarmă. Analiza sistematică din 2025 a găsit o valoare medie raportată de 0,91 în literatura despre pancreatita acută și a avertizat că reflectă probabil supraajustarea. Prea multe variabile Numărul de variabile raportat la numărul de evenimente este determinant. Regula orientativă cere cel puțin zece evenimente per variabilă. Eșantioane mici și selectate Un model construit pe 60 de pacienți, cum a fost unul dintre cele citate în studiul din 2026, are un risc mult mai mare. Absența validării externe Doar un studiu din 30 analizate în 2025 făcuse validare externă. Fără ea, performanța raportată nu poate fi crezută. Relevanță clinică Contrastul din studiul din 2026 este instructiv. Modelul lor a obținut 0,837 pe o cohortă externă, dintr-o altă țară, cu alt profil de pacienți. Literatura raporta o medie de 0,91, dar pe date proprii sau pe eșantioane atent selectate. Autorii analizei sistematice formulează regula: un model care obține 0,84 pe o cohortă externă spune mai mult decât unul care obține 0,95 pe propriile date de antrenament. În evaluarea inteligenței artificiale medicale, rigoarea validării cântărește mai mult decât mărimea cifrei. Există și o formă subtilă de supraajustare, prezentă chiar în studiul din 2026 și recunoscută de autori. Alegerea algoritmului XGBoost, stabilirea pragului de 20% și recalibrarea au fost făcute toate pe cohorta chineză, cea pe care a fost evaluată și performanța. Rezultatele modelelor originale pe această cohortă sunt o validare externă reală. Performanța modelului final, așa cum este implementat în aplicație, nu a fost însă testată pe pacienți complet noi — deci este, tehnic, o estimare optimistă. Aceasta se numește circularitate parțială a evaluării. Pentru un cititor, întrebarea practică în fața unui titlu despre un algoritm care „prezice cu o precizie de 90%” este simplă: a fost testat pe pacienți din alt spital? Răspunsul spune mai mult decât cifra. Cum se detectează Compararea performanței pe datele de antrenament cu cea pe date noi; o diferență mare indică supraajustare. Raportul dintre numărul de evenimente și numărul de variabile. Prezența unei validări externe, pe o populație diferită. Verificarea dacă selecția modelului, pragul și calibrarea au fost făcute pe alt set decât cel de evaluare. Coerența fiziologică a variabilelor reținute; un set fără logică biologică este suspect. Factori care influențează riscul de supraajustare Flexibilitatea algoritmului folosit. Numărul de parametri liberi raportat la numărul de exemple. Numărul de evenimente disponibile. Selecția variabilelor făcută pe același set ca evaluarea. Absența penalizărilor de complexitate. Dimensiunea și reprezentativitatea eșantionului. Numărul de modele testate înainte de alegerea celui final. Supraajustare în context Healthwise Supraajustarea este motivul pentru care, în inteligența artificială medicală, o performanță foarte bună trebuie privită cu mai multă suspiciune decât una modestă. Este un domeniu în care rezultatele prea frumoase sunt, statistic, mai probabil greșite. Pe Healthwise, apare ca principala capcană metodologică a studiilor de predicție clinică și ca reper pentru citirea critică a cifrelor raportate. Concluzie Supraajustarea este învățarea zgomotului din datele de antrenament, alături de relațiile reale, ceea ce face ca modelul să pară excelent pe acele date și să dezamăgească pe date noi. Ce trebuie reținut: o performanță foarte bună este adesea un semnal de alarmă, nu de calitate; singurul antidot serios este validarea externă; iar un model care obține 0,84 pe pacienți din alt spital spune mai mult decât unul cu 0,95 pe propriile date. Synonyms: supraajustare, supraadaptare, overfitting, supraînvățare, supraajustarea modelului« Back to Glossary Index Mihaela Marinescu Sunt Mihaela Marinescu, fondatoarea Healthwise.ro și editor specializat în conținut despre sănătate, beauty, nutriție funcțională și prevenție. Am studiat Medicina la Universitatea de Medicină și Farmacie „Carol Davila” din București, experiență care mi-a format interesul pentru corpul uman, biologie și educație medicală explicată clar. Prin Healthwise, îmi propun să traduc informația științifică și cele mai noi cercetări internaționale într-un limbaj accesibil, cald și responsabil. În medicină există un cuvânt important: complianță. Din punctul meu de vedere, complianța reală nu se naște din frică sau din instrucțiuni greu de urmat, ci din înțelegere. Oamenii au mai multe șanse să aibă grijă de sănătatea lor atunci când înțeleg ce se întâmplă în corp, de ce contează anumite alegeri și cum pot integra recomandările medicale într-o viață reală. Motivul pentru care site-ul se numește Healthwise pornește de la o convingere simplă: un om sănătos are mai multă energie pentru înțelepciune, creștere personală și o viață cu sens. Când sănătatea este susținută prin alegeri informate, ea nu mai consumă tot spațiul interior în jurul bolii, ci devine terenul pe care se poate construi. Astfel, Health și Wise se hrănesc reciproc: sănătatea face loc înțelepciunii, iar înțelepciunea protejează sănătatea. Conținutul publicat pe Healthwise are scop educațional și nu înlocuiește consultul medical, diagnosticul sau recomandarea unui specialist. Dacă te regăsești în semnele, simptomele sau situațiile descrise în articole, îți recomand să discuți cu un medic sau cu un specialist potrivit. Știința oferă informația, dar clinicianul este cel care o interpretează și o aplică în contextul tău personal. previous post Date tabelare next post Validare încrucișată