Random forest by Mihaela Marinescu septembrie 27, 2026 written by Mihaela Marinescu septembrie 27, 2026 4 minutes read 0FacebookTwitterPinterestLinkedinWhatsappCopy LinkThreadsEmail 13 « Back to Glossary Index (categorie: inteligență artificială, statistică) Random forest este un algoritm care construiește sute de arbori de decizie pe eșantioane diferite din aceleași date și combină predicțiile lor prin medie sau prin vot. Numele descrie exact mecanismul: o pădure de arbori construiți cu elemente de întâmplare. În studiul din 2026 a obținut a treia cea mai bună discriminare, cu o arie sub curbă de 0,806, după XGBoost și LightGBM. Cum funcționează Fiecare arbore este construit pe un eșantion extras cu înlocuire din datele originale, deci pe o versiune ușor diferită a setului. În plus, la fiecare punct de ramificare, algoritmul ia în considerare doar un subset ales aleatoriu dintre variabile. Cele două surse de întâmplare fac arborii diferiți între ei. Un arbore singur este instabil — o mică schimbare în date îi modifică structura —, dar media a sute de arbori diferiți este stabilă. Erorile individuale se anulează reciproc. Diferența față de gradient boosting este arhitecturală. Aici arborii sunt independenți și pot fi construiți în paralel; acolo sunt secvențiali, fiecare corectând erorile precedentului. Random forest reduce variabilitatea, gradient boosting reduce eroarea sistematică. Consecința practică este că random forest este robust la zgomot și greu de supraajustat, dar tinde să producă probabilități prost calibrate: media voturilor arborilor nu corespunde direct unei probabilități reale. Caracteristici Robustețe la zgomot Combinarea multor arbori independenți face algoritmul puțin sensibil la valori aberante și la particularitățile unui singur eșantion. Probabilități prost calibrate Punctul slab tipic. În studiul din 2026, panta de calibrare a fost 0,311, comparabilă cu cea a celorlalți algoritmi bazați pe arbori. Sensibilitate mare la pragul de 20% 0,667 — cea mai bună dintre toate modelele — dar cu precizia cea mai mică dintre modelele de vârf, 0,259, și cu o acuratețe de doar 0,532. Evaluarea importanței variabilelor Permite estimarea contribuției fiecărei variabile, utilă în selecția lor. Metoda Boruta, folosită în studiu, se bazează pe acest mecanism. Relevanță clinică Cifrele din studiu ilustrează bine compromisul. Random forest a detectat 30 din 45 de pacienți care s-au agravat, mai mulți decât XGBoost, dar a semnalat un număr mult mai mare de pacienți care nu s-au agravat. Acuratețea generală a scăzut la 0,532, adică puțin peste aruncarea unei monede. Aceasta arată de ce acuratețea singură este un indicator înșelător într-o boală în care evenimentul este relativ rar. Un model care semnalează aproape pe toată lumea ca având risc crescut va detecta majoritatea cazurilor severe și va avea, în același timp, o acuratețe slabă. Legătura cu metoda Boruta este directă și merită explicată. Boruta compară importanța fiecărei variabile reale, calculată prin random forest, cu importanța unor variabile-umbră generate aleatoriu. O variabilă este păstrată doar dacă depășește constant nivelul acestui zgomot. În studiu, Boruta a confirmat nouă variabile din 27. Autorii au reținut numai variabilele alese atât de LASSO, cât și de Boruta — două metode independente, cu mecanisme diferite. Intersecția a fost de șase variabile. Această dublă filtrare reduce riscul de a păstra variabile care par utile din întâmplare. Toate cele trei modele bazate pe arbori au depășit scorul BISAP la discriminare, ceea ce susține concluzia generală a studiului: pentru date tabelare, această familie de algoritmi este alegerea potrivită. Ce trebuie verificat Acuratețea singură este înșelătoare când evenimentul este rar; se raportează împreună cu sensibilitatea și precizia. Calibrarea necesită verificare și, de obicei, ajustare. Numărul de arbori și numărul de variabile testate la fiecare ramificație sunt parametrii principali. Importanța variabilelor calculată de algoritm poate fi influențată de corelațiile dintre ele. Pe cohorte mici, diferențele față de alți algoritmi bazați pe arbori nu sunt definitive. Factori care influențează performanța random forest Numărul de arbori construiți. Numărul de variabile testate la fiecare ramificație. Adâncimea maximă permisă. Dimensiunea eșantioanelor extrase. Proporția de evenimente în date. Corelațiile dintre variabile. Aplicarea unei recalibrări. Random forest în context Healthwise Random forest este algoritmul care a arătat, la începutul anilor 2000, că mulți predictori slabi combinați bat un predictor bine construit. Este și baza metodei Boruta, folosită în studiul din 2026 pentru selecția variabilelor — deci contribuția lui acolo depășește simpla comparație de performanță. Pe Healthwise, apare printre familiile de algoritmi comparate în studiile de predicție clinică și în explicarea metodei Boruta. Concluzie Random forest construiește sute de arbori de decizie pe eșantioane și pe subseturi de variabile alese aleatoriu, apoi combină predicțiile lor. Este robust la zgomot, dar produce probabilități prost calibrate. Ce trebuie reținut: în studiul din 2026 a avut cea mai mare sensibilitate la pragul de 20%, dar cu multe alarme false și o acuratețe de doar 0,532; iar mecanismul lui stă la baza metodei Boruta de selecție a variabilelor. Synonyms: random forest, padure aleatoare, pădure aleatoare, paduri aleatorii« Back to Glossary Index Mihaela Marinescu Sunt Mihaela Marinescu, fondatoarea Healthwise.ro și editor specializat în conținut despre sănătate, beauty, nutriție funcțională și prevenție. Am studiat Medicina la Universitatea de Medicină și Farmacie „Carol Davila” din București, experiență care mi-a format interesul pentru corpul uman, biologie și educație medicală explicată clar. Prin Healthwise, îmi propun să traduc informația științifică și cele mai noi cercetări internaționale într-un limbaj accesibil, cald și responsabil. În medicină există un cuvânt important: complianță. Din punctul meu de vedere, complianța reală nu se naște din frică sau din instrucțiuni greu de urmat, ci din înțelegere. Oamenii au mai multe șanse să aibă grijă de sănătatea lor atunci când înțeleg ce se întâmplă în corp, de ce contează anumite alegeri și cum pot integra recomandările medicale într-o viață reală. Motivul pentru care site-ul se numește Healthwise pornește de la o convingere simplă: un om sănătos are mai multă energie pentru înțelepciune, creștere personală și o viață cu sens. Când sănătatea este susținută prin alegeri informate, ea nu mai consumă tot spațiul interior în jurul bolii, ci devine terenul pe care se poate construi. Astfel, Health și Wise se hrănesc reciproc: sănătatea face loc înțelepciunii, iar înțelepciunea protejează sănătatea. Conținutul publicat pe Healthwise are scop educațional și nu înlocuiește consultul medical, diagnosticul sau recomandarea unui specialist. Dacă te regăsești în semnele, simptomele sau situațiile descrise în articole, îți recomand să discuți cu un medic sau cu un specialist potrivit. Știința oferă informația, dar clinicianul este cel care o interpretează și o aplică în contextul tău personal. previous post LightGBM next post Arbore de decizie