Scor F1

by Mihaela Marinescu
3 minutes read
« Back to Glossary Index

(categorie: statistică, inteligență artificială)

Scorul F1 combină precizia și sensibilitatea într-o singură cifră, prin media armonică a celor două. Este folosit pentru a compara modele când ambele proprietăți contează și când niciuna nu trebuie sacrificată complet.

Media armonică, nu aritmetică, este alegerea deliberată: penalizează puternic un model care excelează la una și eșuează la cealaltă.

Cum funcționează

Precizia arată ce proporție dintre pacienții semnalați s-au agravat efectiv. Sensibilitatea arată ce proporție dintre cei care s-au agravat au fost semnalați. Cele două se află în tensiune: coborârea pragului crește una și scade cealaltă.

Media aritmetică ar masca dezechilibrele. Un model cu precizie 1,0 și sensibilitate 0,0 — care semnalează un singur pacient, corect, și ratează toți ceilalți — ar obține 0,5, o valoare aparent rezonabilă. Media armonică îi dă 0.

Media armonică dă un rezultat apropiat de cea mai mică dintre cele două valori. Un scor F1 bun cere deci ca ambele să fie decente, nu ca una să compenseze pentru cealaltă.

Limita este că tratează precizia și sensibilitatea ca fiind la fel de importante, ceea ce este rar adevărat în medicină. Într-o boală în care ratarea unui caz sever costă mult mai mult decât o monitorizare în plus, sensibilitatea merită o pondere mai mare.

Rezultate din studiul din 2026

XGBoost

Precizie 0,347, sensibilitate 0,556, scor F1 0,427 — cel mai bun dintre toate modelele testate.

LightGBM

Precizie 0,302, sensibilitate 0,644, scor F1 0,411 — sensibilitate mai bună, precizie mai slabă, rezultat combinat apropiat.

Scorul BISAP

Precizie 0,325, sensibilitate 0,556, scor F1 0,410 — practic la egalitate cu LightGBM.

Random forest

Precizie 0,259, sensibilitate 0,667, scor F1 0,373 — cea mai bună detectare, cel mai slab echilibru.

Relevanță clinică

Valorile absolute merită remarcate: cel mai bun scor F1 obținut a fost 0,427, pe o scală de la 0 la 1. Nu este o performanță impresionantă, iar cifra spune ceva important despre dificultatea reală a problemei.

Comparația cu scorul BISAP este din nou instructivă. Diferența dintre 0,427 pentru XGBoost și 0,410 pentru BISAP este mică, pe o cohortă de 216 pacienți cu 45 de evenimente. Pentru un scor construit din cinci elemente adunate pe hârtie, este un rezultat remarcabil.

Autorii au raportat setul complet de metrice — acuratețe, precizie, sensibilitate, scor F1, scor Brier și panta de calibrare — la pragul de 20%. Această transparență permite o comparație mult mai nuanțată decât valoarea ariei sub curbă singură.

Citit atent, tabelul temperează entuziasmul. XGBoost și BISAP au avut aceeași sensibilitate, iar XGBoost o acuratețe și o precizie doar ușor mai bune. BISAP a avut cel mai bun scor Brier și cea mai bună calibrare dintre instrumentele originale.

Pentru citirea studiilor, scorul F1 este util ca sumar, dar nu înlocuiește raportarea separată a preciziei și a sensibilității. O singură cifră nu poate spune care dintre cele două a fost sacrificată.

Ce trebuie verificat

Precizia și sensibilitatea raportate separat, nu doar scorul combinat.

Pragul de decizie la care au fost calculate.

Dacă echilibrul între cele două este potrivit pentru boala în cauză.

Intervalele de încredere, când evenimentele sunt puține.

Comparația cu instrumentele existente, nu doar între algoritmi noi.

Factori care influențează valoarea scorului F1

Pragul de decizie folosit.

Frecvența evenimentului în populație.

Capacitatea de discriminare a modelului.

Echilibrul dintre precizie și sensibilitate la acel prag.

Criteriile de selecție a pacienților.

Numărul de evenimente disponibile.

Definiția rezultatului prezis.

Scor F1 în context Healthwise

Scorul F1 este o încercare de a răspunde la întrebarea „cât de bun este modelul, per total” cu o singură cifră care nu poate fi păcălită prin sacrificarea unei proprietăți. Valorile obținute în studiul din 2026 — cel mai bun 0,427 — spun că problema predicției severității în pancreatita acută rămâne dificilă.

Pe Healthwise, apare printre metricele raportate în studiile de predicție clinică și ca reper pentru echilibrul dintre detectare și alarme false.

Concluzie

Scorul F1 combină precizia și sensibilitatea prin media armonică, penalizând modelele care excelează la una și eșuează la cealaltă.

Ce trebuie reținut: în studiul din 2026, cel mai bun scor F1 a fost 0,427 pentru XGBoost, foarte apropiat de 0,410 obținut de scorul BISAP; iar o singură cifră nu spune care dintre cele două proprietăți a fost sacrificată.

Synonyms:
scor F1, F1, F-scor, F-measure, F1 score
« Back to Glossary Index
-
00:00
00:00
Update Required Flash plugin
-
00:00
00:00