Capitolo 38
Distribuzioni di frequenza assolute, relative, percentuali

WEB (Materiali vari)

“Il pensiero statistico sarà un giorno necessario per la cittadinanza efficiente come la capacità di leggere e scrivere.”
— H.G. Wells

____________________________________________________________________________________

Studia questo capitolo con l’AI: quiz, esercizi e altro

Ripassa con le flashcard

Esercizi auto-generati

Sorgente di questo capitolo

Schede, test e video di matematika.it

Esercizi del prof. De Capoa

Presentazioni— slide NotebookLM (clic per aprire il PDF)

Audio overview— podcast NotebookLM (clic per ascoltare)

[IT] Statistica A

[IT] Statistica descrittiva

Apriamo con questo capitolo la sezione dedicata alla statistica descrittiva, la disciplina che si occupa di raccogliere, organizzare, riassumere e rappresentare dati. A differenza della matematica “deduttiva” che abbiamo finora praticato — dove a partire da definizioni e assiomi si ottengono teoremi — la statistica è una disciplina induttiva: parte dall’osservazione del mondo reale e cerca di estrarre informazione, regolarità e tendenze da insiemi di dati.

L’epigrafe di Wells, scritta più di un secolo fa, è oggi più attuale che mai: viviamo immersi in dati (sondaggi, classifiche, indici economici, statistiche sanitarie, dati climatici) e la capacità di leggerli criticamente, riconoscendone limiti e potenzialità, è un’abilità democratica fondamentale. Comincia con i mattoni più elementari: il concetto di carattere, la nozione di frequenza nelle sue varie forme (assoluta, relativa, percentuale, cumulata), e le tabelle di frequenza, lo strumento con cui si organizza una qualsiasi rilevazione statistica.

38.1 Carattere e modalità

quiz e materiali con l’AI

flashcard del paragrafo

Ogni indagine statistica parte dalla scelta di una popolazione e di un carattere di interesse.

Definizione 38.1 — Popolazione, unità statistica, carattere

La popolazione è l’insieme di tutti gli elementi su cui si svolge l’indagine; ogni elemento della popolazione si chiama unità statistica. Il carattere (o variabile statistica) è la proprietà che si rileva su ciascuna unità statistica. I valori che il carattere può assumere si chiamano modalità.

Esempi:

Caratteri qualitativi e quantitativi

Definizione 38.2 — Tipi di caratteri

Un carattere si dice:

I caratteri quantitativi si dividono ulteriormente in:

I caratteri qualitativi a loro volta si distinguono in sconnessi (le modalità non hanno un ordine naturale: colore degli occhi, marca dell’auto) e ordinati (le modalità ammettono un ordinamento: giudizio scolastico “insufficiente / sufficiente / buono / ottimo”; titolo di studio).

Sapere a quale tipo appartiene il carattere è importante perché determina quali operazioni statistiche sono lecite: ad esempio, calcolare la “media” dei colori preferiti non ha senso, ma calcolare la media delle altezze sì.

Attenzione!

Numero e quantità non sono la stessa cosa. Anche se le modalità di un carattere sono numeriche, ciò non basta a renderlo “quantitativo” in senso pieno. Ad esempio, i numeri di maglia dei giocatori di una squadra di calcio sono numeri, ma fungono solo da etichette: non ha senso calcolare la media dei numeri di maglia, né dire che il giocatore con il numero \(20\) “vale il doppio” del giocatore con il numero \(10\). Caratteri di questo tipo si dicono nominali e vanno trattati come qualitativi anche se i loro valori si scrivono con cifre.

38.2 Frequenza assoluta

quiz e materiali con l’AI

flashcard del paragrafo

Quando si raccolgono i dati di un’indagine, la prima operazione è contare quante unità statistiche presentano ciascuna modalità del carattere.

Definizione 38.3 — Frequenza assoluta

Sia \(X\) un carattere rilevato su una popolazione di \(N\) unità statistiche. La frequenza assoluta della modalità \(x_i\), denotata \(f_i\), è il numero di unità statistiche della popolazione che presentano la modalità \(x_i\).

Se le modalità distinte del carattere sono \(k\), denotate \(x_1, x_2, \dots , x_k\), le frequenze assolute corrispondenti \(f_1, f_2, \dots , f_k\) soddisfano la relazione fondamentale

\[ \sum _{i=1}^{k} f_i = f_1 + f_2 + \dots + f_k = N , \]

poiché ogni unità statistica appartiene a una e una sola modalità.

Esempio 38.1 — Frequenza assoluta del colore preferito

In una classe di \(24\) studenti si chiede a ciascuno qual è il colore preferito fra cinque opzioni proposte. Le risposte raccolte sono riportate nella seguente tabella di frequenza:

Colore \(x_i\) Frequenza assoluta \(f_i\)
Rosso \(7\)
Blu \(6\)
Verde \(5\)
Giallo \(4\)
Nero \(2\)
Totale \(\mathbf {24}\)

Verifica: la somma delle frequenze, \(7 + 6 + 5 + 4 + 2 = 24\), è pari al totale degli studenti, in accordo con la relazione \(\sum f_i = N\).

38.3 Frequenza relativa e percentuale

quiz e materiali con l’AI

flashcard del paragrafo

Le frequenze assolute danno una prima fotografia dei dati, ma non si prestano bene al confronto fra rilevazioni di dimensioni diverse: dire che \(15\) studenti preferiscono il rosso è un dato molto diverso a seconda che la classe sia di \(20\) o di \(200\) studenti. Si introducono perciò le frequenze relative, che esprimono la quota di unità statistiche con una data modalità rispetto al totale.

Definizione 38.4 — Frequenza relativa

La frequenza relativa della modalità \(x_i\), denotata \(\phi _i\) (o \(f_i^{\text {rel}}\)), è il rapporto fra la frequenza assoluta \(f_i\) e il totale \(N\):

\[ \phi _i = \frac {f_i}{N} . \]

Le frequenze relative godono di tre proprietà fondamentali:

1.
sono numeri compresi fra \(0\) e \(1\): \(0 \leq \phi _i \leq 1\);
2.
sommano a \(1\): \(\sum _{i=1}^{k} \phi _i = 1\);
3.
sono adimensionali (puri rapporti).

Frequenza percentuale

Spesso si preferisce esprimere le frequenze relative in forma percentuale, moltiplicandole per \(100\). La frequenza percentuale ha il vantaggio di essere immediatamente comprensibile (“\(25\) su \(100\)”) ed è la forma con cui ci imbattiamo più spesso nella vita quotidiana.

Definizione 38.5 — Frequenza percentuale

La frequenza percentuale della modalità \(x_i\), denotata \(\phi _i^{\%}\), è

\[ \phi _i^{\%} = \phi _i \cdot 100 = \frac {f_i}{N} \cdot 100 \quad [\%] . \]

Le frequenze percentuali sommano a \(100\), cioè \(\sum \phi _i^{\%} = 100\,{\% }\). Si noti che la frequenza percentuale è il modo abituale di esprimere risultati di sondaggi, distribuzioni in popolazioni, ecc. : “il \(45\,{\% }\) degli intervistati”, “il tasso di disoccupazione è del \(8.2\,{\% }\)”, e così via.

Esempio 38.2 — Frequenza relativa e percentuale

Riprendiamo l’esempio del colore preferito. Costruiamo la tabella estesa con frequenze relative e percentuali.

Colore \(x_i\) Assoluta \(f_i\) Relativa \(\phi _i\) Percentuale \(\phi _i^{\%}\)
Rosso \(7\) \(7/24 \approx 0.292\) \(\approx 29.2\,{\% }\)
Blu \(6\) \(6/24 = 0.250\) \(25.0\,{\% }\)
Verde \(5\) \(5/24 \approx 0.208\) \(\approx 20.8\,{\% }\)
Giallo \(4\) \(4/24 \approx 0.167\) \(\approx 16.7\,{\% }\)
Nero \(2\) \(2/24 \approx 0.083\) \(\approx 8.3\,{\% }\)
Totale \(\mathbf {24}\) \(\mathbf {1.000}\) \(\mathbf {100.0\,{\% }}\)

Verifica. Le frequenze relative sommano a \(1\) (a meno di errori di arrotondamento sulle terze decimali), e le percentuali sommano a \(100\,{\% }\).

Attenzione!

Arrotondamenti. Sommando frequenze relative o percentuali arrotondate, il totale può essere leggermente diverso da \(1\) (o da \(100\,{\% }\)). Nell’esempio sopra, \(0.292 + 0.250 + 0.208 + 0.167 + 0.083 = 1.000\) è esatto; ma con arrotondamenti più aggressivi si possono ottenere \(99.9\) o \(100.1\). Si tratta di una conseguenza inevitabile dell’arrotondamento: la somma delle frequenze non arrotondate è sempre esattamente \(1\), ma le approssimazioni introducono piccoli scarti che è opportuno segnalare quando significativi.

38.4 Frequenza cumulata

quiz e materiali con l’AI

flashcard del paragrafo

Per i caratteri quantitativi o qualitativi ordinati (cioè quando le modalità ammettono un ordinamento naturale) è utile considerare anche le frequenze cumulate: si tratta delle frequenze che “si accumulano” procedendo da una modalità all’altra in ordine crescente.

Definizione 38.6 — Frequenze cumulate

Siano \(x_1 < x_2 < \dots < x_k\) le modalità di un carattere ordinato, con frequenze assolute \(f_1, f_2, \dots , f_k\). Si definiscono:

L’utilità delle frequenze cumulate sta nel rispondere a domande del tipo “quante unità statistiche hanno una modalità minore o uguale a \(x_i\)?”. Ad esempio: “quanti studenti hanno un voto sufficiente o inferiore?”, “quale percentuale di intervistati ha meno di \(30\) anni?”.

L’ultima frequenza cumulata \(F_k\) coincide sempre con il totale \(N\) (perché entro l’ultima modalità sono accumulate tutte le unità); analogamente, \(\Phi _k = 1\) e \(\Phi _k^{\%} = 100\,{\% }\).

Esempio 38.3 — Frequenze cumulate dei voti

In una classe di \(25\) studenti si rilevano i voti in matematica del primo compito, espressi in decimi. La tabella seguente riporta frequenze assolute, relative, percentuali, e le rispettive cumulate.

Voto \(f_i\) \(\phi _i\) \(\phi _i^{\%}\) \(F_i\) \(\Phi _i^{\%}\)
\(4\) \(2\) \(0.08\) \(8\,{\% }\) \(2\) \(8\,{\% }\)
\(5\) \(4\) \(0.16\) \(16\,{\% }\) \(6\) \(24\,{\% }\)
\(6\) \(7\) \(0.28\) \(28\,{\% }\) \(13\) \(52\,{\% }\)
\(7\) \(6\) \(0.24\) \(24\,{\% }\) \(19\) \(76\,{\% }\)
\(8\) \(4\) \(0.16\) \(16\,{\% }\) \(23\) \(92\,{\% }\)
\(9\) \(2\) \(0.08\) \(8\,{\% }\) \(25\) \(100\,{\% }\)
Totale \(\mathbf {25}\) \(\mathbf {1.00}\) \(\mathbf {100\,{\% }}\)

Lettura della tabella.

38.5 Tabelle di frequenza

quiz e materiali con l’AI

flashcard del paragrafo

Quanto visto negli esempi è in pratica la tabella di frequenza, lo strumento standard con cui si organizzano i dati di una rilevazione.

Procedura  — Costruzione di una tabella di frequenza

1.
Identifica il carattere oggetto della rilevazione e raccogli i dati grezzi (lista non ordinata delle modalità osservate per ogni unità statistica).
2.
Elenca le modalità distinte del carattere; se è qualitativo ordinato o quantitativo, mettile in ordine.
3.
Conta le frequenze assolute \(f_i\) per ciascuna modalità (es. usando una colonna di “barrette” per il conteggio manuale).
4.
Calcola il totale \(N = \sum f_i\) e verifica che coincida con il numero di unità statistiche rilevate.
5.
Calcola le frequenze relative \(\phi _i = f_i / N\) e percentuali \(\phi _i^{\%} = \phi _i \cdot 100\).
6.
Se il carattere è ordinato, aggiungi le frequenze cumulate \(F_i\) e \(\Phi _i^{\%}\).
7.
Verifica le somme: \(\sum f_i = N\), \(\sum \phi _i = 1\), \(\sum \phi _i^{\%} = 100\,{\% }\), \(F_k = N\), \(\Phi _k^{\%} = 100\,{\% }\).

Caratteri continui: raggruppamento in classi

Quando il carattere è quantitativo continuo, oppure discreto ma con un numero elevato di modalità distinte, la tabella di frequenza con tutte le modalità singole sarebbe ingestibile e poco informativa. Si raggruppano allora i valori in classi: intervalli consecutivi della retta numerica.

Definizione 38.7 — Distribuzione per classi

Una distribuzione per classi è una tabella di frequenza in cui le modalità sono intervalli (classi), tipicamente di ampiezza costante. Per ogni classe si riportano la frequenza assoluta, relativa, percentuale e, se opportuno, le rispettive cumulate.

Per costruire una distribuzione per classi:

Una convenzione frequente è di considerare le classi del tipo \([x_i, x_{i+1})\): l’estremo inferiore è incluso, quello superiore escluso. In questo modo ogni unità statistica appartiene a una sola classe, senza ambiguità ai punti di confine.

Esempio 38.4 — Distribuzione per classi dell’altezza

Si rilevano le altezze in centimetri di \(30\) studenti, ottenendo valori da \(152\,{\mathrm{c} \mathrm{m} }\) a \(188\,{\mathrm{c} \mathrm{m} }\). Decidiamo di organizzare i dati in \(6\) classi di ampiezza \(6\,{\mathrm{c} \mathrm{m} }\):

Classe (cm) \(f_i\) \(\phi _i^{\%}\) \(F_i\)
\([152, 158)\) \(3\) \(10.0\,{\% }\) \(3\)
\([158, 164)\) \(6\) \(20.0\,{\% }\) \(9\)
\([164, 170)\) \(8\) \(\approx 26.7\,{\% }\) \(17\)
\([170, 176)\) \(7\) \(\approx 23.3\,{\% }\) \(24\)
\([176, 182)\) \(4\) \(\approx 13.3\,{\% }\) \(28\)
\([182, 188]\) \(2\) \(\approx 6.7\,{\% }\) \(30\)
Totale \(\mathbf {30}\) \(\mathbf {100.0\,{\% }}\)

Lettura della tabella.

Nota

Quante classi scegliere? Non esiste una regola unica. Tradizionalmente si usano regole empiriche: la regola di Sturges, \(k = 1 + \log _2 N \approx 1 + 3.322 \cdot \log _{10} N\), suggerisce ad esempio \(k = 6\) per \(N = 30\), \(k = 8\) per \(N = 100\), \(k = 11\) per \(N = 1000\). Più importante della regola precisa è il principio: troppe poche classi nascondono la struttura dei dati, troppe (specie con \(N\) piccolo) la frammentano in modo poco informativo.

Esempi svolti

Esempio 38.5 — Dati grezzi a tabella di frequenza

Si chiede a \(20\) persone quanti libri hanno letto nell’ultimo anno. Le risposte raccolte sono:

\[ 2, 5, 0, 3, 1, 4, 2, 6, 0, 2, 1, 3, 4, 2, 0, 5, 1, 2, 3, 6 . \]

Costruiamo la tabella di frequenza.

Conteggio delle modalità distinte.

Libri letti \(x_i\) \(f_i\) \(\phi _i\) \(\phi _i^{\%}\) \(F_i\) \(\Phi _i^{\%}\)
\(0\) \(3\) \(0.15\) \(15\,{\% }\) \(3\) \(15\,{\% }\)
\(1\) \(3\) \(0.15\) \(15\,{\% }\) \(6\) \(30\,{\% }\)
\(2\) \(5\) \(0.25\) \(25\,{\% }\) \(11\) \(55\,{\% }\)
\(3\) \(3\) \(0.15\) \(15\,{\% }\) \(14\) \(70\,{\% }\)
\(4\) \(2\) \(0.10\) \(10\,{\% }\) \(16\) \(80\,{\% }\)
\(5\) \(2\) \(0.10\) \(10\,{\% }\) \(18\) \(90\,{\% }\)
\(6\) \(2\) \(0.10\) \(10\,{\% }\) \(20\) \(100\,{\% }\)
Totale \(\mathbf {20}\) \(\mathbf {1.00}\) \(\mathbf {100\,{\% }}\)

Lettura.

Esempio 38.6 — Confronto fra rilevazioni di dimensione diversa

In una scuola, i questionari sul giudizio dell’orario scolastico hanno dato i seguenti risultati:

Giudizio Classe A (\(N_A = 25\)) Classe B (\(N_B = 40\))
Insoddisfacente \(4\) \(8\)
Sufficiente \(8\) \(14\)
Buono \(9\) \(12\)
Ottimo \(4\) \(6\)
Totale \(\mathbf {25}\) \(\mathbf {40}\)

A prima vista la classe B sembra avere più giudizi positivi della classe A. Ma le due classi hanno numerosità diversa: per confrontarle correttamente occorre passare alle frequenze percentuali.

Giudizio Classe A (%) Classe B (%)
Insoddisfacente \(16.0\,{\% }\) \(20.0\,{\% }\)
Sufficiente \(32.0\,{\% }\) \(35.0\,{\% }\)
Buono \(36.0\,{\% }\) \(30.0\,{\% }\)
Ottimo \(16.0\,{\% }\) \(15.0\,{\% }\)
Totale \(\mathbf {100\,{\% }}\) \(\mathbf {100\,{\% }}\)

Conclusione. La classe A ha in realtà una distribuzione di giudizi leggermente più positiva della classe B (sommando “buono” e “ottimo”: \(52\,{\% }\) in A contro \(45\,{\% }\) in B). L’apparente vantaggio della classe B nei dati assoluti era dovuto solo alla sua numerosità maggiore. È un esempio paradigmatico di come la frequenza percentuale sia indispensabile per confronti corretti.

Esercizio 38.1

1.
Per ciascuno dei seguenti caratteri, indica se è qualitativo (sconnesso o ordinato) o quantitativo (discreto o continuo), motivando.
(a)
Colore degli occhi degli studenti di una classe.
(b)
Numero di fratelli e sorelle.
(c)
Lunghezza del piede in cm.
(d)
Titolo di studio.
(e)
Numero di scarpe (con misura intera).
(f)
Tempo impiegato a percorrere \(100\,{\mathrm{m} }\).
(g)
Squadra di calcio preferita.
(h)
Voti di un’interrogazione (espressi in decimi).
2.
In una classe di \(20\) studenti, i mezzi di trasporto usati per arrivare a scuola sono: \(8\) a piedi, \(6\) in autobus, \(4\) in macchina con un genitore, \(2\) in bicicletta.
(a)
Costruisci la tabella con frequenze assolute, relative e percentuali.
(b)
Quale modalità ha la frequenza massima?
3.
In una rilevazione su \(50\) persone, si registra il numero di animali domestici posseduti. I dati grezzi sono:
\[ 0,1,2,0,1,1,3,0,2,1,0,1,2,1,0,2,1,0,1,3,0,2,1,0,1,1,2,0,1,2,0,1,1,2,0,1,3,1,0,2,1,0,1,2,1,0,1,1,2,0 \]
(a)
Costruisci la tabella di frequenza completa (assoluta, relativa, percentuale, cumulate).
(b)
Quale percentuale delle persone non possiede animali domestici?
(c)
Quale percentuale possiede almeno \(2\) animali?
4.
Vero o falso? Motiva la risposta.
(a)
La somma delle frequenze relative è sempre \(1\).
(b)
La frequenza percentuale è sempre un numero intero.
(c)
La frequenza cumulata è ben definita per qualsiasi tipo di carattere.
(d)
La frequenza cumulata dell’ultima modalità è sempre \(N\).
(e)
Due popolazioni di dimensione diversa con le stesse frequenze relative hanno le stesse frequenze assolute.
5.
I voti del compito di matematica in una classe di \(28\) studenti sono distribuiti come segue:

Voto \(3\) \(4\) \(5\) \(6\) \(7\) \(8\)
\(f_i\) \(1\) \(3\) \(7\) \(10\) \(5\) \(2\)
(a)
Quanti studenti hanno preso la sufficienza?
(b)
Quale percentuale di studenti è insufficiente (voto \(< 6\))?
(c)
Quale percentuale ha preso un voto strettamente maggiore di \(6\)?
6.
In una rilevazione sul peso (in kg) di \(40\) studenti, i valori variano da \(45\,{\mathrm{kg} }\) a \(85\,{\mathrm{kg} }\). Costruisci una distribuzione per classi con \(5\) classi di ampiezza \(8\,{\mathrm{kg} }\), riempiendo la tabella con le frequenze (puoi inventare valori plausibili).
7.
Una distribuzione per classi presenta i seguenti dati:

Classe \(f_i\)
\([0, 10)\) \(5\)
\([10, 20)\) \(12\)
\([20, 30)\) \(18\)
\([30, 40)\) \(10\)
\([40, 50]\) \(5\)
(a)
Calcola \(N\), le frequenze relative e percentuali.
(b)
Calcola le frequenze cumulate assolute e percentuali.
(c)
Quale percentuale di unità statistiche si trova al di sotto del valore \(30\)?
8.
In un’azienda di \(120\) dipendenti, il \(35\,{\% }\) ha una laurea, il \(50\,{\% }\) ha un diploma e il restante ha la licenza media. Quanti dipendenti hanno ciascun titolo?
9.
In un sondaggio politico, su \(800\) intervistati, il \(42\,{\% }\) ha dichiarato di approvare l’operato del governo. Quante persone in valore assoluto hanno espresso l’approvazione?
10.
In una rilevazione le frequenze cumulate percentuali in un certo punto valgono \(\Phi _i^{\%} = 72\,{\% }\) e nel punto successivo \(\Phi _{i+1}^{\%} = 85\,{\% }\). Qual è la frequenza percentuale (non cumulata) della modalità \(x_{i+1}\)?
11.
Due classi di \(25\) studenti ciascuna sostengono lo stesso test. I voti distribuiti sono:

\(4\) \(5\) \(6\) \(7\) \(8\) \(9\) \(10\)
Classe 1 \(2\) \(5\) \(8\) \(6\) \(3\) \(1\) \(0\)
Classe 2 \(0\) \(2\) \(6\) \(9\) \(5\) \(2\) \(1\)
(a)
Calcola le percentuali di studenti che hanno preso la sufficienza in ciascuna classe.
(b)
Quale classe ha avuto risultati globalmente migliori?
(c)
Calcola le percentuali cumulate dei due gruppi e confrontale.
12.
Discuti criticamente la seguente affermazione: “Il \(90\,{\% }\) dei pazienti di un certo ospedale ha avuto un decorso favorevole”. Quali informazioni servirebbero per valutare se è un dato confortante o no? (Suggerimento: quante unità statistiche, quale popolazione, rispetto a quale benchmark.)
13.
Per ciascuno dei seguenti caratteri, suggerisci come raggrupperesti le modalità in classi: ampiezza adeguata, numero di classi.
(a)
Età dei membri di una popolazione (da \(0\) a \(100\) anni).
(b)
Tempo (in minuti) impiegato a risolvere un problema (da \(0\) a \(60\)).
(c)
Punteggio in un test su \(100\) punti (da \(0\) a \(100\)).