Projet · 2026
UFO Sightings Analysis
80 332 observations d'OVNI entre 1949 et 2014. Une analyse exploratoire pour comprendre ce que les témoignages racontent vraiment — des formes perçues aux biais de collecte.
80K
observations
1949–2014
période couverte
20.6%
forme n°1 (Light)
Le problème
Que peuvent nous apprendre 80 000 signalements d'OVNI sur la perception humaine, les biais de collecte et la construction d'un phénomène socioculturel ? Et surtout : que disent ces données — et que ne disent-elles pas ?
L'approche
01
Compréhension des données
80 332 observations × 11 variables (date, lieu, forme, durée, coordonnées). Détection des types mixtes, des valeurs manquantes et des incohérences avant toute analyse.
02
Nettoyage
Conversion de datetime et duration (seconds), nettoyage des latitudes, suppression de la colonne city, normalisation de shape (NaN → Unspecified).
03
Analyse exploratoire
Formes les plus signalées, évolution temporelle depuis 2000, répartition par État américain, distribution des durées d'observation et analyse textuelle des commentaires.
04
Restitution
Visualisations (barh, cumul, courbes temporelles, carte US) et mise en perspective critique : que révèlent ces données sur les biais de perception et de collecte ?
Résultats clés de l'analyse
20.6%
Forme dominante
Les observations de type « Light » écrasent toutes les autres. Viennent ensuite Triangle (9.8%) et Circle (9.5%) : des formes simples, cohérentes avec la perception humaine de nuit.
82.5%
Concentration forte
Seulement 10 formes sur 30 concentrent plus de 80% des signalements. La distribution est fortement asymétrique — un classique des données de témoignages.
2012
Pic de signalements
Croissance progressive de 2000 à 2011, puis explosion en 2012 (7 356 signalements), suivie d'une chute brutale en 2014. Plus corrélé à la collecte qu'au phénomène réel.
×2
Effet démographique
La Californie domine (8 912 obs.), mais certains États comme Washington sur-signalent par rapport à leur population. Les 5 premiers États = 35.5% du total.
Nettoyage — rendre les données exploitables
80 332 lignes, 11 variables, des types mixtes et des valeurs parasites. Avant toute analyse, il fallait rendre le dataset cohérent sans perdre d'information utile.
| Variable | Avant | Après | Traitement |
|---|---|---|---|
| datetime | str | datetime64 | Conversion |
| duration (seconds) | object | float64 | Suppression des ` + conversion |
| latitude | object | float64 | Conversion |
| city | str | — | Suppression (non utilisée) |
| shape | str + NaN | catégorie normalisée | NaN → Unspecified, Title Case |
Le dataset nettoyé est sauvegardé sous ufo_cleaned.csv et sert de base à l'ensemble de l'analyse exploratoire.
Limites assumées
- Les données reflètent les signalements rapportés, pas les phénomènes observés — biais de déclaration et de médiatisation.
- L'explosion des signalements depuis 2000 coïncide avec la démocratisation d'Internet et des plateformes de déclaration (NUFORC).
- Concentration géographique : les États-Unis dominent massivement le dataset (81% des observations), limitant la portée internationale.
- Les durées d'observation comportent des valeurs aberrantes (3 201 > 1h, 179 > 1 jour, 53 > 1 semaine), probablement des erreurs de saisie.
- Les commentaires textuels, très riches, restent sous-exploités : une piste évidente pour du NLP.