Retour aux projets

Projet · 2026

UFO Sightings Analysis

80 332 observations d'OVNI entre 1949 et 2014. Une analyse exploratoire pour comprendre ce que les témoignages racontent vraiment — des formes perçues aux biais de collecte.

80K

observations

1949–2014

période couverte

20.6%

forme n°1 (Light)

Le problème

Que peuvent nous apprendre 80 000 signalements d'OVNI sur la perception humaine, les biais de collecte et la construction d'un phénomène socioculturel ? Et surtout : que disent ces données — et que ne disent-elles pas ?

L'approche

01

Compréhension des données

80 332 observations × 11 variables (date, lieu, forme, durée, coordonnées). Détection des types mixtes, des valeurs manquantes et des incohérences avant toute analyse.

02

Nettoyage

Conversion de datetime et duration (seconds), nettoyage des latitudes, suppression de la colonne city, normalisation de shape (NaN → Unspecified).

03

Analyse exploratoire

Formes les plus signalées, évolution temporelle depuis 2000, répartition par État américain, distribution des durées d'observation et analyse textuelle des commentaires.

04

Restitution

Visualisations (barh, cumul, courbes temporelles, carte US) et mise en perspective critique : que révèlent ces données sur les biais de perception et de collecte ?

Résultats clés de l'analyse

20.6%

Forme dominante

Les observations de type « Light » écrasent toutes les autres. Viennent ensuite Triangle (9.8%) et Circle (9.5%) : des formes simples, cohérentes avec la perception humaine de nuit.

82.5%

Concentration forte

Seulement 10 formes sur 30 concentrent plus de 80% des signalements. La distribution est fortement asymétrique — un classique des données de témoignages.

2012

Pic de signalements

Croissance progressive de 2000 à 2011, puis explosion en 2012 (7 356 signalements), suivie d'une chute brutale en 2014. Plus corrélé à la collecte qu'au phénomène réel.

×2

Effet démographique

La Californie domine (8 912 obs.), mais certains États comme Washington sur-signalent par rapport à leur population. Les 5 premiers États = 35.5% du total.

Nettoyage — rendre les données exploitables

80 332 lignes, 11 variables, des types mixtes et des valeurs parasites. Avant toute analyse, il fallait rendre le dataset cohérent sans perdre d'information utile.

VariableAvantAprèsTraitement
datetimestrdatetime64Conversion
duration (seconds)objectfloat64Suppression des ` + conversion
latitudeobjectfloat64Conversion
citystr—Suppression (non utilisée)
shapestr + NaNcatégorie normaliséeNaN → Unspecified, Title Case

Le dataset nettoyé est sauvegardé sous ufo_cleaned.csv et sert de base à l'ensemble de l'analyse exploratoire.

Limites assumées

  • Les données reflètent les signalements rapportés, pas les phénomènes observés — biais de déclaration et de médiatisation.
  • L'explosion des signalements depuis 2000 coïncide avec la démocratisation d'Internet et des plateformes de déclaration (NUFORC).
  • Concentration géographique : les États-Unis dominent massivement le dataset (81% des observations), limitant la portée internationale.
  • Les durées d'observation comportent des valeurs aberrantes (3 201 > 1h, 179 > 1 jour, 53 > 1 semaine), probablement des erreurs de saisie.
  • Les commentaires textuels, très riches, restent sous-exploités : une piste évidente pour du NLP.

Stack

PythonPandasNumPyMatplotlibSeabornJupyterAnalyse exploratoireData cleaning