Dataset intra-oral

18 000 photographies intra-orales, annotées au pixel

Segmentation experte pour l'IA dentaire : six classes cliniques, six vues standardisées par patient, issues d'un pipeline clinique en production.

  • Dent
  • Gencive
  • Tartre
  • Carie
  • Gingivite
  • Restauration
18 000+

photographies intra-orales

~3 000

patients uniques

100 000+

instances de polygones

480 images sur 80 patients, publiées en accès validé — masques, export COCO et data card inclus.

Vue d'ensemble

Ce qu'est le dataset

Une collection sélectionnée de photographies intra-orales portant des annotations polygonales au pixel, réalisées par le Dr Romain Lateur, chirurgien-dentiste, issues d'un pipeline clinique qui tourne aujourd'hui en cabinet.

Conçue pour la segmentation sémantique : un modèle y apprend à identifier et localiser structures et pathologies buccales directement sur des photographies dentaires standard — pas sur des radiographies.

Exemple ci-contre : P2310, arcade supérieure, tartre.

Photographie intra-orale annotée — arcade supérieure, tartre
Les classes annotées

Six classes cliniques, anatomie et pathologie

Les couleurs correspondent exactement aux canaux de masque exportés et à la légende portée sur les images.

Dent

tooth

Surface d'émail visible — la classe la plus étendue en surface de pixels.

Gencive

gum

Tissu gingival autour des dents. La couleur varie d'un individu à l'autre.

Tartre

tartar

Dépôts de plaque durcie — petits, irréguliers, pertinents en parodontie.

Carie

cavity

Zones de dent cariées. Plus sombres, structurellement irrégulières, souvent discrètes.

Gingivite

gingivitis

Inflammation de la gencive : rougeur et gonflement, reconnues à la texture et à la couleur.

Restauration

restoration

Couronnes et matériaux de restauration — couleur et réflectivité distinctes.

Le protocole de capture

Six vues standardisées par patient

Un patient complet (P2389), sa série de six vues dans l'ordre de capture. Chaque patient est photographié aux six mêmes positions, dans le même ordre — vue, arcade et sextant sont donc toujours connus, jamais déduits.

  1. 1Vue upper_center du patient P2389, annotée

    upper_center

  2. 2Vue upper_right du patient P2389, annotée

    upper_right

  3. 3Vue upper_left du patient P2389, annotée

    upper_left

  4. 4Vue lower_center du patient P2389, annotée

    lower_center

  5. 5Vue lower_right du patient P2389, annotée

    lower_right

  6. 6Vue lower_left du patient P2389, annotée

    lower_left

L'annotation

Segmentation sémantique multi-classes

Des polygones fermés, pas des boîtes englobantes — la frontière réelle de chaque lésion est tracée.

type d'annotation
Polygones fermés (séquences de coordonnées 2D)
stockage
Un fichier JSON par image, plus un export COCO standard
masques
Binaires multi-canaux, forme (6, H, W) — un canal par classe
recouvrements
Un canal séparé par classe : les recouvrements sont préservés (tartre sur dent)
localisation
Chaque lésion est rattachée à la dent, à la gencive ou à la jonction dent-gencive
P2364, arcade supérieure — les six classes visibles sur une seule image
P2364 · upper_center · les six classes visibles sur une seule image
Exemples annotés

Photographie, polygones et légende — livrés ensemble

Chaque image du dataset est accompagnée de ses polygones et de sa légende, dans la même exportation.

P2364 · lower_center — tartre et gingivite
P2364 · lower_centertartre et gingivite
P2356 · lower_center — gingivite, en conditions cliniques
P2356 · lower_centergingivite, en conditions cliniques
P804 · upper_center — tartre important
P804 · upper_centertartre important
P6 · upper_center — carie
P6 · upper_centercarie
Échelle & répartition

Ce que contiennent vraiment 18 000 images

Deux classes anatomiques dans presque chaque image, quatre pathologies à leur prévalence réelle. Rien n'est rééquilibré ni ré-échantillonné : c'est le déséquilibre qu'un modèle rencontre en cabinet.

ClasseInstancesImagesPatientsPar image positive
Dentbase anatomique30,3 %~100 %100 %2,1
Gencivebase anatomique41,3 %~98 %100 %2,9
Tartrepathologie19,6 %~33 %~54 %4,0
Cariepathologie6,4 %~25 %~49 %1,8
Gingivitepathologie0,9 %~5 %~14 %1,4
Restaurationpathologie1,4 %~6 %~12 %1,5

100 000+ instances annotées · environ six par image. La présence de chaque classe est indexée image par image : des sous-ensembles enrichis par classe sont assemblables sur demande. La collecte se poursuit sous le même protocole à six vues et s'étoffe chaque semaine.

La technologie MouthCare

Quatre modèles de Deep Learning, entraînés sur ce dataset

Chaque photo est lue par quatre modèles qui votent pixel par pixel : seules les zones où ils convergent sont signalées. Tartre, carie, gencive inflammée — chaque zone est restituée avec un score de probabilité, dans un langage visuel que le patient comprend immédiatement.

  • Dent
  • Gencive
  • Tartre
  • Carie
  • Gingivite
Cliché intra-oral original
Segmentation IA MouthCare
PHOTO DU PATIENTRÉVÉLÉ PAR L'IA
Parlons-en

Évaluez le dataset

L'échantillon publié sur Hugging Face montre exactement le format livré : 480 images sur 80 patients, annotations, masques et export COCO inclus. Le corpus complet vient ensuite, sous accord.

Dr Romain Lateur · MouthCare — NT Corporation · contact@mouthcare.fr · +33 6 35 16 19 23

L'accès au dataset complet est soumis à accord. Les images de l'échantillon ne sont téléchargeables qu'après acceptation des conditions d'évaluation, et aucune image n'est transmise par e-mail.