18 000 photographies intra-orales,
annotées au pixel
Segmentation experte pour l'IA dentaire : six classes cliniques, six vues standardisées par patient, issues d'un pipeline clinique en production.
- Dent
- Gencive
- Tartre
- Carie
- Gingivite
- Restauration
photographies intra-orales
patients uniques
instances de polygones
480 images sur 80 patients, publiées en accès validé — masques, export COCO et data card inclus.
Ce qu'est le dataset
Une collection sélectionnée de photographies intra-orales portant des annotations polygonales au pixel, réalisées par le Dr Romain Lateur, chirurgien-dentiste, issues d'un pipeline clinique qui tourne aujourd'hui en cabinet.
Conçue pour la segmentation sémantique : un modèle y apprend à identifier et localiser structures et pathologies buccales directement sur des photographies dentaires standard — pas sur des radiographies.
Exemple ci-contre : P2310, arcade supérieure, tartre.

Six classes cliniques, anatomie et pathologie
Les couleurs correspondent exactement aux canaux de masque exportés et à la légende portée sur les images.
Dent
toothSurface d'émail visible — la classe la plus étendue en surface de pixels.
Gencive
gumTissu gingival autour des dents. La couleur varie d'un individu à l'autre.
Tartre
tartarDépôts de plaque durcie — petits, irréguliers, pertinents en parodontie.
Carie
cavityZones de dent cariées. Plus sombres, structurellement irrégulières, souvent discrètes.
Gingivite
gingivitisInflammation de la gencive : rougeur et gonflement, reconnues à la texture et à la couleur.
Restauration
restorationCouronnes et matériaux de restauration — couleur et réflectivité distinctes.
Six vues standardisées par patient
Un patient complet (P2389), sa série de six vues dans l'ordre de capture. Chaque patient est photographié aux six mêmes positions, dans le même ordre — vue, arcade et sextant sont donc toujours connus, jamais déduits.
- 1

upper_center
- 2

upper_right
- 3

upper_left
- 4

lower_center
- 5

lower_right
- 6

lower_left
Segmentation sémantique multi-classes
Des polygones fermés, pas des boîtes englobantes — la frontière réelle de chaque lésion est tracée.
- type d'annotation
- Polygones fermés (séquences de coordonnées 2D)
- stockage
- Un fichier JSON par image, plus un export COCO standard
- masques
- Binaires multi-canaux, forme (6, H, W) — un canal par classe
- recouvrements
- Un canal séparé par classe : les recouvrements sont préservés (tartre sur dent)
- localisation
- Chaque lésion est rattachée à la dent, à la gencive ou à la jonction dent-gencive

Photographie, polygones et légende — livrés ensemble
Chaque image du dataset est accompagnée de ses polygones et de sa légende, dans la même exportation.




Ce que contiennent vraiment 18 000 images
Deux classes anatomiques dans presque chaque image, quatre pathologies à leur prévalence réelle. Rien n'est rééquilibré ni ré-échantillonné : c'est le déséquilibre qu'un modèle rencontre en cabinet.
| Classe | Instances | Images | Patients | Par image positive |
|---|---|---|---|---|
| Dentbase anatomique | 30,3 % | ~100 % | 100 % | 2,1 |
| Gencivebase anatomique | 41,3 % | ~98 % | 100 % | 2,9 |
| Tartrepathologie | 19,6 % | ~33 % | ~54 % | 4,0 |
| Cariepathologie | 6,4 % | ~25 % | ~49 % | 1,8 |
| Gingivitepathologie | 0,9 % | ~5 % | ~14 % | 1,4 |
| Restaurationpathologie | 1,4 % | ~6 % | ~12 % | 1,5 |
100 000+ instances annotées · environ six par image. La présence de chaque classe est indexée image par image : des sous-ensembles enrichis par classe sont assemblables sur demande. La collecte se poursuit sous le même protocole à six vues et s'étoffe chaque semaine.
Quatre modèles de Deep Learning, entraînés sur ce dataset
Chaque photo est lue par quatre modèles qui votent pixel par pixel : seules les zones où ils convergent sont signalées. Tartre, carie, gencive inflammée — chaque zone est restituée avec un score de probabilité, dans un langage visuel que le patient comprend immédiatement.
- Dent
- Gencive
- Tartre
- Carie
- Gingivite


Évaluez le dataset
L'échantillon publié sur Hugging Face montre exactement le format livré : 480 images sur 80 patients, annotations, masques et export COCO inclus. Le corpus complet vient ensuite, sous accord.
Dr Romain Lateur · MouthCare — NT Corporation · contact@mouthcare.fr · +33 6 35 16 19 23
L'accès au dataset complet est soumis à accord. Les images de l'échantillon ne sont téléchargeables qu'après acceptation des conditions d'évaluation, et aucune image n'est transmise par e-mail.