Chaque matin, dans beaucoup d'organisations, quelqu'un ouvre une boîte mail partagée ou une pile de courrier numérisé et répartit tout ça : ceci pour la comptabilité, cela pour le service client, ce dossier-là pour le juridique. C'est répétitif, chronophage, et personne ne revendique cette tâche.
C'est aussi l'un des cas où l'automatisation rapporte le plus vite. Et, paradoxalement, l'un de ceux où l'on se trompe le plus souvent de solution — en sortant l'artillerie lourde pour un problème qui ne le demandait pas.
La bonne question n'est donc pas « quel modèle d'IA utiliser ? », mais plutôt : est-ce que ce problème mérite un modèle ?
Deux façons d'apprendre à trier
Il n'y en a que deux, et la différence est facile à saisir.
Par la règle. Vous expliquez la logique à suivre : si le document contient « facture » et un numéro de TVA, il part en comptabilité. C'est vous qui écrivez les consignes, une par une.
Par l'exemple. Vous montrez au système quelques milliers de documents déjà triés par vos équipes, et il en déduit tout seul des régularités. Personne n'écrit la consigne : elle est apprise. C'est ce qu'on appelle le machine learning, ou apprentissage automatique.
La première approche ressemble à un mode d'emploi. La seconde à la formation d'un nouveau collègue à qui l'on montre comment on fait, sans jamais formaliser complètement pourquoi.
Aucune des deux n'est supérieure dans l'absolu. Elles échouent simplement sur des choses différentes.
Les règles ne sont pas une solution au rabais
On les présente souvent comme le choix de ceux qui n'ont pas les moyens de faire mieux. C'est une erreur. Un jeu de règles possède des qualités qu'aucun modèle statistique n'offre :
- il est explicable ligne par ligne — précieux quand un auditeur ou un régulateur demande pourquoi ce dossier a été classé ainsi ;
- il se corrige dans la journée : une erreur constatée le matin est réparée l'après-midi ;
- il ne demande aucun historique ni aucune donnée annotée ;
- il se comporte toujours de la même façon, ce qui rassure tout le monde.
Si vos documents sont standardisés, si les catégories sont peu nombreuses et si un collègue expérimenté peut résumer la logique de tri en quelques phrases, les règles sont le bon choix. Un modèle n'apporterait rien, tout en ajoutant un coût, une dépendance technique et une part d'opacité.
Les signes qu'il est temps de passer au modèle
Le basculement se justifie quand les règles commencent à coûter plus qu'elles ne rapportent. Quatre signaux sont assez fiables.
Le fichier de règles est devenu intouchable. Il a grossi pendant des années, corriger un cas particulier en casse un autre, et plus personne n'ose y toucher. La complexité a dépassé ce que les règles savent absorber.
La décision dépend du ton général, pas de mots précis. Distinguer une réclamation d'une simple demande d'information ne se joue pas sur un mot-clé : le vocabulaire est le même dans les deux cas. Ce qui change, c'est l'intention — et c'est exactement ce qu'un modèle capte mieux qu'une règle.
Les formulations partent dans tous les sens. Courriers rédigés par des clients, documents scannés de travers, mélange de français et de néerlandais : cette variabilité est le point faible des règles et le point fort des modèles.
Vous avez déjà un historique trié. Des années de documents classés par vos équipes constituent un matériau d'apprentissage quasiment gratuit. C'est souvent l'argument qui emporte la décision.
| Critère | Règles | Machine learning |
|---|---|---|
| Historique nécessaire | Aucun | Plusieurs centaines d'exemples par catégorie |
| Délai de mise en place | Quelques jours | Quelques semaines |
| Capacité à expliquer une décision | Totale | Partielle |
| Corriger une erreur isolée | Immédiat | Demande un réapprentissage |
| Résistance aux formulations variées | Faible | Bonne |
| Entretien au-delà de 20 catégories | Lourd | Raisonnable |
En pratique, on combine les deux
Dans les projets que nous livrons, la meilleure configuration n'est presque jamais l'une ou l'autre. C'est une chaîne à trois étages :
- Des règles en tête de chaîne pour les cas certains et sensibles. Un document portant une référence contractuelle explicite est routé par une règle, sans passer par le modèle. C'est plus rapide, et surtout parfaitement prévisible.
- Un modèle pour la masse des cas ambigus, ceux qui font perdre du temps.
- Un seuil de confiance en sortie : quand le modèle hésite, le document part en révision humaine au lieu d'être classé au hasard.
Ce troisième étage est le plus important, et le plus souvent oublié. Un système qui traite sereinement 85 % des documents et transmet les 15 % restants à une personne crée bien plus de valeur qu'un système qui prétend tout traiter et se trompe en silence.
Le taux de couverture n'est pas une note obtenue à l'examen, c'est un réglage que vous choisissez. On le fixe en fonction de ce que coûte une erreur, pas en fonction de la fierté de l'équipe technique.
Mesurer ce qui compte vraiment
Le « taux de réussite global » est un chiffre trompeur. Si 90 % de vos documents entrants appartiennent à une seule catégorie, un système qui répond systématiquement cette catégorie affiche 90 % de réussite — et n'a aucune utilité.
Deux chiffres sont bien plus parlants, et il faut les regarder catégorie par catégorie :
- Quand le système annonce « réclamation », a-t-il raison ? Sur 100 documents ainsi étiquetés, combien en étaient réellement ?
- Attrape-t-il toutes les réclamations ? Sur 100 vraies réclamations arrivées, combien a-t-il repérées ?
On peut être excellent sur le premier et catastrophique sur le second, ou l'inverse. Les deux racontent des problèmes différents.
Il faut aussi accepter que toutes les erreurs ne se valent pas. Traiter une réclamation urgente comme du courrier ordinaire n'a pas le même coût que l'inverse. Ce tableau des erreurs doit être lu avec les responsables métier, pas seulement par l'équipe technique — c'est une décision de gestion du risque, pas un réglage informatique.
Les vraies difficultés ne sont pas là où on les attend
Sur ce type de projet, l'entraînement du modèle représente une part étonnamment faible du travail. L'essentiel se joue ailleurs.
La qualité de l'historique. Vos documents passés ont été classés par des humains, avec des consignes qui ont changé, des catégories fusionnées en cours de route, et des erreurs. Un modèle qui apprend sur un historique incohérent reproduira l'incohérence. Un audit de l'existant est presque toujours nécessaire avant de commencer.
La qualité de la lecture des scans. Sur du papier numérisé, tout dépend du logiciel qui transforme l'image en texte — l'OCR. S'il lit mal, le meilleur modèle du monde travaillera sur une bouillie de caractères. C'est un plafond de verre qu'on oublie souvent de vérifier.
Le glissement dans le temps. De nouveaux formulaires apparaissent, de nouveaux fournisseurs, de nouvelles catégories. Un modèle figé se dégrade lentement, sans prévenir. Il faut prévoir dès le départ une surveillance et un réapprentissage périodique.
Le raccordement au reste. Le modèle doit s'insérer dans une chaîne existante — GED, ERP, boîte mail partagée — avec reprise en cas de panne et journalisation. C'est fréquemment la partie la plus longue du projet.
Par où commencer
Une démarche qui fonctionne :
- Chiffrer le temps réellement passé à trier aujourd'hui. Sans ce chiffre, aucun arbitrage n'est possible.
- Prendre un échantillon représentatif et vérifier si le classement historique est cohérent.
- Écrire quelques règles simples. Elles constituent la référence que le modèle devra battre — et parfois, elles suffisent.
- N'entraîner un premier modèle que sur les catégories les plus volumineuses.
- Déployer prudemment, avec un seuil de confiance élevé et beaucoup de révision humaine, puis élargir à mesure que la confiance s'installe.
L'avantage de cette progression est qu'elle produit un résultat utile dès l'étape 3, et que chaque étape suivante se justifie par un chiffre plutôt que par une conviction.
Vous traitez un volume important de documents entrants et vous vous demandez ce qui est réellement automatisable ? Découvrez notre approche de la classification automatique, ou parlons de votre cas.