02 — Floride, États-Unis · mission en cours
Lecture automatisée de jugements, livrée chaque semaine
Un cabinet d'avocats de Miami avait besoin des jugements nouvellement
enregistrés au greffe du comté, sous forme de tableau exploitable. Le
portail officiel ne propose ni export, ni API : uniquement des PDF
scannés, un par jugement.
La chaîne parcourt le portail, télécharge les documents, en extrait les
champs structurés (numéro de dossier, date, montant, créancier,
débiteur, avocats de chaque partie) et livre un fichier propre chaque
semaine.
Le problème le plus intéressant n'était pas technique
En auditant les fichiers déjà livrés, j'ai trouvé un libellé qui posait
un vrai problème de fond. Quand aucun avocat n'était mentionné sur le
document, la chaîne écrivait « Pro Se / Default » — c'est-à-dire
« partie non représentée, jugement par défaut ».
Sauf que ce n'est pas ce que dit le document. L'absence d'avocat listé
signifie seulement qu'aucun nom n'apparaît sur ce PDF précis. En déduire
un jugement par défaut, c'est ajouter une information juridique que la
source ne contient pas — dans un fichier destiné à des avocats, qui vont
s'en servir pour décider qui contacter.
Avant
« Pro Se / Default » — une conclusion juridique que la source ne permet pas de tirer.
Après
« None listed (unverified) » — ce que le document dit réellement, sans interprétation ajoutée.
+
Ce qui a été corrigé dans la foulée
Les lignes en erreur étaient livrées telles quelles au client, mêlées
aux bonnes données. Il n'y avait aucune reprise sur échec de lecture,
aucun tri des documents illisibles, et la clé d'accès au service
d'extraction était écrite en dur dans le code.
La version corrigée réessaie avec une temporisation progressive, met
les documents problématiques en quarantaine dans un onglet séparé,
marque les lignes douteuses au moment de l'extraction plutôt qu'après
coup, et lit sa clé depuis l'environnement. Le nombre de traitements
simultanés a aussi été réduit, pour cesser de saturer le service en
face.
=
Vérification sur un lot réel
Le premier lot passé dans la version corrigée :
480 jugements, zéro document en quarantaine, zéro
ligne signalée douteuse.
Python, lecture automatisée de documents scannés, contrôle qualité
intégré, livraison hebdomadaire récurrente.