Déploiement de MinerU-1.2B pour la Lecture Accessible de Documents sur les Portails Web Municipaux
Les portails web des autorités locales sont souvent confrontés à un défi pratique : leurs archives et documents officiels sont fréquemment stockés sous forme d'images scannées. Ces fichiers ne sont ni indexables par les moteurs de recherche, ni accessibles aux logiciels de lecture d'écran pour les personnes malvoyantes. Les solutions traditionn ...
Publié le 18 juillet à 20h21
Mise en œuvre de HG-ha/MTools : Automatisation de la reconnaissance de documents administratifs en mode déconnecté
Contexte technique et enjeux
Les centres de services publics traitent quotidiennement un volume massif de documents papier : cartes d'identité, actes de naissance, licences commerciales et formulaires divers. La saisie manuelle traditionnelle est une source d'erreurs et de goulots d'étranglement administratifs. L'intégration de la solution HG-h ...
Publié le 18 juillet à 18h13
Reconnaissance OCR de Numéros de Cartes Bancaires avec .NET
Pour implémenter une solution de reconnaissance de numéros de cartes bancaires via OCR, voici un guide technique basé sur .NET et PaddleOCRSharp. Les exemples de code sont restructurés avec des noms de variables et une logique modifiée pour réduire la similarité tout en maintenant la fonctionnalité.
Configuration initiale
Environnement de dével ...
Publié le 9 juillet à 09h15
Comparaison des services OCR Tarsier : Google Vision contre Microsoft Azure - Comment choisir ?
Comparaison des services OCR Tarsier : Google Vision contre Microsoft Azure - Comment choisir ?
【Lien de téléchargement gratuit】tarsier Vision utilities for web interaction agents 👀 Projet : https://gitcode.com/gh_mirrors/tarsie/tarsier
Tarsier, en tant que bibliothèque d'outils visuelle spécialisée dans les agents d'interaction Web, offre d ...
Publié le 9 juillet à 06h02
PP-DocLayoutV3 : Annotation indépendante de multiples zones de figures (sous-figures a/b/c) au sein d'une même image
L'analyse de mise en page de documents vise à résoudre un problème fondamental : extraire et structurer automatiquement les différentes régions d'un document numérisé. Le modèle PP-DocLayoutV3 excelle particulièrement dans la détection fine, capable d'identifier et d'annoter séparément plusieurs sous-figures distinctes (souvent étiquetées (a), ...
Publié le 8 juillet à 17h37
Analyse technique de la reconnaissance et de la résolution automatisée des CAPTCHA
Le CAPTCHA, ou « Completely Automated Public Turing test to tell Computers and Humans Apart », est un mécanisme de sécurité conçu pour distinguer les utilisateurs humains des agents automatisés. Apparu dans les années 1990, ce système visait initialement à contrer les abus tels que le spam par courrier électronique et les attaques par force bru ...
Publié le 6 juillet à 16h41
Conversion Rapide de PDF Scientifiques et de Manuels en Markdown avec MinerU 2.5-1.2B
1. Introduction : L'Efficacité de la Conversion PDF vers Markdown en Recherche et Enseignement
Les chercheurs, enseignants et étudiants font souvent face à des défis lors de l'extraction de contenu à partir de PDF académiques. Ces documents contiennent généralement des mises en page complexes, des formules mathématiques, des tableaux structurés ...
Publié le 4 juillet à 08h15
Déploiement local de DeepSeek-OCR-2 : Solution économique d'analyse intelligente de documents pour les PME
Présentation de la solution
DeepSeek-OCR-2 est un moteur d'analyse documentaire basé sur l'intelligence artificielle, conçu pour permettre aux petites et moyennes entreprises (PME) de numériser leurs documents à moindre coût. Contrairement aux systèmes d'OCR classiques qui se limitent à l'extraction de texte brut, cet outil interprète la struct ...
Publié le 27 juin à 16h02
Automatisation de l'extraction de données structurées à partir de documents numérisés avec Youtu-Parsing
Introduction
Le traitement manuel de documents numérisés (contrats, factures, rapports) représente une tâche répétitive et sujette aux erreurs. La conversion de ces fichiers en données exploitables requiert souvent une intervention humaine significative. Cet article présente une approche automatisée basée sur le modèle Youtu-Parsing pour résoud ...
Publié le 20 juin à 22h27
STEP3-VL-10B: Déploiement d'un modèle multimodal léger avec support d'images, OCR et compréhension spatiale
STEP3-VL-10B: Déploiement d'un modèle multimodal léger avec support d'images, OCR et compréhension spatiale
Vous êtes-vous déjà retrouvé dans des situations où vous deviez faire comprendre une image à une IA, comme identifier des données tabulaires, analyser des graphiques ou interpréter des schémas complexes ? Les modèles textuels traditionnel ...
Publié le 19 juin à 03h32