OCR dans le navigateur

OCR Image en Texte

Extrayez du texte de photos, captures d'écran et documents numérisés directement dans votre navigateur. Gratuit, illimité et entièrement privé — vos images ne quittent jamais votre appareil.

Déposez vos images ici

JPG, PNG, WebP, BMP, HEIC jusqu'à 100 Mo chacune

Vos images sont traitées localement et ne quittent jamais ce navigateur.

Ajoutez une ou plusieurs images ci-dessus pour démarrer. Choisissez d'abord la langue pour les résultats les plus précis.

OCR Image en Texte — Questions Fréquentes

Mes images sont-elles téléversées sur un serveur ?

Non. Tout le traitement OCR se déroule dans votre navigateur grâce à WebAssembly. La seule requête réseau est un téléchargement unique du moteur d'OCR et du modèle de langue que vous choisissez — tous deux servis depuis FormatFuse et mis en cache par votre navigateur ensuite. Vous pouvez le vérifier dans l'onglet Réseau de votre navigateur : après le premier chargement, lancer l'OCR sur une nouvelle image ne produit aucun trafic sortant.

Peut-il lire l'écriture manuscrite ?

Pas de manière fiable. Tesseract est entraîné sur du texte imprimé, donc des majuscules d'imprimerie séparées et bien formées fonctionnent parfois, mais l'écriture cursive, les notes prises à la hâte ou l'écriture stylisée donneront de mauvais résultats. Pour le contenu manuscrit, des modèles spécialisés sont nettement plus performants que l'OCR générique. Considérez toute sortie manuscrite comme un brouillon nécessitant une correction manuelle.

Quelle qualité d'image faut-il pour de bons résultats ?

Visez 300 ppp ou plus, avec une mise au point nette, un éclairage uniforme et un bon contraste entre le texte et le fond. Évitez les angles inclinés, les ombres, les reflets et la compression JPG agressive. Si le texte occupe peu d'espace dans le cadre, recadrez sur la zone de texte avant le chargement. Les captures d'écran et les documents numérisés fonctionnent généralement mieux que les photos prises au smartphone d'un document.

Quelles langues fonctionnent le mieux ?

L'anglais donne les résultats les plus constants car il dispose du plus grand corpus d'entraînement. Les autres langues à écriture latine (français, espagnol, allemand) sont également solides. Le chinois, le japonais, l'hindi et l'arabe fonctionnent bien sur du texte imprimé clair mais sont plus sensibles à la résolution et au bruit. Si votre document mélange plusieurs langues, choisissez celle qui apparaît le plus fréquemment — l'OCR multilingue en une seule passe n'est pas pris en charge dans cet outil.

Pourquoi la première exécution est-elle lente ?

La première fois que vous lancez l'OCR dans une langue donnée, votre navigateur télécharge le moteur Tesseract (environ 3 Mo) et les données d'entraînement spécifiques à la langue (de 2 à 15 Mo selon la langue). Ce téléchargement a lieu une fois par langue, votre navigateur le met en cache et chaque exécution suivante démarre instantanément. Passer à une nouvelle langue déclenche un téléchargement supplémentaire pour les données de cette langue, qui est ensuite également mise en cache.

Quels formats d'image puis-je utiliser ?

JPG, PNG, WebP, BMP et HEIC sont pris en charge. Les fichiers HEIC d'iPhone sont décodés dans le navigateur avant l'exécution de l'OCR. Pour les PDF numérisés, convertissez d'abord les pages en images avec nos outils PDF en JPG ou PDF en PNG, puis lancez l'OCR sur les images.