---
title: "Un extracteur de données génériques"
weight: 5
description: "Principe de fonctionnement de DocWizOn : extraction de données de documents via OCR et masques d'expressions régulières."
---

# DocWizOn : extracteur de données génériques

Le principe est le suivant : Document -> Extraction du texte -> Application d'un masque -> Production d'un fichier JSON

- Le document peut être un fichier PDF, TXT ou JPEG
- Le masque est composé d'expressions régulières, le tout décrit dans un fichier au format YML
- Le fichier JSON retourné est structuré en fonction du plugin actif sur le serveur DocWizOn
