Expressions régulières (regex)

Les expressions régulières permettent d'extraire des données dans un bloc de texte.

Note : Voir la documentation sur la création des masques d'extraction de données pour l'import automatique.

Syntaxe de base

  • \w : caractères alphanumériques et _
  • \W : caractères ne composant pas les mots
  • \d : chiffres décimaux
  • \D : autre chose qu'un chiffre décimal
  • \s : caractères d'espacement
  • \S : autre chose qu'un caractère d'espacement
  • . : n'importe quel caractère

Répétitions

  • + : 1 ou plus, exemple \d+
  • * : zéro ou une infinité, exemple \w*

Répétitions fixes avec les accolades

  • \d{2} : 2 chiffres
  • \d{4} : 4 chiffres
  • \d{0,5} : entre aucun et 5 chiffres
  • \/ : le / étant réservé, il faut le déspécialiser en le précédant d'un \

Groupes de capture

  • () : les parenthèses permettent d'indiquer une zone à extraire
  • ?<tag> : pour associer un tag ou une étiquette à la zone extraite

Premier exemple

Soit le texte suivant : "Le 14 janvier 2022"

Comment extraire "14" ?

  • \d\d
  • \d{2}
  • \s\d\d\s