De nombreuses données utiles ne sont disponibles que sous forme de pages web : annuaires, portails, listes de résultats, répertoires, catalogues. Les exploiter suppose aujourd'hui une recopie manuelle, page après page, fastidieuse et source d'erreurs, notamment lorsqu'il faut suivre la pagination.
L'objectif est de déléguer la collecte et la mise en forme à un assistant IA : il parcourt les pages, lit les champs affichés, suit la pagination, et dépose un tableau structuré dans un classeur Excel (ou un CSV), prêt à l'analyse.
Comment ça fonctionne
ouvre un vrai navigateur et accède à la page source (limitée à l'allowlist) ;
lit les données affichées (par enregistrement : nom, ville, secteur, téléphone, etc.) ;
suit la pagination : clique sur « page suivante » et répète tant qu'il reste des pages ;
structure les données en lignes et colonnes selon le format demandé ;
remplit un classeur Excel via COM Windows, ou écrit un CSV via la capacité fichiers ;
rend compte du volume collecté et peut compléter sur demande (colonne supplémentaire, champ manquant).
Capacités ODESA mobilisées
Accède aux pages sources, lit le texte affiché, suit la navigation paginée ; navigation bornée par l'allowlist.
Pilote Excel pour remplir le classeur (feuilles, colonnes, valeurs). Borné par la liste des ProgID autorisés.
Alternative ou complément : écrit un CSV dans une racine autorisée ; sert aussi à enregistrer le classeur.
Confirme le lancement d'une extraction volumineuse, ou signale la fin du traitement.
Déroulé type
L'utilisateur : « Sur cette page d'annuaire, récupère pour chaque établissement le nom, la ville, le secteur et le téléphone affiché ; mets ça dans un Excel ; continue sur toutes les pages. »
L'IA lit la première page, range les valeurs en quatre colonnes, puis clique sur « suivant ».
L'IA enchaîne les pages jusqu'à la dernière.
L'utilisateur : « Ajoute une colonne avec le code postal. »
L'utilisateur : « Plutôt un CSV finalement. »
- Page(s) source(s) : URL de départ de la liste/annuaire à extraire.
- Allowlist : le(s) domaine(s) des pages sources.
- Schéma de sortie : liste des colonnes attendues, fournie en langage naturel.
- Cible Excel : Excel installé sur le poste (capacité COM, ProgID Excel autorisé), ou racine fichiers pour le CSV.
- Racine fichiers autorisée : dossier où déposer le classeur / le CSV.
- Allowlist d'URLs : l'IA ne navigue que sur les domaines sources autorisés.
- ProgID autorisés : la capacité COM est restreinte à Excel ; aucun autre logiciel ne peut être piloté.
- Racine fichiers (« jail ») : le classeur / CSV ne s'écrit que dans le dossier autorisé.
- Lecture publique : l'IA lit des pages accessibles ; elle ne contourne ni authentification ni paywall.
- Jeton d'accès : seul l'assistant configuré peut piloter ODESA.
Mise en place
Les étapes pour configurer ODESA sur ce cas d'usage.
Installer ODESA en local.
Configurer la capacité web : allowlist des pages sources, options de navigation.
Choisir la sortie : activer la capacité COM (ProgID Excel autorisé) pour remplir un classeur, ou la capacité fichiers pour un CSV (racine autorisée).
(Option) Activer la capacité ui pour la confirmation / notification.
Décrire à l'assistant la page source, les champs et les colonnes voulues ; lancer une extraction de test sur une page.
- Structure des pages : l'extraction suppose des données affichées de façon régulière. Une mise en page très irrégulière, fortement dynamique (chargement infini, contenu généré au défilement) ou protégée par des mécanismes anti-automatisation peut compliquer la collecte.
- Volume et respect des sites : pour de gros volumes, garder un rythme raisonnable et respecter les conditions d'utilisation et les fichiers robots des sites sources.
- Pages publiques : ce cas standard porte sur du contenu publiquement accessible, sans contournement de protection.
- Pagination atypique : certaines listes utilisent un défilement plutôt que des pages numérotées ; la stratégie de parcours doit être adaptée.
- Excel requis pour la sortie COM : sur un poste sans Excel, utiliser la sortie CSV.
- Nettoyage et normalisation des valeurs collectées (formats de téléphone, casse, doublons) avant écriture.
- Mise en base : ranger les données dans une base SQL plutôt qu'un tableur, pour les réutiliser.
- Extraction multi-sources en parallèle via plusieurs sessions navigateur indépendantes.
- Planification VAILS : relancer périodiquement une extraction qui évolue (annuaire mis à jour).
- Mise en forme avancée du classeur via COM Excel (en-têtes, filtres, feuilles multiples).
Mettez ODESA au travail.
ODESA installe l'IA agentique chez vos clients, en local et sous contrôle. Devenez le partenaire qui la déploie.