14Configuration ODESA

L'extracteur web vers Excel

Collecte de données affichées sur des pages web (avec pagination) et structuration dans un tableur Excel ou un CSV.

Besoin métier

De nombreuses données utiles ne sont disponibles que sous forme de pages web : annuaires, portails, listes de résultats, répertoires, catalogues. Les exploiter suppose aujourd'hui une recopie manuelle, page après page, fastidieuse et source d'erreurs, notamment lorsqu'il faut suivre la pagination.

L'objectif est de déléguer la collecte et la mise en forme à un assistant IA : il parcourt les pages, lit les champs affichés, suit la pagination, et dépose un tableau structuré dans un classeur Excel (ou un CSV), prêt à l'analyse.

Comment ça fonctionne

1

ouvre un vrai navigateur et accède à la page source (limitée à l'allowlist) ;

2

lit les données affichées (par enregistrement : nom, ville, secteur, téléphone, etc.) ;

3

suit la pagination : clique sur « page suivante » et répète tant qu'il reste des pages ;

4

structure les données en lignes et colonnes selon le format demandé ;

5

remplit un classeur Excel via COM Windows, ou écrit un CSV via la capacité fichiers ;

6

rend compte du volume collecté et peut compléter sur demande (colonne supplémentaire, champ manquant).

Capacités ODESA mobilisées

Navigateur réel (web)

Accède aux pages sources, lit le texte affiché, suit la navigation paginée ; navigation bornée par l'allowlist.

COM Windows (com), Excel

Pilote Excel pour remplir le classeur (feuilles, colonnes, valeurs). Borné par la liste des ProgID autorisés.

Fichiers (fs)

Alternative ou complément : écrit un CSV dans une racine autorisée ; sert aussi à enregistrer le classeur.

Interaction humaine (ui) *(option)*

Confirme le lancement d'une extraction volumineuse, ou signale la fin du traitement.

Déroulé type

1

L'utilisateur : « Sur cette page d'annuaire, récupère pour chaque établissement le nom, la ville, le secteur et le téléphone affiché ; mets ça dans un Excel ; continue sur toutes les pages. »

2

L'IA lit la première page, range les valeurs en quatre colonnes, puis clique sur « suivant ».

3

L'IA enchaîne les pages jusqu'à la dernière.

4

L'utilisateur : « Ajoute une colonne avec le code postal. »

5

L'utilisateur : « Plutôt un CSV finalement. »

Données & accès
  • Page(s) source(s) : URL de départ de la liste/annuaire à extraire.
  • Allowlist : le(s) domaine(s) des pages sources.
  • Schéma de sortie : liste des colonnes attendues, fournie en langage naturel.
  • Cible Excel : Excel installé sur le poste (capacité COM, ProgID Excel autorisé), ou racine fichiers pour le CSV.
  • Racine fichiers autorisée : dossier où déposer le classeur / le CSV.
Bornage & sécurité
  • Allowlist d'URLs : l'IA ne navigue que sur les domaines sources autorisés.
  • ProgID autorisés : la capacité COM est restreinte à Excel ; aucun autre logiciel ne peut être piloté.
  • Racine fichiers (« jail ») : le classeur / CSV ne s'écrit que dans le dossier autorisé.
  • Lecture publique : l'IA lit des pages accessibles ; elle ne contourne ni authentification ni paywall.
  • Jeton d'accès : seul l'assistant configuré peut piloter ODESA.

Mise en place

Les étapes pour configurer ODESA sur ce cas d'usage.

1

Installer ODESA en local.

2

Configurer la capacité web : allowlist des pages sources, options de navigation.

3

Choisir la sortie : activer la capacité COM (ProgID Excel autorisé) pour remplir un classeur, ou la capacité fichiers pour un CSV (racine autorisée).

4

(Option) Activer la capacité ui pour la confirmation / notification.

5

Décrire à l'assistant la page source, les champs et les colonnes voulues ; lancer une extraction de test sur une page.

Limites & points d'attention
  • Structure des pages : l'extraction suppose des données affichées de façon régulière. Une mise en page très irrégulière, fortement dynamique (chargement infini, contenu généré au défilement) ou protégée par des mécanismes anti-automatisation peut compliquer la collecte.
  • Volume et respect des sites : pour de gros volumes, garder un rythme raisonnable et respecter les conditions d'utilisation et les fichiers robots des sites sources.
  • Pages publiques : ce cas standard porte sur du contenu publiquement accessible, sans contournement de protection.
  • Pagination atypique : certaines listes utilisent un défilement plutôt que des pages numérotées ; la stratégie de parcours doit être adaptée.
  • Excel requis pour la sortie COM : sur un poste sans Excel, utiliser la sortie CSV.
Évolutions possibles
  • Nettoyage et normalisation des valeurs collectées (formats de téléphone, casse, doublons) avant écriture.
  • Mise en base : ranger les données dans une base SQL plutôt qu'un tableur, pour les réutiliser.
  • Extraction multi-sources en parallèle via plusieurs sessions navigateur indépendantes.
  • Planification VAILS : relancer périodiquement une extraction qui évolue (annuaire mis à jour).
  • Mise en forme avancée du classeur via COM Excel (en-têtes, filtres, feuilles multiples).

Mettez ODESA au travail.

ODESA installe l'IA agentique chez vos clients, en local et sous contrôle. Devenez le partenaire qui la déploie.

14ODESA configuration

The web-to-Excel extractor

Collect data displayed on web pages (with pagination) and structure it into an Excel spreadsheet or a CSV.

Business need

Many useful data are only available as web pages: directories, portals, result lists, registers, catalogues. Exploiting them today requires manual copying, page after page, tedious and error-prone, especially when pagination must be followed.

The goal is to delegate collection and formatting to an AI assistant: it browses the pages, reads the displayed fields, follows the pagination, and drops a structured table into an Excel workbook (or a CSV), ready for analysis.

How it works

1

opens a real browser and accesses the source page (limited to the allowlist);

2

reads the displayed data (per record: name, city, sector, phone, etc.);

3

follows the pagination: clicks "next page" and repeats while pages remain;

4

structures the data into rows and columns per the requested format;

5

fills an Excel workbook via Windows COM, or writes a CSV via the files capability;

6

reports the volume collected and can complete on request (extra column, missing field).

ODESA capabilities used

Real browser (web)

Accesses the source pages, reads the displayed text, follows paginated navigation; navigation bounded by the allowlist.

Windows COM (com), Excel

Drives Excel to fill the workbook (sheets, columns, values). Bounded by the list of allowed ProgIDs.

Files (fs)

Alternative or complement: writes a CSV in an allowed root; also used to save the workbook.

Human interaction (ui) *(option)*

Confirms the launch of a large extraction, or signals the end of processing.

Typical flow

1

User: "On this directory page, get for each establishment the name, the city, the sector and the displayed phone; put it in an Excel; continue on all the pages."

2

The AI reads the first page, tidies the values into four columns, then clicks "next".

3

The AI chains the pages to the last.

4

User: "Add a column with the postcode."

5

User: "Actually, a CSV instead."

Data & access
  • Source page(s): starting URL of the list/directory to extract.
  • Allowlist: the domain(s) of the source pages.
  • Output schema: list of expected columns, provided in plain language.
  • Excel target: Excel installed on the workstation (COM capability, allowed Excel ProgID), or a file root for the CSV.
  • Allowed file root: folder to drop the workbook / CSV.
Scope & security
  • URL allowlist: the AI only navigates the allowed source domains.
  • Allowed ProgIDs: the COM capability is restricted to Excel; no other software can be driven.
  • File root ("jail"): the workbook / CSV is written only in the allowed folder.
  • Public reading: the AI reads accessible pages; it bypasses no authentication or paywall.
  • Access token: only the configured assistant can drive ODESA.

Setup

The steps to configure ODESA for this use case.

1

Install ODESA locally.

2

Configure the web capability: source-page allowlist, navigation options.

3

Choose the output: enable the COM capability (allowed Excel ProgID) to fill a workbook, or the files capability for a CSV (allowed root).

4

(Option) Enable the ui capability for confirmation / notification.

5

Describe to the assistant the source page, the fields and the wanted columns; run a test extraction on one page.

Limits & caveats
  • Page structure: extraction assumes regularly displayed data. A very irregular layout, strongly dynamic (infinite loading, content generated on scroll) or protected by anti-automation mechanisms can complicate collection.
  • Volume and respect for sites: for large volumes, keep a reasonable pace and respect the terms of use and robots files of the source sites.
  • Public pages: this standard case covers publicly accessible content, without bypassing protection.
  • Atypical pagination: some lists use scrolling rather than numbered pages; the browsing strategy must be adapted.
  • Excel required for COM output: on a workstation without Excel, use the CSV output.
Possible extensions
  • Cleaning and normalisation of collected values (phone formats, case, duplicates) before writing.
  • Into a database: tidy the data into a SQL database rather than a spreadsheet, to reuse it.
  • Multi-source extraction in parallel via several independent browser sessions.
  • VAILS scheduling: periodically re-run an extraction that evolves (updated directory).
  • Advanced workbook formatting via Excel COM (headers, filters, multiple sheets).

Put ODESA to work.

ODESA brings agentic AI to your clients, locally and under control. Become the partner who deploys it.