beVault evolves quickly.—Don't miss any news Subscribe to release notes

AI Series · Article 5/7 Back to series

Automating metadata extraction with AI: no more SQL parsers

La puissance de l'orchestration IA simple — sans infrastructure complexe.

Certaines tâches sont parfaites pour l'automatisation IA : fastidieuses à faire manuellement, basées sur la reconnaissance de patterns plutôt que sur le jugement métier, produisant des sorties structurées.

Ces tâches partagent un pattern commun : envoyer une entrée à un modèle IA, recevoir une sortie structurée, utiliser le résultat. Pas de prise de décision complexe. Pas de raffinement itératif. Juste de l'orchestration simple.

The opportunity: documenting your Information Marts with AI

Dans beVault, la documentation des Information Marts est essentielle mais chronophage. Vous écrivez du SQL dans l'onglet "Code". Pour maintenir un lineage correct, beVault fournit un onglet "Columns" où vous documentez chaque colonne de sortie et son lineage.

Ces métadonnées sont précieuses pour la gouvernance, la visualisation du lineage, l'analytique self-service et la collaboration d'équipe.

L'opportunité : un script avec 50 colonnes peut prendre une heure à documenter manuellement. Avec l'automatisation IA, ça tombe à 2-3 minutes — réduction de 90 %+ tout en améliorant la cohérence.

The approach: simple orchestration

Ce pattern connecte deux APIs via une state machine linéaire :

  • Récupérer le SQL du script depuis beVault
  • Envoyer le SQL à Anthropic Claude avec un prompt structuré
  • Parser la réponse JSON contenant les métadonnées
  • Mettre à jour les métadonnées de colonnes via l'API beVault

Design the perfect prompt for beVault

Le succès de cette automatisation dépend entièrement du prompt engineering. Votre prompt doit guider Claude à produire du JSON qui mappe directement à la structure de colonnes beVault.

Les cinq composants critiques :

  • Définition de rôle claire
  • Instruction de format explicite
  • Définition du schéma
  • Gestion des cas limites (CTEs, requêtes imbriquées, transformations complexes)
  • Contraintes répétées sur le format de sortie

Structure essentielle :

prompt
You are a SQL code analyzer specialized in extracting data lineage metadata from
Information Mart scripts.
 
Your task is to analyze the provided JSON response containing an Information Mart
script and generate an API call payload to update its metadata.
 
## Output Requirements
Generate ONLY a JSON payload that contains ALL the key/value pairs from the input
API response EXCEPT "_links", "_embedded" and "code".
 
## Column Analysis Rules
- Column Identification: Extract each column from the SELECT clause
- Direct column references (e.g., info2.contact_name as customer)
- Calculated fields (e.g., info.unit_price * info4.quantity as sales_amount_target)
 
Critical Output Requirement:
RESPOND WITH ONLY THE JSON PAYLOAD. NO EXPLANATORY TEXT.

Pour le prompt complet prêt pour la production, voir la documentation beVault : https://support.bevault.io/en/bevault-documentation/current-version/how-tos/how-to-update-the-metadata-of-your-im-scripts-with-ai

What it delivers

  • Gain de temps : 30-60 min manuellement → 2-3 min avec l'IA (−90 %)
  • Gouvernance améliorée : lineage complet, format cohérent, aucune documentation manquée
  • Meilleure collaboration : les utilisateurs métier comprennent les data products sans lire le SQL
  • Moins d'erreurs : pas de fautes de frappe dans les noms de colonnes ou les références d'entités

Limites

Cette approche excelle quand les tâches sont bien définies et les scripts stables. Elle montre ses limites pour le raffinement interactif basé sur le contexte métier, ou pour les noms de colonnes très ambigus sans connaissance domaine.

Next articleInteractive AI agentsRead