Mon Agent IA Personnel | Centre de Contrôle Intelligent
Il s'agit d'un projet d’intelligence artificielle conçu comme un assistant numérique multimodal capable d’interagir avec différents outils, sources de données et services depuis une interface centralisée. L’objectif n’est pas simplement de créer un chatbot capable de répondre à des questions, mais de construire un véritable agent intelligent, capable de comprendre une demande, d’accéder aux informations nécessaires, d’analyser différents types de contenus...
Présentation du projet
Il s'agit d'un projet d’intelligence artificielle conçu comme un assistant numérique multimodal capable d’interagir avec différents outils, sources de données et services depuis une interface centralisée.
L’objectif n’est pas simplement de créer un chatbot capable de répondre à des questions, mais de construire un véritable agent intelligent, capable de comprendre une demande, d’accéder aux informations nécessaires, d’analyser différents types de contenus et, lorsque cela est autorisé, d’interagir avec des services externes.
Le système centralise notamment :
- Intelligence artificielle
- Documents et connaissances personnelles
- Recherche et navigation Web
- Messagerie Gmail
- Analyse d’images et de documents
- Interaction vocale
- Recherche augmentée par récupération (RAG)
- Automatisation de certaines tâches
Le projet a été pensé autour d'une idée simple : transformer un modèle d’IA en véritable assistant capable d’agir dans un environnement numérique.
Le concept : aller au-delà du chatbot
Un chatbot classique fonctionne principalement selon un modèle simple :
Question → Réponse
Un agent intelligent fonctionne différemment.
Il peut recevoir une demande, déterminer quelles informations sont nécessaires, utiliser différents outils, analyser les résultats puis produire une réponse ou préparer une action.
L’architecture du projet repose donc davantage sur :
Demande → Compréhension → Raisonnement → Outils → Données → Action → Validation
Cette approche permet de rapprocher l’IA des usages réels du quotidien.
Par exemple, au lieu de simplement demander :
« Résume-moi ce document. »
L’utilisateur peut fournir un document, demander son analyse, poser des questions sur son contenu, rechercher des informations complémentaires sur le Web et exploiter ensuite les résultats dans une autre tâche.
Une IA multimodale
L’agent ne se limite pas au texte.
Il peut travailler avec plusieurs types de contenus, notamment :
- JPG
- PNG
- WEBP
- GIF
- DOCX
- TXT
- Markdown
Cette capacité permet d’utiliser l’IA pour analyser différents supports : documents administratifs, graphiques, captures d’écran, tableaux, schémas, factures ou autres fichiers contenant des informations exploitables.
L’objectif est de permettre à l’utilisateur de présenter l’information sous sa forme naturelle, sans devoir systématiquement la convertir avant de pouvoir l’exploiter.
Intelligence artificielle et modèles Gemini
Le cœur conversationnel de l’agent repose sur la famille de modèles Gemini.
L’architecture prévoit également une logique permettant de gérer différents modèles et certains mécanismes de repli afin d’améliorer la disponibilité du service.
Les réponses peuvent être transmises progressivement grâce au streaming SSE (Server-Sent Events).
Au lieu d’attendre que toute la réponse soit générée avant de l'afficher, l’interface peut recevoir progressivement les différents fragments de réponse.
Cela permet de rendre l’interaction plus fluide et plus proche d’une conversation avec un assistant réel.
RAG : connecter l’IA aux connaissances
L’un des éléments importants du projet est l’utilisation du Retrieval-Augmented Generation (RAG).
Un modèle de langage possède des connaissances générales, mais il ne connaît pas nécessairement les documents ou informations spécifiques auxquels l’utilisateur souhaite accéder.
Le RAG permet de créer une passerelle entre le modèle et une base de connaissances.
Le fonctionnement général est :
Document → Extraction → Embedding → Indexation → Recherche → Contexte → Réponse IA
Lorsqu’une question est posée, le système recherche les informations les plus pertinentes dans les données disponibles avant de transmettre le contexte nécessaire au modèle.
Le projet utilise notamment des embeddings ainsi qu’une recherche combinant des approches sémantiques et lexicales.
Cette approche permet d’améliorer la pertinence des réponses lorsqu’elles dépendent de documents spécifiques.
Attribution des sources
Une autre problématique importante concerne la traçabilité des informations.
Une réponse générée par une IA ne devrait pas toujours être considérée comme suffisante en elle-même.
Lorsque cela est possible, le système peut associer les réponses aux sources ou documents utilisés pour construire le contexte.
L’objectif est simple :
Ne pas seulement obtenir une réponse, mais pouvoir comprendre d’où vient l’information.
Cette approche est particulièrement importante pour les documents professionnels, académiques ou administratifs.
OCR et Human-in-the-Loop
Le projet intègre également un système d’OCR (Optical Character Recognition) permettant d’extraire du texte depuis certains documents ou images.
Mais l’extraction automatique n’est pas considérée comme parfaite.
Une chaîne de traitement basée sur le principe Human-in-the-Loop a donc été mise en place :
Document → OCR → Texte extrait → Vérification humaine → Validation → Indexation
L’utilisateur peut notamment corriger les informations extraites, modifier le titre ou ajuster le contenu avant son intégration dans la base de connaissances.
Cette approche permet de combiner :
- la rapidité de l’automatisation ;
- la capacité de contrôle humain ;
- la réduction des erreurs d’extraction ;
- une meilleure qualité des données utilisées ensuite par l’IA.
Intégration de Gmail
L’agent peut également interagir avec Gmail grâce à l’authentification OAuth.
Il peut notamment être utilisé pour :
- rechercher des messages ;
- consulter des emails ;
- résumer des conversations ;
- retrouver des informations précises ;
- préparer des brouillons.
Une distinction importante est cependant faite entre préparer une action et exécuter une action sensible.
Par exemple, la création d’un brouillon peut être automatisée, tandis que l’envoi définitif nécessite une validation explicite de l’utilisateur.
La suppression des emails n’est pas autorisée dans l’architecture du projet.
Cette séparation permet d’éviter qu’un agent puisse effectuer automatiquement des opérations potentiellement irréversibles.
Interaction avec Facebook
Une intégration avec Facebook permet également à l’agent d’exploiter certaines informations et fonctionnalités disponibles via l’API.
Le système peut notamment être utilisé pour :
- consulter certaines informations du profil ;
- analyser des commentaires ;
- consulter des notifications ;
- analyser certaines statistiques ;
- préparer des réponses ou publications.
L’IA peut proposer une réponse ou un contenu, mais l’utilisateur conserve le contrôle sur la publication.
Pour les situations sensibles, le système peut également demander une validation humaine avant toute action.
L’idée n’est donc pas de laisser l’agent publier librement, mais de construire un système dans lequel l’IA assiste et l’humain décide.
Navigation et recherche Web
L’agent peut également exploiter des informations provenant du Web.
Lorsqu’une URL est fournie, le système peut identifier la page et récupérer son contenu textuel afin de permettre son analyse par le modèle.
Cette fonctionnalité ouvre plusieurs possibilités :
- résumer une page Web ;
- analyser un article ;
- extraire des informations ;
- comparer plusieurs sources ;
- répondre à des questions à partir d’un contenu externe.
Cela transforme progressivement l’agent en une interface permettant de dialoguer avec le Web, plutôt que de simplement discuter avec un modèle de langage isolé.
Vision et compréhension des documents
La capacité de vision permet à l’agent d’analyser des contenus visuels.
Il peut notamment être utilisé pour comprendre :
- des graphiques ;
- des diagrammes ;
- des captures d’écran ;
- des tableaux ;
- des documents numérisés ;
- des images contenant du texte ;
- différents éléments visuels présents dans un fichier.
Cette fonctionnalité est particulièrement intéressante lorsqu’une information importante ne se trouve pas directement sous forme de texte exploitable.
Interaction vocale
Le projet intègre également une dimension vocale.
L’utilisateur peut utiliser la voix pour interagir avec l’agent, notamment grâce à des fonctionnalités de :
- dictée ;
- transcription ;
- synthèse vocale ;
- conversation vocale.
L’objectif est de rendre l’interaction plus naturelle et de réduire la dépendance à l’interface textuelle classique.
À terme, l’agent peut ainsi être utilisé davantage comme un assistant personnel conversationnel.
Streaming des réponses
L’utilisation du streaming permet d’améliorer l’expérience utilisateur.
Avec SSE, la réponse du modèle peut être transmise progressivement à l’interface.
L’utilisateur n’a donc pas nécessairement besoin d’attendre la fin complète du traitement pour commencer à voir le résultat.
Cette architecture est particulièrement pertinente pour les réponses longues ou les traitements nécessitant plusieurs secondes.
Sécurité et contrôle des actions
Un agent capable d’accéder à des emails, documents ou services externes doit être conçu avec une attention particulière portée à la sécurité.
Le projet intègre plusieurs mécanismes de protection, notamment :
- authentification OAuth ;
- gestion des permissions ;
- chiffrement des informations sensibles ;
- séparation entre consultation et action ;
- validation humaine pour les opérations critiques ;
- limitation de certaines actions irréversibles.
Les tokens et informations sensibles sont protégés à l’aide de mécanismes de chiffrement tels que Fernet / AES-256 selon les composants concernés.
L’objectif est de respecter un principe essentiel :
Plus un agent possède de capacités d’action, plus ses permissions doivent être contrôlées.
Human-in-the-Loop : garder l’humain dans la boucle
L’un des principes fondamentaux du projet est le Human-in-the-Loop.
L’IA peut :
- analyser ;
- rechercher ;
- résumer ;
- proposer ;
- préparer ;
- recommander.
Mais certaines décisions restent volontairement sous le contrôle de l’utilisateur.
Cela concerne notamment les actions pouvant avoir des conséquences importantes ou difficiles à annuler.
Cette approche permet de construire un système plus sûr tout en conservant les avantages de l’automatisation.
Personnalisation de l’agent
L’architecture prévoit également plusieurs paramètres permettant d’adapter le comportement de l’agent.
Il est notamment possible de configurer :
- le nom de l’agent ;
- ses instructions système ;
- la température ;
- le modèle utilisé ;
- la voix TTS ;
- certaines instructions spécifiques selon le service utilisé.
Cette possibilité permet d’adapter le comportement de l’agent à différents contextes et usages.
Architecture Web et mobile
Le projet n’est pas limité à une utilisation sur ordinateur.
L’interface peut également être adaptée à un environnement mobile grâce à Capacitor.
L’objectif est de conserver une expérience cohérente entre différents supports tout en permettant à l’agent d’être utilisé dans des situations où le smartphone constitue l’interface principale.
Technologies et concepts utilisés
Technologies
- Gemini
- RAG
- Embeddings
- OCR
- OAuth
- SSE / Server-Sent Events
- TTS
- Capacitor
- Supabase
- APIs externes
Concepts
- AI Agents
- Multimodalité
- Retrieval-Augmented Generation
- Human-in-the-Loop
- LLM
- Embeddings
- Automatisation
- Sécurité applicative
- Gestion des permissions
- Streaming
- Traitement documentaire
Ce que ce projet démontre
Ce projet montre surtout qu’un agent IA ne se résume pas à appeler une API de modèle de langage.
Construire un agent réellement utilisable implique de travailler sur plusieurs couches :
Modèle IA + Prompt Engineering + RAG + Embeddings + OCR + APIs + OAuth + Sécurité + Gestion des erreurs + Human-in-the-Loop + Interface utilisateur
Chaque composant répond à un problème différent.
Le modèle fournit l’intelligence générative, mais les autres composants permettent à cette intelligence de devenir réellement exploitable dans un environnement numérique.
Principaux défis techniques
Plusieurs difficultés ont été rencontrées dans la conception d’un tel système.
Fiabilité des réponses
Un modèle peut générer des informations incorrectes ou manquer de contexte.
Approche : utilisation du RAG, recherche de sources et vérification humaine lorsque nécessaire.
Sécurité des intégrations
Donner accès à des services comme Gmail ou Facebook augmente considérablement la surface de risque.
Approche : OAuth, permissions limitées et validation humaine pour les actions sensibles.
Qualité des données
L’OCR ou l’extraction automatique peuvent produire des erreurs.
Approche : intégrer une étape de vérification humaine avant l’indexation.
Expérience utilisateur
Un système composé de nombreux outils peut rapidement devenir complexe.
Approche : utiliser une interface conversationnelle permettant à l’utilisateur d’exprimer directement son besoin.
Ce que j’ai appris à travers ce projet
La réalisation d’un agent IA permet de comprendre que l’intelligence artificielle moderne repose sur beaucoup plus qu’un modèle.
Il faut également comprendre :
- comment connecter un LLM à des données externes ;
- comment construire une architecture RAG ;
- comment gérer des embeddings ;
- comment traiter des documents ;
- comment intégrer des APIs ;
- comment gérer OAuth ;
- comment sécuriser des informations sensibles ;
- comment contrôler les actions d’un agent ;
- comment gérer les erreurs ;
- comment intégrer la validation humaine ;
- comment concevoir une interface adaptée à l’IA.
Ce projet constitue donc une expérience pratique autour de la conception de systèmes IA complets, allant du modèle jusqu'à l’expérience utilisateur.
Conclusion
Agent IA Personnel représente une approche concrète de ce que peut devenir un assistant intelligent lorsqu’on lui donne accès à des données, des outils et des capacités d’action.
L’objectif n’est pas de remplacer l’utilisateur, mais de créer une interface capable de comprendre ses besoins, de rechercher les informations pertinentes, d’effectuer certaines tâches et de demander une validation lorsque la décision doit rester humaine.
Le projet s’inscrit ainsi dans une vision plus large de l’IA : passer de simples modèles qui répondent à des agents capables d’interagir avec leur environnement, tout en conservant des mécanismes de contrôle et de sécurité.
Informations du projet
Catégorie : Intelligence Artificielle & Agents
Type : Projet personnel
Domaine : AI / Data Science / Automation
Concepts principaux : AI Agent, RAG, Multimodalité, Human-in-the-Loop, OCR, OAuth, Automatisation et Sécurité
Plateformes : Web & Mobile
Commentaires (0)
Soyez le premier à commenter !
Laisser un commentaire