AudioRAG vise à transformer les contenus radio, TV ou podcasts en une base de connaissances exploitable par IA.
Le projet permet de passer d’un média éphémère (audio ou vidéo) à un espace d’exploration sémantique interactif, où l’utilisateur peut poser des questions, explorer des thèmes, et obtenir des synthèses de ce qui a été dit.
L’objectif à long terme est de proposer un moteur d’analyse et de recherche conversationnelle multimédia, capable de :
| Enjeu | Description |
|---|---|
| Accès intelligent au contenu audio-visuel | Transformation des transcriptions audio en données consultables et interrogeables. |
| Analyse du discours et des opinions | Étude des thèmes, émotions et argumentations présentes dans les médias. |
| Veille médiatique augmentée par IA | Possibilité de poser des questions à une base de contenus audio (RAG). |
| Synthèse et contextualisation | Génération de résumés et visualisation des relations entre émissions. |
Créer une preuve de concept complète sur un fichier audio unique (ex. un podcast ou un extrait radio).
Téléchargement du contenu audio
ASR + Diarisation
RAG vectoriel et graph (single-document)
Interface web (Streamlit)
Étendre le RAG et la visualisation à plusieurs contenus audio connectés autour d’un même sujet.
RAG multi-documents
Clustering et graphe inter-émissions
Interface enrichie
"Que disait le présentateur x à propos de la crise du logement dans son émission du 5 mars ?"
Le chatbot retrouve la séquence correspondante, la résume et montre les passages similaires dans d’autres émissions.
| Version | État | Description |
|---|---|---|
| v0.1 | 🚧 En développement | RAG sur un seul contenu audio, interface Streamlit |
| v0.2 | 🧩 Conception | RAG multi-contenus + graphe inter-émissions |
| v0.3+ | 🔭 À définir | Automatisation de la veille, enrichissement multimodal |
Les contributions sont bienvenues :
MIT License © 2025 AudioRAG Project
35 commits
HTML
56.9%
Jupyter Notebook
31.1%
Python
12.0%
AudioRAG vise à transformer les contenus radio, TV ou podcasts en une base de connaissances exploitable par IA.
Le projet permet de passer d’un média éphémère (audio ou vidéo) à un espace d’exploration sémantique interactif, où l’utilisateur peut poser des questions, explorer des thèmes, et obtenir des synthèses de ce qui a été dit.
L’objectif à long terme est de proposer un moteur d’analyse et de recherche conversationnelle multimédia, capable de :
| Enjeu | Description |
|---|---|
| Accès intelligent au contenu audio-visuel | Transformation des transcriptions audio en données consultables et interrogeables. |
| Analyse du discours et des opinions | Étude des thèmes, émotions et argumentations présentes dans les médias. |
| Veille médiatique augmentée par IA | Possibilité de poser des questions à une base de contenus audio (RAG). |
| Synthèse et contextualisation | Génération de résumés et visualisation des relations entre émissions. |
Créer une preuve de concept complète sur un fichier audio unique (ex. un podcast ou un extrait radio).
Téléchargement du contenu audio
ASR + Diarisation
RAG vectoriel et graph (single-document)
Interface web (Streamlit)
Étendre le RAG et la visualisation à plusieurs contenus audio connectés autour d’un même sujet.
RAG multi-documents
Clustering et graphe inter-émissions
Interface enrichie
"Que disait le présentateur x à propos de la crise du logement dans son émission du 5 mars ?"
Le chatbot retrouve la séquence correspondante, la résume et montre les passages similaires dans d’autres émissions.
| Version | État | Description |
|---|---|---|
| v0.1 | 🚧 En développement | RAG sur un seul contenu audio, interface Streamlit |
| v0.2 | 🧩 Conception | RAG multi-contenus + graphe inter-émissions |
| v0.3+ | 🔭 À définir | Automatisation de la veille, enrichissement multimodal |
Les contributions sont bienvenues :
MIT License © 2025 AudioRAG Project
35 commits
HTML
56.9%
Jupyter Notebook
31.1%
Python
12.0%