Les offres de “Orange”

Nouveau Orange

Stage - Développement d'un tableau de bord d'analyse exploratoire de jeux de données vocales F/H

  • Stage
  • Lannion (Côtes-d'Armor)

Description de l'offre

Date de publication : Sep 28, 2026, 2:45PM

Vous travaillerez au développement d'une plateforme de monitoring innovante dédiée àl'analyse et à la validation de jeux de données. Cette plateforme permettra aux équipes de recherche et développement d'Orange d'évaluer rapidement la qualité et la conformité de leursdatasets avant leur utilisation dans des pipelines d'apprentissage de modèles de traitement dela parole.
Orange développe des technologies vocales multilingues tels que la reconnaissance vocale, lasynthèse vocale et les systèmes de dialogues. La qualité des données d'entraînement est un facteur critique pour la performance et la robustesse de ces modèles. Ce stage vise àautomatiser et à visualiser les contrôles de qualité et de conformité des datasets de parole au travers d’une plateforme dédiée, afin de faciliter et d’accélérer le travail de prétraitement
nécessaire avant tout entraînement de modèles.

Pour garantir des entraînements robustes, fiables et exempt de biais, vous aurez pour missionde concevoir et développer un tableau de bord interactif permettant de :

·  Valider l'intégrité structurelle des corpus vocaux
·  Mesurer la qualité acoustique des enregistrements
·  Générer des statistiques descriptives et des visualisations pertinentes
·  Fournir des recommandations contextualisées selon la tâche aval envisagée

Au quotidien, Vos missions seront de :

·  Concevoir l'architecture logicielle de la plateforme de monitoring, en définissant les modules de chargement, validation, analyse et visualisation des données.
·  Développer les fonctionnalités de chargement de datasets : implémenter des parseurs robustes pour ingérer des corpus vocaux de formats variés (fichiers audio,transcriptions textuelles, métadonnées, images associées).
·  Implémenter les contrôles de conformité des jeux de données (cohérence, intégrité,duplicata, etc.)
·  Intégrer un modèle d'évaluation de la qualité vocale (par exemple, WhiSQA ouéquivalent) pour mesurer la qualité acoustique de chaque enregistrement et identifierles fichiers dégradés.
·  Développer des analyses statistiques descriptives issus des datasets audio.
·  Concevoir un système de recommandations contextualisées : en fonction de la tâche aval sélectionnée (reconnaissance automatique de la parole, synthèse vocale,détection de deepfakes audio, identification de langue, etc.), proposer des avertissements et des conseils de traitement des données.
·  Assurer l'ergonomie et la scalabilité : développer une interface utilisateur intuitive et performante, capable de traiter des corpus de grande taille.
·  Rédiger une documentation technique et scientifique du projet.
·  Bonus (si le temps le permet) :
·  Implémenter des fonctionnalités d'export des rapports (PDF, CSV, JSON)
·  Développer un module de suggestion de sélection de données pour laconstitution des splits d’entrainement
·  Intégrer des visualisations avancées (t-SNE, UMAP) pour explorer les embeddings vocaux
·  Ou toute autre suggestion

Vous êtes actuellement en dernière année d’école d’ingénieur ou en 2è année de Master,avec une spécialisation en informatique, intelligence artificielle, science des données,traitement automatique du langage ou domaine équivalent.

·  Vous maîtrisez le langage Python et avez une expérience solide en développementbackend (frameworks comme Flask, FastAPI ou Django) et êtes familier avec le développement frontend (React, Vue.js ou équivalent).
·  Vous avez une première expérience avec des bibliothèques de traitement et devisualisation de données, telles que Plotly, D3.js, Matplotlib, Seaborn.
·  Vous êtes intéressé.e par le développement d’interfaces et de tableaux de bordinteractifs, avec une première expérience éventuelle de frameworks tels que Streamlit, Dash, Gradio ou équivalent.
·  Vous disposez de connaissances en manipulation de fichiers, bases de données,métadonnées et formats de données structurés, notamment CSV, JSON, YAML ouParquet.
·  Vous êtes à l’aise avec les environnements de développement collaboratif et les outilsde gestion de code, notamment Git.
·  Des connaissances en traitement automatique de la parole, apprentissage automatiqueou apprentissage profond constituent un atout.
·  Un attrait pour le traitement audio numérique est un plus.
·  Vous êtes autonome, rigoureux, curieux.se et avez le sens du partage et de lacommunication.

Vous intégrer un cadre de travail bienveillant avec un accès à un écosystème d’experts Data/IA.
Vos travaux pourront être valorisés par des séminaires internes, un rapport technique structuré, un package de reproductibilité (code, scripts, documentation).

Au sein de l'entité Data AI d’Orange Innovation, l’équipe MAS rassemble environ 25 chercheurs, ingénieurs, développeurs, data scientists, doctorants et apprentis. L'équipe mène des travaux de R&D sur les technologies de la parole au sens large : reconnaissance automatique de la parole (ASR) multilingue, diarisation, synthèse vocale (TTS), évaluation et optimisation des modèles. Nous ancrons nos recherches dans la méthode scientifique : revue de littérature, formulation d’hypothèses, protocoles expérimentaux robustes, analyse statistique et reproductibilité. Nos résultats sont partagés via rapports techniques, séminaires internes, contributions open source et, lorsque pertinent, soumissions à des ateliers/conférences internationales spécialisées.

Date de début souhaitée : Feb 01, 2027, 12:00AM

Chez Orange, seules vos compétences comptent.

Quel que soit votre âge, genre, origine, parcours, religion, orientation sexuelle, handicap, neuroatypie, ou apparence, nous encourageons activement la diversité au sein de nos équipes, car elle constitue une force pour le collectif et un vecteur d’innovation.
Orange est une entreprise handi-accueillante : n’hésitez pas à nous faire part de vos besoins spécifiques.

Faire de chaque avenir une réussite.
  • Annuaire emplois
  • Annuaire entreprises
  • Événements