Âge VII — La multimodalité · 2023 — 2025
Un seul modèle pour le texte, l'image et la voix
Événement
Que s'est-il produit ?
Des modèles nativement multimodaux traitent dans un même espace le texte, l'image, le son et la vidéo, avec des échanges vocaux en temps quasi réel.
Capacité
Que l'IA peut-elle désormais faire ?
Voir un document, entendre une question, répondre à voix haute et raisonner sur l'ensemble.
Rupture
Pourquoi cette étape change-t-elle la trajectoire ?
La séparation entre les modalités disparaît côté utilisateur. On montre au lieu de décrire.
Conséquence
Que cela change-t-il pour l'humanité ?
L'accessibilité progresse pour les personnes empêchées de lire ou d'écrire, en même temps que la surveillance automatisée devient plus simple à déployer.
Voix machine
« Montre-moi, je regarde et je réponds. »
Sources · force documentaire P1 à P4
L'état de contrôle indique la dernière réponse obtenue en interrogeant l'adresse, non la conformité du document : un lien actif ne prouve pas que la page affiche bien la référence citée. Les liens protégés par un dispositif anti-robot s'ouvrent normalement dans un navigateur. · P1 source primaire — publication évaluée, texte officiel, document d'origine · P2 institutionnelle, ou communication d'entreprise : primaire pour ce que son émetteur affirme, non preuve indépendante · P3 recherche secondaire, synthèse ou prépublication non évaluée · P4 presse. Le grade qualifie la source, non la fiche.
Partager
Chaque page a son adresse propre et sa carte de partage. Aucun script tiers n'est chargé : ces boutons sont de simples liens.
Pour citer : Un seul modèle pour le texte, l'image et la voix — 2024 · IA LIFE LINE — IA LIFE LINE, https://oveliya.com/ia-life-line/fiche/2024-multimodal/, consulté le . Corpus sous licence CC BY-NC 4.0.