Les appareils intelligents IoT s’orientent de plus en plus vers une intégration profonde de l’audio, vidéo, et technologies d'IA. Produits tels que des haut-parleurs intelligents, systèmes d'interphone vidéo, Caméras CIP, Terminaux audio Bluetooth, et les panneaux d'interaction homme-machine nécessitent de multiples capacités, y compris la lecture audio, capture vidéo, et algorithmes vocaux intelligents. Pendant longtemps, les développeurs ont dû basculer entre plusieurs frameworks indépendants, ce qui entraîne des interfaces incohérentes, réutilisation du code difficile, et des coûts d'apprentissage élevés, ce qui limitait l'efficacité des itérations du produit.
Espressif a publié ESP-GMF (Cadre multimédia général) v1.0! Il s'agit de la première version officiellement publiée et stable par API du framework multimédia général d'Espressif.. Il intègre l'audio, vidéo, et les capacités multimédia de l'IA dans un cadre unifié, fournissant une base de développement multimédia tout-en-un pour les puces de la série ESP32. Il remplace officiellement ESP-ADF et marque le début d'une nouvelle ère pour le développement multimédia Espressif IoT.
Qu'est-ce que l'ESP-GMF?
ESP-GMF est un framework de développement multimédia unifié conçu pour les SoC Espressif. Grâce à un modèle de flux de données unifié, système de composants, et architecture de développement, il intègre l'audio, vidéo, et capacités multimédias de l'IA sur une seule plateforme, offrir aux développeurs une solution plus efficace, flexible, et une expérience de développement évolutive.
Par rapport au précédent ESP-ADF (Cadre de développement audio), qui se concentrait principalement sur les applications audio, ESP-GMF a été entièrement mis à niveau en termes de conception d'architecture, gamme de support matériel, et capacités de réutilisation du code. Il peut prendre en charge un large éventail de scénarios d'application, y compris la lecture audio, enregistrement audio, Applications vocales IA, appels vidéo, Son Bluetooth, rendu d'image, et plus.
Construire une plate-forme logicielle multimédia unifiée
Avec l'intégration continue de l'audio, vidéo, et applications d'IA, le développement multimédia devient de plus en plus complexe et diversifié.
Grâce à une architecture logicielle unifiée, ESP-GMF intègre les capacités multimédias précédemment distribuées d'Espressif et établit un réseau unifié. Flux de données modèle, système de composants modulaires, et évolutif Pipeline architecture. Cela fournit une approche de développement cohérente pour l'audio, vidéo, et applications multimédia IA.
Les développeurs n'ont plus besoin de basculer entre plusieurs frameworks et peuvent réaliser le développement de différents types d'applications multimédias au sein du même système de développement.. Cela réduit considérablement les coûts d'apprentissage et améliore l'efficacité de la réutilisation du code..
En même temps, Espressif a développé Noyau multimédia ESP en tant que fondement des capacités sous-jacentes de l'ESP-GMF. ESP Multimedia Core consolide les capacités fondamentales telles que les protocoles multimédias, codecs audio/vidéo, algorithmes audio, et algorithmes de traitement d'image dans les bibliothèques sous-jacentes. Il fournit une base logicielle stable et à long terme pour l'ESP-GMF et les futurs produits multimédias., tout en évoluant continuellement avec l’écosystème multimédia d’Espressif.
ESP-GMF v1.0: La première version stable de l'API
ESP-GMF v1.0 est le premier officiellement publié API stable version du cadre. Cette version unifie plusieurs versions de développement précédentes et met à niveau tous les composants officiels vers 1.0.x, ce qui signifie que les futures versions continueront d'évoluer tout en maintenant la stabilité de l'API, rendre le cadre plus adapté au développement de produits et à la maintenance à long terme.
Cette version introduit principalement les mises à jour suivantes:
Tous les composants officiels mis à niveau vers 1.0.x
Tous les composants officiels ont terminé leur transition vers des versions officielles, et les API publiques ont atteint un état stable, fournir une assurance de compatibilité à long terme pour le développement de produits.
Quatre nouveaux modules de base ajoutés
ESP-GMF v1.0 introduit plusieurs modules de capacités importants, y compris:
esp_player
Un nouveau lecteur multimédia embarqué prenant en charge le démultiplexage, décodage, rendu audio/vidéo, et opérations de recherche.
esp_asrc
Un module de conversion de fréquence d'échantillonnage audio capable de convertir les fréquences d'échantillonnage, profondeur de bits, et canaux audio, avec prise en charge de l'accélération collaborative logicielle et matérielle.
esp_video_render
Un module de rendu vidéo et UI prenant en charge plusieurs backends d'affichage, double flux vidéo, Recouvrir, et systèmes de widgets.
gmf_fft
Un module de calcul FFT/IFFT à virgule fixe prenant en charge l'accélération matérielle sur des puces telles que ESP32-S31, ESP32-P4, et ESP32-S3.
Amélioration supplémentaire des capacités multimédias
Avec l'introduction de nouveaux composants, ESP-GMF v1.0 établit un système complet de capacités multimédia couvrant l'audio, vidéo, IA multimodale, et multimédia Bluetooth. Il fournit des interfaces fonctionnelles unifiées pour la capture de contenu, traitement, lecture, rendu, et transmission, offrir aux développeurs une expérience de développement multimédia plus complète et plus efficace.
Capture ESP fournit un point d'entrée unifié pour la capture audio et vidéo, intégration de l'accès aux appareils, conversion de format, codage, traitement d'images, Recouvrir, synchronisation, et capacités de multiplexage. Il prend en charge la négociation automatique, transmission de flux parallèle, et stockage local, ce qui le rend largement applicable à des scénarios tels que l'IA multimodale, WebRTC, diffusion en direct, et surveillance à distance.
Joueur ESP fournit une solution de lecture tout-en-un, du démultiplexage et du décodage au rendu audio/vidéo. Il prend en charge plusieurs sources multimédias, y compris les fichiers locaux, HTTP(S), et HLS, tout en intégrant la synchronisation audio-vidéo, contrôle de lecture, Chercher, et fonctions de lecture à vitesse variable, aider les développeurs à créer rapidement des applications de lecture multimédia stables et fluides.
Lecteur audio simple ESP fournit une solution légère de lecture audio pure. Il prend en charge les formats grand public tels que MP3, CAA, FLAC, WAV, et opus, ainsi que plusieurs sources audio. Il peut automatiquement terminer le décodage et la conversion du format audio, permettant aux applications d'obtenir une lecture audio efficace avec une consommation de ressources réduite.
Rendu vidéo ESP offre des capacités de composition et d'affichage vidéo hautes performances. Il prend en charge plusieurs flux vidéo, Interface utilisateur superposée, rendu intégré, et des backends d'affichage tels que LCD et LVGL, répondant aux exigences des applications, y compris les lecteurs vidéo, écrans intelligents, robots, et aperçus de la caméra.
Rendu audio ESP est conçu pour l'intégration audio multicanal et une sortie de haute qualité. Il prend en charge le mixage PCM, traitement des effets audio, et capacités de post-traitement, permettant une mise en œuvre flexible de scénarios typiques tels que la musique de fond et le mixage TTS, superposition du son des notifications, et interaction vocale.
ESP BT Audio unifie les capacités Classic Bluetooth et LE Audio. Il prend en charge les protocoles dont A2DP, HFP, AVRCP, BAP, et TMAP, et peut être intégré de manière transparente dans le pipeline ESP-GMF. Les développeurs peuvent également combiner les exemples audio Bluetooth de base fournis par Espressif pour découvrir rapidement des applications typiques telles que LE Audio et Auracast., accélérer le développement de produits audio Bluetooth.
Optimisation continue pour plusieurs SoC Espressif
ESP-GMF v1.0 continue d'être optimisé pour les SoC Espressif tels que ESP32-S31, ESP32-P4, et ESP32-S3.
Parmi eux, ESP32-S31 introduit la nouvelle prise en charge de la caméra V4L2 et prend en charge le décodage MJPEG vers RVB, Superposition vidéo multirégion, exemples de rendu audio/vidéo, ainsi que des capacités d'accélération matérielle FFT et PPA. Ces améliorations offrent une prise en charge plus complète du développement d'applications telles que les caméras IA., écrans intelligents, et terminaux d'interaction homme-machine.
En outre, la nouvelle version optimise encore la chaîne d'outils de développement. esp_board_manager a été séparé en un composant indépendant, et les exemples de projets utilisent désormais uniformément le esp-bmgr-assist Package Python pour gérer les ressources de la carte de développement. Cela rend les méthodes de configuration plus cohérentes entre les différents projets et améliore encore l'efficacité du développement..
Scénarios d'application de produits typiques
Terminaux vocaux intelligents:
Haut-parleurs intelligents avec mot de réveil hors ligne, panneaux de commande vocale, Microphones vocaux Bluetooth
Appareils visuels intelligents:
Haut-parleurs vocaux équipés d'un écran, systèmes d'interphone vidéo intérieurs, caméras de contrôle d'accès
Caméras IoT (CIB):
Capture vidéo + prise audio, alertes vocales, interphone bidirectionnel
Produits audio Bluetooth:
Diffusion audio LE, Terminaux audio publics Auracast
Interaction homme-machine industrielle:
Annonces vocales de l'équipement, alertes audio locales, terminaux de capture d'images
Conclusion
ESP-GMF v1.0 a été officiellement open source. Les développeurs peuvent accéder au code source via le référentiel ESP-GMF GitHub et le combiner avec la documentation officielle, notes de version complètes, et le Guide du cadre multimédia général Espressif pour découvrir rapidement l'audio, vidéo, et capacités de développement multimédia d'IA rendues possibles par le cadre multimédia unifié.
La libération de ESP-GMF v1.0 marque une mise à niveau stratégique de l’écosystème logiciel multimédia d’Espressif. Un framework unique prend désormais en charge l'intégration de l'audio, vidéo, et exigences en matière d'IA, reliant l'ensemble de la chaîne de développement, depuis l'acquisition du matériel et le traitement des médias jusqu'aux algorithmes intelligents.














