L’hôpital 嶺井第一病院, situé dans la ville d’Urasoe, dans la préfecture japonaise d’Okinawa, a commencé à proposer le système CommunicationBoard+AI afin d’aider les patients qui ont perdu la capacité de parler tout en conservant leur conscience et leur capacité à s’exprimer. Le système repose sur les lunettes MiRZA de NTTコノキューデバイス, un smartphone qui leur est associé et une unité de commande équipée d’un joystick de type XBOX Adaptive ジョイスティック.
Au cours d’un essai mené de janvier à avril, 25 patients ont participé au total. Selon l’article, certains patients étaient initialement hésitants, mais ils ont continué à utiliser les lunettes avec enthousiasme après les avoir essayées. La composition des messages, qui prenait plusieurs minutes avec un tableau de lettres en papier ou en acrylique, ne prenait plus que quelques dizaines de secondes ou quelques secondes dans certains cas. La mise à disposition officielle du système a commencé le 29 mai, et des patients atteints de sclérose latérale amyotrophique (ALS) ont également commencé à l’utiliser individuellement.
Du tableau de lettres à la suggestion de phrases
Le tableau des caractères japonais composé de syllabes selon l’ordre « gojūon » apparaît dans le champ de vision de l’utilisateur. Le curseur peut être déplacé par des mouvements de la tête ou à l’aide du joystick, avec deux options de saisie : sélectionner chaque caractère séparément, ou sélectionner un groupe tel que la « ligne A » ou la « ligne KA », puis affiner la sélection d’une manière semblable à un clavier coulissant. Les professionnels déterminent la méthode la mieux adaptée à chaque patient.
Après la saisie d’environ deux caractères, le système utilise un modèle d’intelligence artificielle d’OpenAI disponible via Microsoft Azure pour prédire les mots ou expressions suivants. Une fois la phrase validée, elle est convertie en voix à l’aide du service Text to Speech, afin que les membres de la famille ou le personnel soignant puissent l’entendre.
La caméra ajoute du contexte au message
Le système ne se limite pas à la saisie de texte. Lors de la sélection de l’icône de la caméra, le service de reconnaissance d’images d’Azure analyse la scène filmée par la caméra des lunettes et suggère des noms d’objets tels qu’un rideau, un lit ou un téléviseur. Il est ensuite possible de compléter le message avec des verbes comme « allumer » ou « éteindre ». Dans d’autres exemples, le système a également reconnu des livres, des fruits et des personnes apparus devant la caméra, puis a ajouté des noms appropriés à la liste des suggestions.
Rocket Studio a développé le système pendant trois ans et demi, à partir de novembre 2022, avec une équipe composée d’un programmeur et d’un directeur. Le vice-président de l’entreprise, Tomohiko Nakajima, a déclaré que l’innovation fondamentale ne résidait pas dans une technologie d’intelligence artificielle développée par l’entreprise, mais dans la conception de l’interface : les couleurs, la taille des caractères, le nombre d’étapes de saisie et la possibilité de l’utiliser sans lire de manuel. L’entreprise s’est appuyée sur son expérience dans le développement de jeux pour concevoir l’interface.
Qu’est-ce qui a changé concrètement ?
La valeur du système réside dans la réduction de la charge entre le désir du patient de s’exprimer et la réception du message par son entourage. Le fait de placer l’intelligence artificielle et les services de conversion de la parole en voix dans le cloud a également facilité le transfert de l’application des lunettes HoloLens 2, dont la production s’est arrêtée en 2024, vers les MiRZA, sans reconstruire les composants essentiels ; la principale modification a concerné la saisie et l’affichage sur l’appareil.
La pratique sur le terrain a également montré que le contrôle par mouvements de la tête pouvait provoquer de la fatigue, notamment chez certains patients en rééducation utilisant un fauteuil roulant. L’entreprise a donc ajouté le joystick après l’observation de l’hôpital et a réussi à l’intégrer en une seule journée. La personnalisation de l’expérience pour chaque patient se fait au moyen d’instructions textuelles prédéfinies, par exemple en proposant des expressions liées à l’éclairage ou aux rideaux pour un patient dont il faut éviter de stimuler les yeux. Le système ne charge pas l’intégralité du dossier médical électronique, mais se limite aux informations nécessaires, selon l’article.
Limites et questions ouvertes
La méthode de contrôle actuelle ne fonctionne pas avec un patient atteint de SLA qui n’est plus capable que de bouger les yeux ; elle exige l’utilisation de la tête ou du doigt, ce qui signifie que son utilisation doit commencer avant la perte de ces capacités. Rocket Studio étudie le transfert du système vers des appareils moins coûteux équipés d’un suivi du regard, s’ils deviennent disponibles, et envisage également d’ajouter une voix artificielle imitant la voix originale du patient grâce à l’enregistrement préalable de phrases.
Le service est vendu dans le cadre d’accords de licence, tandis que le prix est fixé individuellement sur demande. L’entreprise prévoit une version moins coûteuse destinée à la rééducation à domicile. L’article mentionne l’existence d’un filtre automatique du contenu nuisible dans Azure, mais ne fournit ni résultats cliniques quantitatifs ni détails opérationnels sur la précision de la prédiction et de la reconnaissance des images, des points qui devront être examinés avant d’évaluer l’adéquation du système à plus grande échelle.