SOUVERAIN TECHNOLOGIE
← Retour aux articles

Dictée vocale et notes cliniques : installer Whisper en local sans envoyer d'audio dans le nuage

Par Vincent Savard • • Technique & Santé

L’utilisation de la voix pour dicter des notes d’évolution ou transcrire des entrevues fait gagner plusieurs heures par semaine aux psychologues, médecins et avocats.

Le problème réside dans les outils grand public. Des applications comme Otter.ai, Dragon Professional Cloud ou l’API Whisper hébergée chez OpenAI envoient les fichiers audio sur des serveurs distants. Dans le cas d’une entrevue clinique, un enregistrement audio contient la voix directe du patient, ses confidences les plus intimes et souvent des noms de tiers. Transmettre ce flux à un service tiers constitue une rupture du secret médical et une non-conformité avec la Loi 25.

Pourtant, le modèle de transcription Whisper développé à l’origine par OpenAI a été publié sous licence libre (MIT). Il peut être exécuté intégralement sur votre propre ordinateur, sans internet.

Configuration requise et performances réelles

Pour faire tourner Whisper en local avec une latence quasi-nulle et une excellente précision en français, vous n’avez pas besoin d’un centre de données.

Voici la configuration matérielle type que nous installons en cabinet :

  • Processeur : Apple Silicon (M2/M3/M4 avec 16 Go de mémoire unifiée) ou PC sous Linux/Windows avec une carte graphique NVIDIA de milieu de gamme (ex. RTX 4060 avec 8 Go de VRAM).
  • Moteur d’inférence : utilisation de whisper.cpp ou de faster-whisper (optimisation CTypes avec quantification CTranslate2 en 8 bits).
  • Modèle sélectionné : large-v3-turbo ou medium.

Sur une machine Apple M3, la transcription d’une dictée de 10 minutes prend environ 45 secondes. La précision sur le français québécois et le vocabulaire clinique (DSM-5, terminologie médicolégale) est identique à celle des services payants en ligne.

La preuve par l’isolation réseau (Air-Gapping)

L’avantage décisif de cette architecture est la vérifiabilité de la sécurité.

Une fois le modèle téléchargé et installé sur le poste de travail :

  1. Les règles du pare-feu local bloquent tout trafic sortant pour le binaire de transcription.
  2. Vous pouvez débrancher le câble réseau ou couper le Wi-Fi : le logiciel fonctionne exactement de la même manière.
  3. Le fichier audio temporaire est traité dans la mémoire vive (RAM) et écrasé dès que le texte est collé dans votre dossier patient.

Aucun compte utilisateur externe n’est requis. Aucun abonnement mensuel par utilisateur n’est facturé. Le cabinet conserve la garde exclusive du matériel et des données.

Vous souhaitez évaluer la souveraineté de votre cabinet ?

Nous analysons vos flux documentaires et vous proposons un plan d'autonomie sans engagement.

Demander une démonstration