Transformer un tuto YouTube en outil qui tourne

Une vidéo montre quelqu'un faire une chose une fois. À la fin de ce guide, tu as un outil qui la fait à la demande.

Le scénario habituel : tu regardes un tuto, tu prends des notes que tu ne rouvriras jamais, et trois semaines plus tard tu refais le montage de mémoire, de travers. Ce qui suit se termine autrement : par un skill installé dans ton agent, qui exécute la méthode enseignée dans la vidéo, aussi longtemps que tu le gardes.

Compte un quart d'heure d'installation, une seule fois. Ensuite, chaque vidéo te coûte quelques minutes.

Le principe : deux lecteurs qui ne voient pas la même chose

Un agent de code sait lire une page, lancer un script, parcourir un dépôt. Il ne sait pas regarder une vidéo. Colle-lui un lien YouTube et il devine à partir du titre.

La méthode fait donc lire la vidéo deux fois, par deux IA différentes, et surtout par deux chemins différents :

  • Claude lit la vidéo sur ta machine : des images extraites et la transcription horodatée.
  • Gemini lit la même URL de son côté, chez Google, avec ses propres images et son propre son. Rien ne transite par ton disque.

Aucun des deux ne voit les preuves de l'autre. C'est exactement ce qui rend le deuxième avis utile : là où ils se contredisent se trouve ce que tu dois aller vérifier toi-même. Un résumé unique, lui, a toujours l'air également sûr de lui partout, y compris là où il invente.

1

Donne la vue à ton agent

On installe /watch, un skill open source qui télécharge la vidéo, en extrait les images et récupère la transcription, puis remet le tout à l'agent. Choisis la ligne qui correspond à ton environnement.

Dans Claude Code

deux commandes, dans l'ordre
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

Dans Codex, Cursor, Copilot, Gemini CLI et les autres

dans ton terminal
npx skills add bradautomates/claude-video -g

Sur Claude en ligne, télécharge le fichier watch.skill depuis la dernière version publiée du dépôt, puis ajoute-le dans Paramètres, Capacités, Skills.

Sous le capot, /watch s'appuie sur deux outils libres que tu connais peut-être déjà, yt-dlp et ffmpeg. Ils s'installent tout seuls au premier appel. Si tu passes par Claude en ligne, active d'abord l'exécution de code dans les capacités : sans elle, l'installation réussit et chaque lancement échoue.
2

Récupère une clé Gemini

C'est la seule clé de toute la chaîne. Elle se crée gratuitement sur aistudio.google.com/apikey, puis se range dans une variable d'environnement :

dans ton terminal
export GEMINI_API_KEY="ta-cle-ici"
Reste sur le palier gratuit, et pas seulement pour le prix. Les clés gratuites affichent les modèles haut de gamme mais renvoient une erreur dès qu'on les appelle. Surtout, un modèle plus bavard produit des comptes rendus plus fluides et plus inventés : ici, un modèle rapide plus tes propres yeux valent mieux qu'un gros modèle et de la confiance.

Tu n'as besoin d'aucune autre clé. La grande majorité des vidéos publiques ont des sous-titres, et pour les rares qui n'en ont pas, Gemini entend l'audio de son côté. Si tu veux la transcription sur ton disque, un modèle de transcription local fait le travail gratuitement et hors ligne.

3

Fais lire la vidéo à Claude

Lance /watch sur l'URL, puis demande un cahier des charges structuré avant toute autre chose :

prompt de lecture
À partir de ce que tu viens de voir dans la vidéo, écris-moi
un cahier des charges en six parties :

1. Ce que la méthode produit, en une phrase.
2. Les outils utilisés, avec leur nom exact.
3. Les étapes, dans l'ordre, avec les commandes telles
   qu'elles apparaissent à l'écran.
4. Les réglages et valeurs précises montrés.
5. Ce qu'il fallait avoir fait AVANT que la vidéo commence.
6. Les pièges que l'auteur mentionne en passant.

Note ce que tu n'as pas pu lire clairement plutôt que de
le deviner. Enregistre le tout dans notes/passe-claude.md.
Les parties 5 et 6 sont celles qui sauvent la soirée. Dans tout tuto, il y a un moment où l'auteur lâche « ah oui, il faut avoir déjà installé ça », et cette phrase de deux secondes vaut plus que le reste de la vidéo.

Si la vidéo est surtout du terminal ou du code, demande une résolution d'extraction plus élevée, sinon les commandes sont illisibles. Et n'ouvre pas encore la lecture de Gemini.

4

Envoie la même vidéo à Gemini

Plutôt que de recopier un script figé, fais-le écrire par ton agent : les noms de modèles Gemini changent plus vite que n'importe quel guide.

prompt, à donner à ton agent de code
Écris-moi un script Python qui envoie une URL YouTube à
l'API Gemini et me rend un cahier des charges de la vidéo.

Contraintes :
- Le script passe l'URL directement au modèle, sans rien
  télécharger sur ma machine.
- Il lit la clé dans la variable GEMINI_API_KEY.
- Il essaie plusieurs modèles rapides à la suite, et passe
  au suivant si l'un renvoie une erreur de quota.
- Il interroge le modèle DEUX fois avec la même consigne,
  puis me montre les deux réponses côte à côte.
- Je peux limiter la lecture à une portion de la vidéo.

Utilise la même consigne en six parties qu'à l'étape
précédente. Enregistre le résultat dans
notes/passe-gemini.md.
Le double appel n'est pas une sécurité, c'est la mesure. Un modèle est un témoin instable : même vidéo, même consigne, réponse sensiblement différente. Ce qui apparaît dans les deux réponses est solide. Ce qui n'apparaît que dans une seule est une supposition, et tu peux enfin voir laquelle.
5

Confronte les deux lectures

C'est l'étape que tout le monde saute, et c'est celle qui transforme deux comptes rendus moyens en un document fiable.

prompt de confrontation
Voici deux lectures indépendantes de la même vidéo :
notes/passe-claude.md et notes/passe-gemini.md.

Produis un seul document, où CHAQUE affirmation porte une
étiquette :
- CONFIRMÉ : les deux lectures le disent.
- SOURCE UNIQUE : une seule le dit. Précise laquelle.
- CONFLIT : elles se contredisent. Donne les deux versions.

Termine par une liste QUESTIONS OUVERTES : ce que la vidéo
n'a jamais vraiment expliqué.

N'arbitre pas les conflits toi-même et ne fusionne rien
pour faire propre. Enregistre dans SPEC.md.

Tu ne relis pas la vidéo entière : tu passes ton attention sur les lignes CONFLIT, en général trois ou quatre. Et la liste des questions ouvertes est le document le plus précieux de toute la chaîne : c'est l'inventaire écrit de ce que le tuto ne t'a jamais appris, donc de ce qui cassera plus tard.

6

Construis le skill, puis lance-le une fois

Donne SPEC.md à skill-creator, le skill officiel d'Anthropic qui sert à écrire des skills. Il te pose quelques questions et écrit le fichier au bon endroit.

dans ton agent
Utilise skill-creator pour construire un skill à partir de
SPEC.md. Le skill doit exécuter la méthode de la vidéo sur
une nouvelle entrée que je lui donnerai.

Ignore les lignes étiquetées CONFLIT tant que je ne les ai
pas tranchées, et mentionne dans le skill ce qui vient
d'une SOURCE UNIQUE.
Puis lance-le une fois, sur un cas réel, et corrige ce qui casse. Cette étape n'est pas facultative, c'est là que la plupart des gens s'arrêtent. Un skill tiré d'une vidéo mais jamais exécuté n'est qu'un résumé de vidéo déguisé en outil. Il faut en général une passe de corrections.

Tu te retrouves avec trois choses, et chacune a son rôle : SPEC.md dit ce que tu as construit, le dossier notes/ garde les preuves, et le skill fait le travail. Dans trois mois, quand il déraillera, tu pourras remonter à la ligne exacte et voir si elle était CONFIRMÉE ou SOURCE UNIQUE. Autrement dit, savoir tout de suite si le bug vient de toi ou du tuto.

Les réglages qui changent tout

Choisis le niveau de détail, ne le subis pas

Le coût est dominé par les images, puisque chaque image extraite est un jeton visuel. Quatre modes existent :

ModeQuand l'utiliser
transcriptQuelqu'un parle, il ne tape rien. Aucune image extraite.
efficientPremier coup d'oeil sur un long enregistrement d'écran.
balancedLe mode par défaut, quand tu dois lire l'écran.
token-burnerVidéo très mouvementée, où le mode par défaut rate des coupes.

Vise une fenêtre, pas une vidéo

Les deux lecteurs se dégradent de la même façon sur la durée : ils étalent un budget fixe sur toute la longueur. Une lecture dense de six minutes t'apprend beaucoup plus qu'une lecture clairsemée de quarante. Regarde la vidéo en accéléré, note deux horodatages, et donne cette fenêtre aux deux lecteurs.

Le signe qui ne trompe pas : si les deux lectures se contredisent sur presque tout à l'étape 5, ta fenêtre était trop large. Rétrécis-la et relance, plutôt que d'essayer d'arbitrer le désordre.

Trois pièges à connaître

Garde les noms, jette les chiffres.

Un modèle de vision n'a ni horloge ni règle : ses horodatages et ses durées sont des reconstructions, souvent fausses de plusieurs secondes même quand la structure décrite est juste. En revanche il est très bon pour nommer : l'outil à l'écran, l'erreur affichée, la commande exacte. Traite les noms comme des preuves et les nombres comme de la décoration.

Le piège de l'archétype.

Un modèle décrit volontiers ce que ce genre de vidéo contient d'habitude, plutôt que ce que celle-ci montrait. L'étape singulière, celle-là même pour laquelle tu avais gardé la vidéo, est justement celle qui se fait gommer vers la moyenne. C'est toute la raison d'être des étiquettes de l'étape 5.

La fluidité est un signal d'alarme.

Quand une ligne du document se lit plus joliment et plus complètement que celles qui l'entourent, elle vient souvent de la mémoire du modèle et non de la vidéo. Commence tes vérifications par celle-là.

Ce que ça coûte, et ce que ça ne fait pas

Rien n'est payant ici. Le skill de lecture, yt-dlp et ffmpeg sont libres, les sous-titres sont gratuits, le palier gratuit de Gemini couvre largement quelques tutos par jour, et la transcription de secours tourne en local. La seule dépense est l'abonnement à ton agent, que tu paies déjà.

  • Vidéos publiques seulement. Gemini refuse les URL privées ou non répertoriées, et le skill de lecture ne se connecte à aucun compte.
  • Les noms de modèles bougent. C'est pour ça que le script en essaie plusieurs à la suite. Si tout échoue, va voir la liste des modèles disponibles avant de conclure que le script est cassé.
  • La limite honnête : cette méthode produit un très bon premier jet de skill. Pas un skill testé. L'étape 6 existe précisément parce que l'écart entre « le cahier des charges a l'air juste » et « ça tourne » est l'endroit où le travail se termine vraiment.

Sources

Cette méthode est adaptée d'un guide de Jens Heitmann, qui a conçu l'enchaînement des deux lectures et la confrontation étiquetée.

Le skill /watch est l'œuvre de Brad Bonanno, publié en open source sous licence MIT sur github.com/bradautomates/claude-video (plus de 15 000 étoiles). Il s'appuie sur yt-dlp et ffmpeg. skill-creator vient du dépôt anthropics/skills. Ce guide est la méthode construite par-dessus ces outils, il ne les remplace pas.

Les noms de dépôts, la licence, les commandes d'installation et les modes de détail ont été vérifiés directement dans le dépôt de /watch en août 2026. Une précision par rapport au guide d'origine : les quotas gratuits de Gemini sont publiés en nombre de requêtes par jour, pas en heures de vidéo, et ils évoluent. Fie-toi à la page officielle des limites plutôt qu'à un chiffre lu dans un guide, celui-ci compris.

Challenge IA

Lire un guide, c'est bien.
Construire pendant 30 jours, c'est autre chose.

Ce guide t'a donné une méthode. Le problème, c'est qu'on enregistre des astuces IA et qu'on n'en applique aucune. Le Challenge IA, c'est l'inverse : un défi par jour, un système construit par jour, pendant 30 jours. Les inscriptions ouvrent bientôt.

Un challenge par jour

30 jours, 30 systèmes qui tournent pour toi.

Tes propres agents

Prompts et agents à installer pendant que tu construis.

Vidéos et démos réelles

Je construis devant toi, tu refais derrière.

Accès à vie

Ce que tu construis reste à toi, sans limite de temps.

Rejoindre la file d'attente

Gratuit et sans engagement. Les inscrits sont prévenus en premier.

Pour les entreprises

Pas le temps d'apprendre ? On le fait pour toi.

Des solutions IA sur mesure, clés en main, pour automatiser tes process, réduire tes coûts et gagner du temps sur ce qui compte. Agents IA, automatisations, outils internes : on construit, tu récoltes.

15+solutions livrées
40%réduction des coûts
20h+gagnées / semaine
Découvrir nos solutions
Zoe
Mon agent IA

De 0 à 70 000 abonnés en 3 mois. Ne cherche plus jamais quoi poster.

Je l'ai construite pour moi, parce que je perdais mes journées à chercher quoi poster. Zoe surveille les créateurs de ta niche, repère les Reels qui explosent cette semaine, comprend pourquoi ils marchent, et t'écrit le script du tien avec ta manière de parler. Elle tourne toujours sur mon compte tous les jours. Elle est maintenant ouverte à tout le monde.

Elle repère

Les Reels qui font x5 la moyenne du compte qui les a publiés.

Elle explique

Ce qui a marché dans la vidéo, hook par hook.

Elle écrit

Le script prêt à tourner, avec ta manière de parler.

Découvrir Zoe

Sans engagement, résiliable en un clic. Les résultats dépendent de ton travail : Zoe te dit quoi tourner, elle ne tourne pas à ta place.

Agentic eSchool
Accès gratuit

Lis la suite gratuitement

Entre tes infos pour débloquer le guide complet.

Données privées100% gratuitPas de spam
SkillsYouTubeClaude CodeMéthode