Aller au contenu

Comment Garfunkel analyse une vidéo

Collez un lien et Garfunkel transforme la vidéo en rapport structuré : ce qui est dit, ce qui est montré, le hook, les mêmes tags pour chaque post et, si vous le demandez, les réactions des internautes. Voici les étapes, dans l’ordre.

Copie cette page au format Markdown, prête à être collée dans un assistant IA.

  1. Étape 01 sur 08

    Récupérer le post

    Nous ouvrons le lien et récupérons la vidéo ainsi que les informations affichées par la plateforme : la légende, le nom du créateur et le nombre de vues, de mentions J’aime, de commentaires et de partages. Ces chiffres sont conservés tels qu’ils sont indiqués, pour que vous puissiez ensuite trier et comparer les posts. Le fichier vidéo est conservé uniquement le temps de son traitement, puis supprimé une fois l’analyse terminée.

    Récupérer le postUn lien vidéo devient une fiche de post avec sa miniature, son créateur, sa légende et le nombre de vues, de J’aime et de commentaires.Lien…/video/1842@creator1.2M84K1.1K
  2. Étape 02 sur 08

    Séparer le son et l’image

    Nous vérifions si la vidéo contient une piste audio, puis séparons le son de l’image pour les examiner chacun de leur côté. Le son est transcrit et l’image est échantillonnée pour sélectionner des images clés. Les deux sont réunis à l’étape du résumé du post.

    Séparer le son et l’imageLa vidéo est séparée en deux éléments : une pellicule d’images et une forme d’onde sonore.VidéoImageAudio
  3. Étape 03 sur 08

    Transcrire l’audio

    Un modèle de reconnaissance vocale transcrit tout ce qui est dit dans la vidéo et ajoute un horodatage à chaque ligne. Vous pouvez ainsi voir ce qui a été dit et à quel moment. Une vidéo avec des paroles n’est jamais analysée sans transcription : si cette étape échoue, nous la relançons au lieu de la passer. Un post dont l’analyse échoue ne vous est jamais facturé.

    Modèle : Qwen3-ASR-0.6B · un modèle de reconnaissance vocale open source

    À voir dans l’onglet Transcription d’un résultat

    Transcrire l’audioUne forme d’onde devient trois lignes de transcription, chacune avec un horodatage.0:000:030:07Transcription0:00
    Alors, voici l’astuce…
    0:03
    faites d’abord chauffer la poêle,
    0:07
    puis ajoutez l’huile.
  4. Étape 04 sur 08

    Choisir les images clés

    Un algorithme échantillonne les images pour en réduire le nombre tout en préservant le sens général de la vidéo. Le modèle d’IA examine les images retenues avec la transcription dans les étapes suivantes.

    Choisir les images clésUne longue série d’images presque identiques est réduite à quelques images qui montrent chacune quelque chose de différent.Toutes les imagesImages sélectionnées
  5. Étape 05 sur 08

    Résumer le post

    Un modèle d’IA lit la transcription et la légende tout en examinant les images clés. Il comprend ainsi le post dans son ensemble, plutôt qu’élément par élément. Il rédige un résumé court et décrit le déroulement de l’histoire, moment par moment, en reliant chaque étape à un instant de la vidéo.

    Modèle : gpt-6.1-sol · lit ensemble la transcription et les images échantillonnées

    Résumer le postLes lignes de transcription et les images alimentent une fiche récapitulative qui présente les étapes de l’histoire dans l’ordre, avec leurs horodatages.Transcription0:000:030:07ImagesRésuméDéroulé de l’histoire0:00
    Présente l’astuce
    0:04
    Fait d’abord chauffer la poêle
    0:09
    Montre le résultat
  6. Étape 06 sur 08

    Repérer le hook

    Le modèle examine les premières secondes pour identifier le hook : les mots ou l’image qui captent l’attention, le type de hook et le moment où il se produit. Il relève aussi la promesse faite au public, la façon dont la vidéo y répond et les raisons de son efficacité.

    Modèle : gpt-6.1-sol · le même modèle et la même analyse que pour le résumé

    À voir dans la carte Hook d’un résultat

    Repérer le hookUne chronologie des premières secondes met en évidence la séquence d’accroche, son type et la citation, ainsi que la promesse, le résultat et les raisons de son efficacité.Premières secondes0:000:010:020:030:04Démonstration
    “Alors, voici l’astuce…”
    PromesseFaire frire sans que les aliments accrochent à la poêle.
    RésultatÀ la fin, les aliments glissent facilement hors de la poêle.
    Pourquoi ça marcheMontre la méthode au lieu de la décrire.
  7. Étape 07 sur 08

    Attribuer les tags et analyser le post

    À partir du résumé, de la transcription et des images clés, le modèle attribue à chaque post les mêmes tags : format, thème, émotion, ton, personnes et marques, lieux, objets, montage et références culturelles ou aux mèmes. Les principaux tags sont vérifiés pour assurer leur cohérence. Chaque post reçoit les mêmes tags, ce qui vous permet de comparer deux posts côte à côte.

    Modèle : gpt-6-luna · attribue les tags et vérifie les références culturelles et aux mèmes

    À voir dans les tags d’un résultat

    Attribuer les tags et analyser le postUne fiche de synthèse alimente une grille de neuf tags : format, thème, émotion, ton, personnes et marques, lieux, objets, montage et culture.Résumé
    FormatTutoriel
    ThèmeCuisine et boissons
    ÉmotionJoie
    TonLudique
    Personnes et marquesUne personne à l’écran
    LieuxCuisine à la maison
    ObjetsPoêle, huile
    MontageCoupes franches
    CultureSon tendance
  8. Étape 08 sur 08

    Analyser les commentaires

    Si vous demandez l’analyse des commentaires, nous les récupérons et le modèle les lit un par un dans le contexte du post : sa légende, son résumé et sa transcription. Il évalue ainsi les réactions en tenant compte de ce que la vidéo dit et montre réellement. Le rapport indique qui est d’accord, qui s’y oppose, quelles questions sont posées et ce que les gens ont apprécié.

    Modèle : gpt-6-luna · lit chaque commentaire en tenant compte du post

    Ajouter les commentaires à un résultat

    Analyser les commentairesTrois commentaires, classés selon qu’ils approuvent, contestent ou posent une question, au-dessus d’une barre qui montre les avis.
    Enfin quelqu’un qui explique ça correctement.Approuve
    Pourtant, ça ne marche pas comme ça.Conteste
    Où avez-vous trouvé cette poêle ?Pose une question
    Positionnement des personnes

Comment le contexte s’enrichit à chaque étape

Chaque étape s’appuie sur la précédente. Les suivantes ne travaillent donc jamais uniquement à partir de la vidéo brute. Voici ce que chacune analyse.

  1. 01TranscriptionAnalyseLa bande-son
  2. 02Résumé et accrocheAnalyseLa transcription, la légende et des images sélectionnées dans la vidéo
  3. 03TagsAnalyseLe résumé, la transcription, la légende et des images sélectionnées dans la vidéo
  4. 04Analyse des commentairesAnalyseLes commentaires, la légende, le résumé et la transcription

La même structure pour chaque post

Chaque post est converti en données structurées selon un schéma fixe : les mêmes champs, dans le même format, pour chaque post. Les résultats sont ainsi cohérents et comparables, faciles à trier et à filtrer, et prêts à être exportés vers un tableur, l’API ou MCP.

{
  "format": "Tutorial",
  "theme": "Food & drink",
  "emotion": ["Joy"],
  "tone": ["Playful"],
  "hook": { "type": "Demonstration", "start": 0.0, "end": 2.0, "text": "So here’s the trick…" },
  "tags": ["home kitchen", "pan", "jump cuts"],
  "transcript": [{ "start": 0.0, "end": 2.4, "text": "So here’s the trick…" }],
  "comments": { "agree": 52, "push_back": 14, "questions": 18 }
}

Les noms de champs présentés ici sont donnés à titre d’exemple ; la documentation indique les noms utilisés en réalité.

Ce que vous obtenez

  • Un résumé et le déroulé de l’histoire
  • Une transcription horodatée
  • L’accroche : sa nature, le moment où elle apparaît et pourquoi elle fonctionne
  • Les mêmes tags pour tous les posts
  • Une analyse des commentaires, si vous la demandez
  • Une recherche par sens : trouvez des posts selon leur sujet, pas seulement selon les mots qu’ils contiennent
  • Des exports vers des tableurs, l’API et MCP

Le fichier vidéo est supprimé une fois l’analyse terminée.