Een VTT-bestand (Web Video Text Tracks-bestand) is een platte-tekstindeling die wordt gebruikt om getimede tekst – zoals ondertitels, bijschriften en hoofdstukmarkeringen – weer te geven, gesynchroniseerd met HTML5-video- en audio-inhoud. Ontwikkeld als een W3C-webstandaard, VTT-bestanden bieden geavanceerde functies zoals tekstopmaak, sprekersidentificatie en nauwkeurige positionering, waardoor ze het voorkeursformaat zijn voor webvideo’s.
VTT-bestanden hebben een specifieke structuur die door browsers en videospelers kan worden geïnterpreteerd. Elk VTT-bestand bevat de volgende kernonderdelen:
Here’s what a basic VTT file looks like:
WEBVTT
00:00:01.000 –> 00:00:04.500
Welcome to today’s presentation
over aanbevolen werkwijzen voor transcriptie.
00:00:05.000 –> 00:00:08.750
We’ll cover everything you need
meer te weten komen over ondertitelingsformaten.
Let erop dat VTT-tijdstempels punten gebruiken vóór de milliseconden (00:00:01.000), terwijl SRT-bestanden komma’s gebruiken. Dit kleine verschil is van belang: als je het verkeerde scheidingsteken gebruikt, werken je ondertitels niet meer.
Wat VTT onderscheidt van eenvoudigere formaten, is de ondersteuning voor uitgebreide opmaak:
Dankzij deze mogelijkheden zijn VTT-bestanden bijzonder waardevol voor toegankelijke webcontent waarbij de vormgeving en de verstaanbaarheid van de spreker het begrip bevorderen.
VTT-bestanden bestaan uit platte tekst, dus je hebt verschillende mogelijkheden om ze te bekijken en te bewerken:
Teksteditors: Any basic text editor (Notepad, TextEdit, VS Code) can open VTT files. You’ll see the raw text and timestamps, making it easy to make quick corrections.
Mediaspelers: VLC en de meeste moderne videospelers geven VTT-ondertitels weer als het bestand dezelfde naam heeft als je videobestand. Zet beide bestanden gewoon in dezelfde map.
Webbrowsers: Aangezien VTT het standaard HTML5-formaat voor ondertitels is, geven browsers deze bestanden naadloos weer met het
Ondertitelingsredacteuren: Met speciale tools kun je de video synchroon met de ondertiteling afspelen, zodat je de timing kunt aanpassen terwijl je de video bekijkt.
Er zijn twee manieren om VTT-bestanden aan te maken:
Handmatig aanmaken: Open a text editor, add the “WEBVTT” header, then write your cues with accurate timestamps. This approach works for short clips but becomes impractical for longer content—a one-hour video might contain hundreds of individual caption entries.
Geautomatiseerde generatie: Software voor transcriptie analyseert je audio of video en genereert automatisch VTT-bestanden met tijdcodes. Moderne AI-transcriptie zorgt voor de identificatie van sprekers en bereikt een hoge nauwkeurigheid, waardoor dit de standaardaanpak is voor professionals die grote hoeveelheden videomateriaal beheren. Platforms zoals Sonix automatische transcriptie combineren met het genereren van VTT-bestanden, waarbij zowel de identificatie van sprekers als de tijdcodering tegelijkertijd worden afgehandeld.
Voor tv-productiebedrijven, advocatenkantoren die getuigenverklaringen verwerken of onderwijsinstellingen die collegebibliotheken van ondertitels voorzien, zorgt de geautomatiseerde generatie van VTT ervoor dat wat vroeger dagen werk kostte, nu in een gestroomlijnde workflow wordt omgezet.
Despite VTT’s technical advantages, you’ll often need both formats. Major social platforms like LinkedIn and X (Twitter) only accept SRT files, while your website’s HTML5 player requires VTT.
De conversie zelf is eenvoudig; de belangrijkste verschillen zijn:
VTT-formaat:
SRT-formaat:
In plaats van handmatig afzonderlijke bestanden bij te houden, geautomatiseerde ondertitelingstools kan beide formaten vanuit één enkel brontekstbestand exporteren. Dit zorgt voor consistentie op alle platforms en voorkomt dubbel werk.
Zelfs de beste geautomatiseerde ondertitels zijn gebaat bij een controle door een mens. Let bij het bewerken van VTT-bestanden vooral op:
Aanpassingen aan de timing: Zorg ervoor dat ondertitels iets voordat de woorden worden uitgesproken verschijnen en kort daarna weer verdwijnen. Zorg ervoor dat leessnelheid van bijschriften blijft onder de 160-180 woorden per minuut, zodat het prettig te lezen is.
Tekstnauwkeurigheid: One wrong word can change meaning entirely—”now” becoming “not” reverses the message. Review auto-generated captions against the actual audio.
Luidsprekerlabels: Bij interviews, getuigenverklaringen of paneldiscussies zorgt een duidelijke aanduiding van de spreker ervoor dat kijkers het gesprek beter kunnen volgen.
Regeleinden: Houd elk bijschrift beperkt tot maximaal twee regels met ongeveer 42 tekens per regel, zodat het op alle apparaten goed leesbaar is.
Bij professionele workflows wordt vaak gebruikgemaakt van browsergebaseerde editors die de ondertiteltekst synchroniseren met de videoweergave, waardoor je tijdens het bekijken timingproblemen kunt opsporen en correcties kunt aanbrengen.
VTT-bestanden vervullen twee steeds belangrijkere functies die verder gaan dan het standaard ondertitelen:
Naleving toegankelijkheid: De WCAG-richtlijnen recommend captions for video content, and regulations like the ADA and Section 508 require them in many contexts. The European Accessibility Act, with a compliance deadline of June 28, 2025, mandates accessible videos for EU e-commerce. VTT’s support for descriptive audio and detailed speaker identification helps meet these requirements.
Zichtbaarheid in zoekresultaten: Search engines can’t watch your videos, but they can read your caption files. With video being increasingly prominent in search results, VTT files make your spoken content discoverable. For researchers analyzing interview footage, legal teams searching deposition archives, or marketers maximizing content reach, VTT files transform video from a sealed box into searchable, indexable text.
VTT-bestanden ondersteunen tekstopmaak, positionering, sprekerslabels en CSS-aanpassingen, terwijl SRT-bestanden alleen platte tekst met tijdstempels bevatten. VTT gebruikt punten voor milliseconden (00:00:01.000) en SRT gebruikt komma’s (00:00:01,000). VTT is de web-native standaard voor HTML5-video; SRT biedt bredere compatibiliteit met oudere systemen.
Yes. The core conversion involves changing comma separators to periods and adding the “WEBVTT” header. Many transcription platforms export both formats simultaneously, eliminating manual conversion.
Absolutely. Search engines index caption text, making your video’s spoken content searchable. Videos with captions tend to rank better and appear more frequently in search results because the content becomes readable by crawlers.
Alle grote browsers – Chrome, Firefox, Safari en Edge – ondersteunen VTT-bestanden al sinds 2015. Het formaat werkt via het HTML5-element
Add a <track> element inside your <video> tag pointing to your VTT file: <track src=”captions.vtt” kind=”subtitles” srclang=”en” label=”English”>. Viewers can then toggle captions using the player’s built-in controls.
Comprehensive data compiled from extensive research on podcast transcription market growth, AI adoption, and content…
We hebben het Yanny vs Laurel audiobestand door Sonix AI engine gehaald en hier is...
Automated transcription is the process of converting spoken audio or video content into written text…
Sprekeridentificatie is een door AI aangestuurd proces dat automatisch verschillende sprekers in audio-opnames identificeert en labelt…
Zoom-transcriptie is het proces waarbij gesproken inhoud uit Zoom-vergaderingen wordt omgezet in geschreven tekst,…
Sonix has built the world's first AudioText Editor™ and it now works seamlessly with Adobe…
Deze website maakt gebruik van cookies.