1.2.4 Napisy (na żywo) (ang.) Captions (Live)
Spis treści
Istota i cel kryterium
Głównym założeniem tego kryterium jest bezkompromisowe zapewnienie dostępności dla wszystkich przekazów dźwiękowych realizowanych w czasie rzeczywistym w ramach mediów zsynchronizowanych. Wytyczna ta nakłada obowiązek dostarczania zsynchronizowanego tekstu odzwierciedlającego ścieżkę audio w strumieniach wideo przekazywanych na żywo. Dzięki temu eliminujesz bariery i pozwalasz osobom niesłyszącym lub słabosłyszącym na pełnoprawne śledzenie prezentacji oraz wydarzeń w czasie rzeczywistym.
Napisy w tym kryterium nie ograniczają się wyłącznie do zapisu samych dialogów. Masz obowiązek precyzyjnego identyfikowania osób mówiących oraz notowania istotnych efektów dźwiękowych i innych znaczących odgłosów tła, które budują pełny kontekst przekazu.
Pamiętaj, że termin „na żywo” dotyczy informacji przechwytywanych bezpośrednio z wydarzeń w świecie rzeczywistym i przesyłanych do odbiorcy. Dopuszczalne jest jedynie tak zwane opóźnienie emisyjne ((ang.) broadcast delay) – czyli krótka, automatyczna zwłoka pozwalająca nadawcy na ocenzurowanie lub przygotowanie sygnału, która jednak nie pozwala na jakąkolwiek znaczącą edycję materiału.
Definicja w j. angielskim
Definicja dostępna pod adresem (link otworzy się w nowej karcie):
https://www.w3.org/WAI/WCAG22/quickref/#captions-live
Definicja w j. polskim
Definicja dostępna pod adresem (link otworzy się w nowej karcie):
https://www.w3.org/Translations/WCAG21-pl/#napisy-rozszerzone-na-zywo
Słownik pojęć
- Napisy (na żywo) (ang.) Captions (Live)
-
–
Zsynchronizowana wizualna lub tekstowa alternatywa dla informacji dźwiękowych (zarówno mowy, jak i odgłosów pozatekstowych), niezbędna do pełnego zrozumienia treści multimedialnych na żywo.
- Media zsynchronizowane (ang.) synchronized media
-
–
ścieżka dźwiękowa (audio) lub obraz (wideo) połączone i skoordynowane w czasie z innym formatem prezentacji informacji lub z interaktywnymi komponentami czasowymi. To w praktyce klasyczny materiał wideo z dźwiękiem. Chodzi o sytuację, w której ścieżka audio (np. głos lektora, dialogi) jest ściśle połączona i skoordynowana w czasie z obrazem. To właśnie to połączenie sprawia, że kryterium 1.2.2 staje się aktywne (samo audio bez obrazu nie jest mediami zsynchronizowanymi).
Wpływ na dostępność (Kogo wspierasz?)
- Osoby niesłyszące oraz słabosłyszące: To fundamentalna grupa odbiorców, dla której napisy są jedynym i wzorcowym pomostem do zrozumienia informacji zawartych w ścieżce dźwiękowej w trakcie wydarzeń na żywo. Bez nich tacy użytkownicy zostają całkowicie odcięci od udziału w relacjach w czasie rzeczywistym.
- Osoby w specyficznych warunkach otoczenia: Użytkownicy oglądający transmisję w hałaśliwych miejscach (np. w środkach transportu publicznego) lub w strefach bezwzględnej ciszy (np. w bibliotekach czy biurach typu open space), gdzie odtwarzanie dźwięku jest utrudnione lub zabronione.
- Osoby z zaburzeniami poznawczymi lub przetwarzania słuchowego: Równoległy odbiór bodźców wzrokowych i słuchowych drastycznie odciąża pamięć roboczą, ułatwia zrozumienie skomplikowanych wywodów akademickich oraz dynamicznych, nakładających się na siebie dyskusji.
Zasady wdrażania i wymagania techniczne
Wdróż napisy na żywo, stosując poniższe, surowe reguły techniczne i jakościowe:
- Zaakceptuj różne formy prezentacji napisów: Standard WCAG uznaje za w pełni wystarczające zarówno napisy zamknięte ((ang.) closed captions), które użytkownik może samodzielnie włączać i wyłączać, jak i napisy otwarte ((ang.) open captions), czyli tekst trwale scalony z obrazem wideo, widoczny przez cały czas.
- Zapewnij bezwzględną dokładność i kompletność: Tekst musi wiernie odzwierciedlać słowa mówców. Unikaj rażących pomyłek ortograficznych i gramatycznych. Transkrypcja w czasie rzeczywistym nie może stać się wybiórczym i chaotycznym skrótem myślowym.
- Identyfikuj prelegentów i tło dźwiękowe: Jeśli w relacji bierze udział wielu mówców, jednoznacznie oznaczaj w napisach, kto aktualnie zabiera głos. Opisuj w nawiasach kwadratowych istotne efekty dźwiękowe (np. śmiech publiczności, oklaski, syreny alarmowe).
- Wzbogać opisy transmisji artystycznych i muzycznych: W przypadku transmisji koncertów lub występów muzycznych, profesjonalne usługi wsparcia muszą rejestrować nie tylko tekst piosenek, ale także identyfikować muzykę instrumentalną poprzez podanie tytułu utworu, części, kompozytora oraz wszelkich informacji pomagających pojąć naturę dźwięku.
- Zredukuj opóźnienia do minimum: Zsynchronizuj pojawianie się tekstu z fonią z minimalnym poślizgiem czasowym wynikającym z natury transmisji (optymalnie do 1–2 sekund). Zbyt długi dystans czasowy całkowicie niszczy kontekst i wrażenia użytkownika.
- Wykorzystaj oficjalnie wspierane technologie: Stosuj formaty multimedialne oraz odtwarzacze wideo posiadające natywne wsparcie dla zsynchronizowanych strumieni tekstowych (np. poprzez znaczniki w standardzie SMIL lub nowoczesne technologie strumieniowania napisów w czasie rzeczywistym).
Wybierz właściwą ścieżkę operacyjną do generowania tekstu na żywo:
- Komunikacja CART ((ang.) Communication Access Realtime Translation): Angażuj wykwalifikowanych stenotypistów lub tłumaczy symultanicznych mowy na tekst, co gwarantuje najwyższą dostępną precyzję.
- Systemy ASR z nadzorem ludzkim: Możesz stosować automatyczne rozpoznawanie mowy ((ang.) ASR – Automatic Speech Recognition), pod warunkiem, że proces jest w locie korygowany przez człowieka ((ang.) human-assisted ASR) w celu wyeliminowania krytycznych błędów.
- Scenariusze przygotowane z wyprzedzeniem: Jeśli wydarzenie opiera się na sztywnym i wcześniej spisanym scenariuszu (np. oficjalne przemówienia), dopuszcza się ręczne serwowanie gotowych partii tekstu w rytm wypowiadanych słów.
Wyjątki i sytuacje szczególne
- Dwustronne połączenia multimedialne: Kryterium 1.2.4 zostało stworzone z myślą o szerokopasmowych transmisjach i powszechnych emisjach mediów zsynchronizowanych. Nie ma ono na celu wymuszania, aby każda dwustronna rozmowa wideo lub telekonferencja między dwiema lub kilkoma osobami realizowana za pomocą aplikacji internetowych musiała posiadać napisy na żywo, niezależnie od realnych potrzeb użytkowników.
- Odpowiedzialność za napisy w komunikatorach: W przypadku spotkań online i wideorozmów, odpowiedzialność za dostarczenie ewentualnych napisów spoczywa bezpośrednio na dostawcach treści (osobach dzwoniących) lub na organizatorze ((ang.) host) danego połączenia, a nie na samym twórcy czy dostawcy aplikacji internetowej.
Przykłady implementacji
Najczęstsze błędy
Oficjalna dokumentacja W3C dedykowana wytycznej 1.2.4 nie definiuje powiązanych bezpośrednio, skodyfikowanych błędów technicznych (takich jak np. F44 czy F85). W praktyce audytorskiej najpoważniejszymi uchybieniami są jednak:
- Absolutny brak jakichkolwiek napisów: Całkowite zignorowanie ścieżki tekstowej w transmisji wideo na żywo, co bezwzględnie odcina i wyklucza osoby niesłyszące.
- Ślepe zaufanie do surowych systemów ASR: Publikowanie automatycznych napisów generowanych przez algorytmy bez nadzoru i korekty ludzkiej. Skutkuje to masą błędów, które tworzą chaotyczny i całkowicie losowy przekaz.
- Zaniechanie identyfikacji muzyki w transmisjach artystycznych: Pomijanie kluczowych danych o tytule, kompozytorze czy charakterze partii instrumentalnych podczas relacjonowania koncertów lub oper na żywo.
- Dopuszczanie do drastycznych przesunięć czasowych: Wyświetlanie tekstu z potężnym opóźnieniem w stosunku do wypowiadanych słów, co kompletnie niszczy synchronizację i dezorientuje odbiorcę.
- Ukrywanie napisów za elementami interfejsu lub kadru: Wadliwe pozycjonowanie warstwy tekstowej, przez co napisy zlewają się z grafiką lub są zasłaniane przez domyślne kontrolki odtwarzacza bądź istotne elementy wizualne.
- Ignorowanie efektów dźwiękowych i tożsamości mówców: Pomijanie w napisach informacji o tym, kto aktualnie zabiera głos oraz ignorowanie istotnych odgłosów tła (np. alarmów, śmiechu publiczności), co pozbawia odbiorcę kluczowego kontekstu sytuacyjnego.
Najlepsze praktyki
- Zastosuj usługi tłumaczenia tekstu w czasie rzeczywistym: Jeśli Twoje wydarzenie na żywo gromadzi międzynarodową społeczność, wykorzystaj systemy dynamicznego tłumaczenia symultanicznego napisów ((ang.) real-time text translation service) na inne języki ludzkie.
- Zapewnij wyrazistość bez kompromisów (Akustyka): Zadbaj o bezbłędną jakość dźwięku u źródła – stosuj profesjonalne mikrofony i eliminuj szumy otoczenia, co znacząco ułatwi pracę tłumaczom CART oraz algorytmom wspomagającym.
- Udostępniaj zweryfikowane materiały post-facto: Po zakończeniu emisji na żywo niezwłocznie przekształć napisy w idealnie dopracowany plik napisów zamkniętych dla wersji archiwalnej lub opublikuj pełną transkrypcję tekstową wydarzenia.
- Przeprowadzaj próby generalne: Testuj stabilność strumieniowania napisów oraz ich czytelność na różnych ekranach na długo przed oficjalnym rozpoczęciem transmisji.
Metody testowania
- Testowanie manualne (Audyt bez dźwięku): Wyłącz całkowicie głośniki oraz słuchawki w trakcie trwania przekazu w czasie rzeczywistym. Sprawdź, czy jesteś w stanie bezbłędnie zidentyfikować każdego z mówców, zrozumieć dynamikę akcji i zarejestrować kluczowe odgłosy tła wyłącznie na podstawie renderowanych napisów.
- Narzędzie deweloperskie (ang.) Developer Tools: Uruchom inspekcję kodu w przeglądarce podczas trwania emisji na żywo, aby zweryfikować, czy strumień tekstu jest przesyłany w sposób uporządkowany oraz czy elementy strukturalne odtwarzacza poprawnie obsługują napisy otwarte bądź zamknięte.
- (ang.) WCAG Color contrast checker: Dokonaj weryfikacji kontrastu napisów. Upewnij się, że tekst zachowuje bezpieczny i wyraźny kontrast względem tła, szczególnie gdy napisy są wyświetlane bezpośrednio na dynamicznie zmieniającym się obrazie wideo.
Sprawdź swoją wiedzę
W linku poniżej znajduje się 5 modułów symulujących strumienie wideo w czasie rzeczywistym. Twoim zadaniem jest ocenić, czy każdy wariant dostarcza osobom niesłyszącym prawidłowe napisy na żywo lub czy legalnie korzysta z wyjątków w ramach wytycznej WCAG.
Jak to sprawdzić?
- Wycisz dźwięk i spróbuj zrozumieć pełny kontekst wyłącznie z napisów.
- Zwróć uwagę na jakość i kompletność: czy widzisz kto mówi (identyfikacja mówców)? Czy opisywane są ważne dźwięki tła (np. muzyka)?
- Oceń wiarygodność tekstu: czy nie roi się od błędów gramatycznych typowych dla maszynowych generatorów ASR?
- Włącz dźwięk i obserwuj synchronizację. Dopuszcza się naturalne, krótkie opóźnienie emisyjne, ale nie drastyczne przesunięcia.
- Rozpoznaj format: czy dane wideo podlega pod transmisję multimedialną do odbiorców, czy jest wyjątkiem?
Notatka: Zanim zajrzysz do rozwiązania, przetestuj i zapisz swoje wnioski na kartce.
Proponowane narzędzia: Wyciszenie dźwięku, Narzędzie deweloperskie (ang.) Developer Tools
Link: https://pdc.ambiscale.com/training/wcag-1-2-4/
#1 BŁĄD
Problem: Transmisja na żywo nie zawiera żadnej zsynchronizowanej ścieżki tekstowej (w odtwarzaczu brak opcji CC, w kodzie brak znacznika <track>).
Dlaczego: To najpoważniejsze uchybienie. Odbiorcy niesłyszący i słabosłyszący zostają całkowicie odcięci od informacji przekazywanych podczas wydarzenia. Późniejsze dodanie napisów po nagraniu nie ratuje sytuacji dla osób chcących uczestniczyć w transmisji na żywo.
Naprawa: Zapewnij zsynchronizowane napisy (otwarte lub zamknięte) używając np. komunikacji CART lub wspomaganego komputerowo rozpoznawania mowy (ASR) z ludzką korektą w czasie rzeczywistym.
#2 DOBRZE
Dlaczego: Zastosowano napisy najwyższej jakości (CART lub profesjonalne ASR pod nadzorem człowieka), które perfekcyjnie odzwierciedlają wymogi WCAG 1.2.4:
- Identyfikacja mówców: Napisy jasno określają, kto aktualnie zabiera głos („[Prowadzący]:”).
- Efekty dźwiękowe: W nawiasach kwadratowych zawarto istotne dźwięki z tła (np. „[Intro muzyczne…]”), pozwalając osobom niesłyszącym na odbiór tego samego nastroju i kontekstu co osoby słyszące.
- Precyzja: Tekst jest wolny od rażących błędów i wiernie oddaje to, co słychać w transmisji, zachowując minimalne dopuszczalne opóźnienie emisyjne.
#3 BŁĄD
Problem: Zastosowano surowe, niekorygowane przez człowieka napisy generowane automatycznie (ASR).
Dlaczego: Ślepe zaufanie do surowych systemów ASR skutkuje lawiną błędów (np. „docinku”, „kryteria per cepcji”), brakiem interpunkcji i całkowitym pominięciem kluczowych dźwięków i identyfikatorów mówców. Przekaz taki jest chaotyczny, niezrozumiały i nie spełnia wymogu „pełnoprawnego śledzenia wydarzenia”.
Naprawa: Systemy automatycznego rozpoznawania mowy mogą być stosowane wyłącznie wtedy, gdy proces jest „w locie” korygowany przez człowieka (human-assisted ASR) w celu natychmiastowej eliminacji błędów algorytmu.
#4 BŁĄD
Problem: Napisy są drastycznie opóźnione w stosunku do warstwy dźwiękowej (poślizg ~7 sekund).
Dlaczego: Choć termin „na żywo” dopuszcza naturalne, krótkie opóźnienie emisyjne (zazwyczaj do 1-2 sekund wynikające z pracy tłumacza/systemu), to drastyczne przesunięcia czasowe całkowicie niszczą synchronizację tekstu z obrazem. Odbiorca widzi napisy dotyczące akcji, która dawno już minęła, co prowadzi do dezorientacji.
Naprawa: Optymalizuj infrastrukturę strumieniowania i pracę tłumaczy/systemów ASR tak, by napisy podążały za mową z najmniejszym możliwym poślizgiem.
#5 DOBRZE
Dlaczego: To połączenie 1:1, czyli prywatna, dwustronna rozmowa wideo. Kryterium 1.2.4 ma zastosowanie przede wszystkim do transmisji (broadcast) i nie wymusza odgórnie, by każda dwustronna komunikacja (np. spotkanie zespołu na MS Teams/Zoom) musiała od strony dostawcy aplikacji natywnie wymuszać i posiadać włączone napisy na żywo (odpowiedzialność leży tu na organizatorze, a nie na samej stronie internetowej). Jest to poprawny wyjątek, w którym nagranie to nie narusza wytycznej 1.2.4.
Źródła
- Abou-Zahra S., Eggert E., Vanderheiden G. [i in.] (red.), „1.1.1 Non-text Content Level A”, [w:] Web Content Accessibility Guidelines (WCAG) 2.2 Quick Reference, 2025, https://www.w3.org/WAI/WCAG22/quickref/#captions-live [dostęp: 3.07.2026].
- Accessibility Guidelines Working Group Participants, „Understanding SC 1.2.4 Captions (Live) (Level AA)”, [w:] WCAG 2.2 Understanding Docs, 2026, https://www.w3.org/WAI/WCAG22/Understanding/captions-live.html [dostęp: 3.07.2026].
- World Wide Web Consortium (W3C), „Kryterium sukcesu 1.2.4 Napisy rozszerzone (na żywo)”, [w:] Web Content Accessibility Guidelines (WCAG) 2.1, tłum. Fundacja Instytut Rozwoju Regionalnego, 2021, https://www.w3.org/Translations/WCAG21-pl/#napisy-rozszerzone-na-zywo [dostęp: 3.07.2026].
- DOCK sp. z o.o., WCAG 1.2.4: Napisy (na żywo), https://wcag.dock.codes/pl/dokumentacja/kryteria-sukcesu-wcag/wcag-124/ [dostęp: 3.07.2026].
Dodatkowe linki
- W3C WCAG:
- Dokładna definicja: https://www.w3.org/WAI/WCAG22/quickref/#captions-live
- Zrozumienie podpunktu: https://www.w3.org/WAI/WCAG22/Understanding/captions-live.html