Narsil č. 45

MPEG

↑

MPEG je datový standard pro ukládání a přenos pohyblivých obrazů synchronně se zvukem, který je vytvářen v rámci mezinárodní organizace pro standardizaci (ISO) pracovní kupinou Motion Picture Expert Group.

MPEG-1

První verze byla uveřejněna po pětiletém vývoji v roce 1992. Tento standard je v podstatě digitální podoba video přehrávače. Soubory v MPEG-1 lze přehrávat pouze lineárně, jako běžné CD. Existují však modifikace standardu MPEG-1, které umožňují streaming.

Datový tok CD mechanik v době návrhu nepřesahoval 1,5 MB/s a proto bylo nutno dosáhnout komresní poměr minimálně 1 ku 150 (pro normu PAL).

Ke kompresi dochází už při digitalizaci video signálu. Lidské oko rozlišuje lépe změny jasové složky obrazu než barvy. Proto je barevný obrázek kódován barevným modelem YCbCr, který odděluje jasový (Y) a barvonosný (CbCr) signál. Tento model využívá další standard ISO: JPEG (Joint Photographics Expert Group).

JPEG používá pru ukládání statických obrázků ztrátovou kompresi, která sestává z následujících kroků:

1. Převod obrazu do modelu YCbCr dle vzorkovacího formátu 4:2:0 (bloku 2x2 jasových vzorků přiřadí jeden vzorek barvonosný)

2. Obraz se rozdělí na čtvercové bloky 8x8 pixelů

3. Každý blok se komprimuje pomocí diskrétní kosinové tramsformace, jejíž koeficienty jsou kvantizovány (kvantizace určuje kvalitu ztrátové komprese)

4. posloupnosti koeficientů jsou uspořádány a dále komprimovány Huffmanovým kódem v kombinaci s Run Lenght)

Formát MPEG obsahuje stejný postup, ale navíc přidává další kroky. Vzhledem k vzorkování barev 4:2:0 je obraz rozdělen na makro-bloky 16x16 (čtyři sousední bloky 8x8). MPEG interpretuje následující obrázek (který se liší od předchozího) jako posun jednotlivých makrobloků v obrázku předchozím. Kódují se tedy pouze změny - rozdíly v pozicích jednotlivých makrobloků. Obraz zakódovaný jako rozdíl od předchozích se označuje P (prediction), obrázek který je pro rozdílové kódování referenční (kódovaný v podstatě jako normální JPEG) se označuje I (intra frame). Kombinací I a P lze signál komprimovat zhruba na polovinu. Větší komprimace se dosahuje tzv. obousměrným kódováním - zprůměrováním změn mezi obrázky I a P. Mezi I a P se tedy vloží další obrázky označované B (bi-directional). Počet snímků I v posloupnosti všech snímků určuje rychlost přístupu ke změnám v původním video signálu. Počet snímků P a B ovlivňuje kvalitu MPEG komprese.

Každý druh snímku je samostatně komprimován obdobnou metodou jako JPEG. Nejhorší kompresi mají I snímky, nejlepší B snímky. Nejvýhodnější by tedy bylo vztvořit co nejvíc B snímků. Z praktických důvodů jsou ale snímky kódovány v přesně definovaných posloupnostech s periodou 12 snímků tak, aby se každé 0,4 sekundy objevil jeden I snímek:

I/B/B/P/B/B/P/B/B/P/B/B/I ...

Protože k zobrazení B snímků je nutné znát snímek P, není při přenosu (zápisu) dat do souboru dodrženo výše uvedené pořadí. Zápis tedy vypadá takto:

I/P/B/B/P/B ...

Zvuk u MPEG-1 je komprimován pomocí lineárního kvantování se vzorkovací frekvencí 48 kHz (max. 348 kb/s) v jednom nebo ve dvou kanálech.

Díky nízkému rozlišení MPEG-1 a vysoké citlivosti lidského oka k ostrým hranám jsou makro bloky (čtverečky) v obraze viditelné. Problémy vznikají při dodržení stálého datového toku. Pokud se při rozdílovém kódování nedosáhne požadovaného datového toku, je obraz degradován až do příchodu prvního snímku typu I. Hledání makro-bloků pro rozdílovou kompresi je náročný úkol. Místa střihu (totální změna obrazu) by měla být kódována pomocí I snímků a místa s prolínáním pomocí snímků B.

MPEG-2

Standard z roku 1995. Rozšiřuje MPEG-1 o vlastnosti, které umožňují jeho použití v TV průmyslu.

V profesionálním prostředí je požadován datový tok 15 Mb/s (80 Mb/s u HDTV s poměrem stran obrazu 16:9) pro digitální TV přenos. MPEG-2 zpracovává TV obraz s prokládaným řádkováním. Lze volit mez vzorkovacími formáty barev 4:2:2, 4:2:0 a 4:4:4. Oproti MPEG-1 je zdokonaleno prediktivní kódování (obrázky P), kvantování koeficientů a několik dalších věcí. MPEG-2 má rozšířené zvukové možnosti: lze použít až 24 bit. vzorkování (96 kHz) v osmi nezávislých kanálech (max. 6144 kb/s) a lze volit metodu kvantování.

MPEG-2 je navržen pro ukládání kvalitního videa (DVD), ale i pro satelitní TV přenos. Proto se standard zabývá také ochranou signálu (enkrypce). Princip rozdílového kódování tůstává i u MPEG-2 stejný jako u MPEG-1 a tudíž i zde jsou viditelné čtverečky.

M-JPEG

Samostatný formát pro střih videa. Je to v podstatě záznam videa jen pomocí snímků typu I (JPEG).

MPEG-4

Níže přikládám v plném znění článek Jiřího Žáry "Nejmladší z rodu empegů", který vyšel v Chipu č. 3/2001.

MPEG-7

Dokončení tohoto formátu se plánuje na konec roku 2001. Má se zabývat vyhledáváním obrázků, animací a videa (plus zvuk) dle zadaných kritérií.

výše uvedený text zpracoval J. Suchánek dle článku "Kolik je vlastně MPEGů?" z Pixelu 38 (2/2000)

----------------------------------------------------

MPEG-4

Nejmladší z rodu "empegů"

Zkratka MPEG je všeobecně známa jako označení kvalitní metody pro kódování videosekvencí. MPEG verze 1 je určena pro informační technologie, verze 2 pro přenos televizního signálu. Verze 4, která se objevila v minulém roce, přináší zcela zásadní změny v možnostech kódování obrazu a zvuku.

Jak vzniká televizní obraz

Mezinárodní normy MPEG-1 a MPEG-2 jsou považovány za jedny z nejúspěšnějších normalizačních počinů v celé historii organizace ISO. Byly vytvořeny skupinou expertů MPEG (Motion Picture Experts Group) a velmi rychle přijaty průmyslem. Lze říci, že si bez nich současnou informační a televizní technologii již nedokážeme představit. Norma MPEG-1 je určena pro uchovávání obrazových a doprovodných zvukových informací na paměťové médium. Typicky jde o zápis filmů a animací na disk, CD-ROM a další média. Norma MPEG-2 pak slouží k efektivnímu kódování a přenosu filmového a televizního signálu. Právě televizní technika se stala hybným motorem vývoje norem MPEG a výrazně ovlivňuje směřování dalšího normalizačního úsilí.

Je třeba zdůraznit, že televizní vysílání se podstatným způsobem liší od běžného přehrávání filmů. V moderních televizních studiích je výsledný vysílaný signál vytvářen smícháním mnoha rozličných informací, zejména v tzv. virtuálních studiích. Příkladem užití virtuálního studia je předpověď počasí, při níž se skutečný hlasatel pohybuje ve speciální místnosti umožňující vhodnou filtrací barvy získat pouze obraz jeho postavy. Ta je dále kombinována s pozadím, na němž se odehrává zobrazení meteorologických informací ů typicky z počítače. Celý obraz může být doplněn textovými informacemi ů titulky a dalšími nápisy. V některých případech je do výsledného obrazu ještě přidán malý obrázek překladatele do znakové řeči. Všechny tyto dílčí informace se zkombinují do jediné posloupnosti televizních snímků, která putuje dále k (satelitnímu) vysílači. Po dekompresi se generuje signál televizních snímků předávaný do televizorů diváků.

Základním předpokladem při kódování obrazu (videa) v normách MPEG-1 a MPEG-2 je skutečnost, že vysílaný signál je strukturován na samostatné obrazy, zvané snímky či půlsnímky. Pod snímkem si můžeme představit obdélníkové pole barevných bodů, jejichž množství odpovídá rozměrům obrazu v dané televizní normě. Snímek nemá vnitřní strukturu, pouze je komprimován metodou založenou na normě JPEG. Pro zvýšení efektivity se ještě před kompresí snímky předzpracovávají, a to jak odečtením dvou po sobě jdoucích snímků, tak zavedením tzv. vektorů pohybu, s jejichž pomocí lze odhadnout posuny jednotlivých bodů v dalším snímku.

Existují tři druhy předzpracovaných snímků (s označením I, B a P), které se po kompresi a zakódování řadí do lineární posloupnosti. Členové skupiny MPEG však zjistili, že přenos posloupnosti obrazů není pro televizní technologii obecně správná cesta. Jednotlivé složky (např. popředí, pozadí, titulky apod.) se totiž míchají do každého obrazu, ačkoliv jejich samostatné kódování by bylo mnohem jednodušší a úspornější. Budoucí interaktivní televize pak navíc bude vyžadovat identifikaci jednotlivých logických částí obrazu, která není z přenášených smíchaných snímků zpětně proveditelná. Skupina MPEG proto vytvořila novou normu, MPEG-4, která byla publikována koncem roku 1999 pod označením ISO/IEC 14496 ů Information technology ů Coding of audio-visual objects. Číslo čtyři v pracovním názvu MPEG-4 přitom naznačuje, že od předchozích dvou norem došlo k výraznému logickému skoku, a zároveň zajišťuje, že si lidé tuto normu nebudou plést s oblíbeným kódováním hudby MP3. To je mimochodem také produktem expertů MPEG ů představuje vlastně samostatný zvukový kanál odebraný z kódu MPEG-1.

Co zvládne MPEG-4

Na rozdíl od "snímkového" přístupu norem MPEG-1 a MPEG-2 představuje koncepce MPEG-4 zásadní změnu. Obraz a zvuk nejsou kombinovány před přenosem, ale jsou přenášeny v mnoha dílčích, multiplexovaných bitových tocích. Velký objem práce je převeden na přijímací a prezentační část procesu. Zatímco v předchozích normách bylo jediným úkolem koncového dekodéru zpracovat jednotlivé snímky a postupně je prezentovat uživateli, nyní musí dekodér provést úplné vytvoření a smíchání obrazové a zvukové scény, tj. to, co dosud běžně provádějí zařízení v televizním studiu. Tento přístup využívání výkonu na straně uživatele se objevuje v informačních technologiích stále častěji ů připomeňme například prezentaci dokumentů WWW, při níž se k uživateli přenášejí pouze popisné informace, z nichž internetové prohlížeče vytvářejí stránky s nadpisy, odstavci, tabulkami, formuláři apod.

Bitové toky, které se v terminologii MPEG-4 nazývají elementární toky, přitom mohou přenášet jakoukoliv informaci, která má vztah k výslednému obrazu. Každý druh informace pak lze komprimovat takovou metodou, která je pro něj nejvhodnější. Jinak se tedy kódují textové údaje, jinak statické obrazy, sekvence pohyblivých obrazů, obecné zvuky, řeč atd. Další samostatný tok obsahuje (hierarchický) popis scény, tj. způsob, jakým jsou jednotlivé elementární informace skládány do výsledné prezentace. Také tento tok je komprimován vhodným binárním kódováním. Podívejme se nyní, jaké rozmanité informace lze v rámci MPEG-4 kódovat a přenášet:

Obecný zvuk

Pro kódování zvuku se používají úsporné metody zápisu převzaté z předchozích norem MPEG, tj. především kódování známé pod označením MP3. Navíc lze zapisovat i syntetizovaný zvuk vytvořený jednak ze vzorků různých hudebních nástrojů, jednak z notového zápisu konkrétní skladby. Pro tyto účely se používají zvláštní jazyky pro popis orchestrů a partitur.

ŕeč

Při použití syntetizované řeči lze nejprve přenést knihovnu tzv. fonémů (zvuků vyslovovaných písmen, jejich dvoj- či trojpísmenných kombinací a dalších akustických projevů, jako jsou např. smích či zakašlání), a poté velmi úsporně kódovat řeč složenou pouze z těchto fonémů.

Zvukové operátory

Jednotlivé toky zvuků a řeči lze zpracovávat pomocí zvukových operátorů, které si můžeme představit jako virtuální směšovací pult v nahrávacím studiu. V něm se k základním zvukovým zdrojům přidávají různé efekty jako je zpoždění, změna hlasitosti (útlum), přehrávání ve smyčce, změna rychlosti apod. Zvukové operátory a zdroje zvuku jsou uspořádány do grafu v podobě stromu.

Statický obraz

Nejčastěji se statické obrazy využívají jako pozadí, přes které je umístěn děj probíhající v popředí. Další možností je použití statických obrazů v podobě ikon na popředí, které slouží k interaktivním zásahům do scény (děje). V případě trojrozměrné scény se statické obrazy stávají texturami, které se mapují na povrch trojrozměrných objektů. K jejich kódování lze využít řady metod.

Oblíbeným způsobem je kódování JPEG, nově je zavedena tzv. vlnková transformace (wavelet). Ta převádí dvojrozměrný rastrový obraz na množinu koeficientů pro dvojici speciálních, navzájem korespondujících matematických funkcí. Tyto funkce lze vyhodnocovat opakovaně v rekurzivním tvaru a uspořádat tak výsledné koeficienty do hierarchické struktury. Při dekódování je obraz získán velmi rychle v hrubém rozlišení a v případě potřeby zjemněn do požadovaného detailu. Tento postup lze aplikovat lokálně a detailně vykreslit jen část obrazu podle potřeby. S výhodou se této metody zápisu obrazu použije u textur, které na vzdálených či malých objektech zabírají jen malou část obrazovky.

Pohyblivý obraz (film, video)

Původní schopnost norem MPEG přenášet posloupnost snímků reprezentujících filmový či televizní záznam je pochopitelně zachována. Jednotlivé snímky lze přitom kódovat jak metodou JPEG, tak dalšími způsoby, tedy například také pomocí vlnkových transformací.

Dvojrozměrná (2D) grafika

Jakmile je obraz reprezentován polem barevných bodů (rastrem), nelze provádět některé úpravy bez ztráty informace nebo zkreslení. Rastrový obraz lze například jen velmi obtížně postupně otáčet o malý úhel. Lepší je tedy uchovávat popis obrazu složený z geometrických prvků, s nimiž je manipulace snazší. Výsledný obraz vznikne převedením geometrických prvků do rastru, přičemž velikost rastru může být zcela libovolná. Tímto způsobem pracuje například známý editor obrázků CorelDRAW. Norma MPEG-4 umožňuje popsat obraz pomocí mnoha různých objektů, z nichž mezi nejčastěji používané patří lomená čára složená z úseček, Bézierova křivka, kružnice, obdélník, obecný mnohoúhelník. Objektům lze přiřadit barvu nebo vzorek pro výplň. Jednotlivé objekty je možno sdružovat do skupin, aplikovat na ně afinní transformace a definovat vzájemné překrývání na principu vrstev.

Text

Přestože text bývá v počítačových aplikacích chápán jako součást 2D grafiky, při použití v televizním vysílání mívá navíc zvláštní funkci v podobě titulků. Norma MPEG-4 dovoluje vysílat paralelně několik titulků v různých jazycích. Jejich volba, případně úplné potlačení, je záležitostí dekodéru uživatele. Lze si tak představit společné vysílání signálu ze satelitu, které je přijímáno v různých jazykových oblastech a kombinováno s příslušnými titulky.

Trojrozměrná (3D) grafika

Vzhledem k tomu, že scéna v televizním studiu je svým charakterem trojrozměrná, není nic překvapivého na tom, že norma MPEG-4 umožňuje kódovat a přenášet data popisující trojrozměrné objekty. Zde skupina MPEG využila existence normy VRML pro popis virtuální reality a přijala ji jako základní prostředek pro modelování prostorové scény v normě MPEG-4. Původní textové kódování jazyka VRML zde bylo obohaceno o úsporné binární kódování vhodné k přenosu v rámci elementárního toku MPEG. Praktickým příkladem využití trojrozměrného modelu je globus ve virtuálním studiu předpovědi počasí. Koule, která jej reprezentuje, se pochopitelně může otáčet.

Animace obličeje

Podobně, jako se při přenosu řeči snižuje objem dat rozkladem hlasu na fonémy a jejich opětným složením v plynulou řeč, lze animovat obličej mluvícího člověka. Namísto nepřetržitého vysílání pohledu na hlasatele lze přenést nejprve pouze několik základních pohledů na jeho tvář (čelní pohled, profil), vytvořit prostorový model jeho hlavy a dále měnit vzhled jeho obličeje na základě několika desítek tzv. vizémů (obdoba fonémů ve vizuální oblasti). Každý vizém určuje pohyb určitých částí obličeje, například otevření úst při vyslovení písmene "O", zvednutí koutků při úsměvu, zvednutí obočí při údivu apod. Samotná norma již obsahuje čtrnáct základních vizémů pro typické fonémy, jako jsou samohlásky, retnice apod.

Lidský obličej je přitom charakterizován množinou řídicích bodů. Transformacemi těchto bodů se obličej animuje tak, aby jeho vzhled odpovídal s ním synchronizované (syntetické) řeči. Některé body lze měnit samostatně, jiné se transformují vždy ve skupině s dalšími body. Je zřejmé, že tento přístup vyžaduje náročné výpočty jak při získávání modelu hlavy konkrétního člověka, tak při výsledné animaci tohoto trojrozměrného modelu kombinovaného s texturou.

Popis scény

Veškeré elementární toky MPEG jsou v koncovém dekodéru skládány do prezentace, která zahrnuje složku zvuků, 2D i 3D objektů. Časoprostorové vztahy mezi všemi těmito druhy informací lze definovat pomocí hierarchického popisu v podobě stromové struktury. Tento popis audiovizuální scény slouží i pro případnou interakci. Ta může zahrnovat nejen volbu titulků v určitém jazyce nebo zapnutí či vypnutí zobrazení doprovodných trojrozměrných předmětů, ale i postupy, které byly až dosud ve spojení s televizním vysíláním nepředstavitelné. Mezi metody, které nás překvapí asi nejvíce, patří sledování trojrozměrné scény z několika pohledů podle přání uživatele. Pokud jsou totiž vysílány informace z několika kamer současně, není problém si vybrat libovolnou z nich. Je-li pak televizní studio zcela virtuální tedy v paměti počítače, lze na pojem kamera zapomenout zcela a pohybovat se ve studiu bez omezení, pochopitelně také pouze virtuálně v paměti lokálního uživatelského výpočetního systému.

Závěr

Norma MPEG-4 představuje revoluční změnu v pojímání obrazu a zvuku, který je přenášen z televizních satelitů nebo ze sítě internet k uživatelům. Data kódovaná v normě MPEG-4 mohou obsahovat jak video posloupnosti z předchozích norem MPEG, tak velmi bohaté a strukturované informace použitelné pro interaktivní televizi a trojrozměrnou grafiku a virtuální realitu. Přestože se škála zpracovávaných informací výrazně rozšířila, použití specializovaných algoritmů přineslo naopak snížení objemu přenášených dat. Norma MPEG-4 byla okamžitě přijata odbornou veřejností. Firma Microsoft již distribuuje prohlížeče multimediálních souborů kódovaných v normě MPEG-4, pracuje se na realizaci hardwarových dekodérů a kodérů pro profesionální účely. Skupina expertů MPEG tak vytvořila další normu řadící se mezi nejhodnotnější produkty organizace ISO.

Zájemci o MPEG-4 mohou získat plné znění normy v Českém normalizačním institutu. První, hlavní část normy byla přeložena do češtiny pod označením ČSN ISO/IEC 14496-1 Informační technologie ů Kódování audiovizuálních objektů ů Část 1: Systémy. Dalších šest specializovaných částí je k dispozici v angličtině. Zajímavá je pátá část, která obsahuje vzorovou implementaci kodérů a dekodérů normy MPEG-4 v jazyce C. Programátoři tak mohou použít nástroje, které sice nejsou optimální z hlediska využití paměti či času, ale jsou schopny rozpoznat, zda uživatelská data splňují požadavky normy.

Jiří Žára

infotipy:

www.mpeg.org

Odkazy a základní informace o všech normách MPEG.

www.cselt.it/mpeg/

Oficiální stránka skupiny MPEG, která obsahuje především technické údaje. Hlavou tohoto sdružení více než dvou set expertů z celého světa je obdivuhodný italský profesor Leonardo Chiariglione.

www.csni.cz

Narsil MPEG – obrázek 1

Český normalizační institut umožňuje na svých stránkách nejen vyhledat informace o českých a mezinárodních normách, ale také si je objednat.