Kompresja MP3 polega na
Kompresja MP3 polega na usuwaniu albo bardzo mocnym ograniczaniu tych fragmentów sygnału audio, których człowiek zwykle nie słyszy albo słyszy bardzo słabo. To jest kompresja stratna, oparta na modelu psychoakustycznym, czyli na wiedzy o tym, jak działa ludzkie ucho. Przykład praktyczny: jeśli w nagraniu jest bardzo głośny dźwięk gitary, to cichy szum lub delikatny ton w podobnym zakresie częstotliwości może zostać zamaskowany i dla słuchacza prawie znika. Koder MP3 wykorzystuje takie zjawiska maskowania, dzieli sygnał na pasma częstotliwości i zapisuje mniej danych tam, gdzie strata będzie najmniej zauważalna. Standardowo MP3 to MPEG-1 lub MPEG-2 Audio Layer III. W praktyce dobiera się bitrate, np. 128 kb/s do prostych zastosowań, 192 kb/s jako rozsądny kompromis, a 320 kb/s gdy zależy nam na lepszej jakości. Moim zdaniem najważniejsze jest zapamiętać, że MP3 nie poprawia dźwięku, tylko sprytnie zmniejsza plik kosztem informacji mniej istotnych dla ucha.
W kompresji MP3 łatwo pomylić samo zmniejszanie rozmiaru pliku z dowolną zmianą głośności lub brzmienia, ale to nie o to chodzi. Format MP3 nie usuwa danych najlepiej słyszalnych, bo wtedy nagranie bardzo szybko stałoby się zniekształcone, płaskie i po prostu nieprzyjemne. Najlepiej słyszalne elementy, na przykład główny wokal, wyraźny werbel czy podstawowa linia melodyczna, są właśnie tym, co powinno zostać zachowane możliwie dobrze. Gdyby koder usuwał takie informacje, kompresja byłaby technicznie skuteczna tylko pod względem rozmiaru, ale fatalna pod względem jakości użytkowej.
Nie ma też sensu mówić, że MP3 wzmacnia dane niesłyszalne. Wzmacnianie czegokolwiek zwiększałoby energię lub zmieniało charakter sygnału, a kompresja audio ma głównie ograniczyć liczbę bitów potrzebnych do zapisu. Dane, których człowiek nie rejestruje albo które są przykryte przez inne dźwięki, można pominąć lub zapisać mniej dokładnie. To wynika z psychoakustyki i zjawiska maskowania częstotliwościowego oraz czasowego. Podobnie wyciszanie danych słyszalnych nie opisuje poprawnie działania MP3, bo wyciszenie to operacja na poziomie głośności, a nie zasadniczy mechanizm kodowania stratnego. Typowy błąd myślowy polega na traktowaniu kompresji jak prostego przyciszania albo obcinania dźwięku. W rzeczywistości algorytm analizuje widmo, próg słyszalności i maskowanie, a potem rozdziela bity tak, żeby najmniej zauważalne fragmenty ucierpiały najbardziej. Z mojego doświadczenia najlepiej kojarzyć MP3 z kompromisem: mniejszy plik, wygodne przesyłanie i odtwarzanie, ale kosztem części informacji akustycznej.
Nie ma też sensu mówić, że MP3 wzmacnia dane niesłyszalne. Wzmacnianie czegokolwiek zwiększałoby energię lub zmieniało charakter sygnału, a kompresja audio ma głównie ograniczyć liczbę bitów potrzebnych do zapisu. Dane, których człowiek nie rejestruje albo które są przykryte przez inne dźwięki, można pominąć lub zapisać mniej dokładnie. To wynika z psychoakustyki i zjawiska maskowania częstotliwościowego oraz czasowego. Podobnie wyciszanie danych słyszalnych nie opisuje poprawnie działania MP3, bo wyciszenie to operacja na poziomie głośności, a nie zasadniczy mechanizm kodowania stratnego. Typowy błąd myślowy polega na traktowaniu kompresji jak prostego przyciszania albo obcinania dźwięku. W rzeczywistości algorytm analizuje widmo, próg słyszalności i maskowanie, a potem rozdziela bity tak, żeby najmniej zauważalne fragmenty ucierpiały najbardziej. Z mojego doświadczenia najlepiej kojarzyć MP3 z kompromisem: mniejszy plik, wygodne przesyłanie i odtwarzanie, ale kosztem części informacji akustycznej.