
Если вы хоть раз экспортировали трек из аудиоредактора, копались в настройках звуковой карты или писали код, который что-нибудь проигрывает, вы видели число 44 100. Оно стоит по умолчанию почти везде, в конфиге его набираешь на автомате, как пин-код от своей карты, и вопросов оно обычно не вызывает, потому что объяснение к нему все помнят еще со времен лабораторных по цифровой обработке сигналов.
Я тоже много лет жила с этим объяснением и считала вопрос закрытым, пока не попробовала пересказать его вслух и не споткнулась на последнем шаге: откуда взялись именно эти сто герц сверху? Почему не ровно 44 000, почему не 45 000, почему не 48 000, как у студийного видео? Спойлер для тех, кто не любит интригу, уже вынесен в заголовок, а остальным предлагаю пройти тот же путь, что прошла я, от учебника через подозрительную арифметику к телевизионной развертке, которая до сих пор сидит в каждом компакт-диске и в огромной части музыки на стримингах.
Что говорит учебник
Классическое объяснение выглядит так: теорема Котельникова (она же теорема Найквиста–Шеннона для остального мира) говорит, что сигнал с полосой до F можно восстановить без потерь, если брать отсчеты чаще, чем 2F раз в секунду. Человек слышит примерно до 20 кГц, и то в молодости и при хорошем раскладе, значит, частота дискретизации должна быть больше 40 кГц.
Дальше учебник вспоминает, что перед АЦП нужен фильтр, который вырежет все выше половины частоты дискретизации, иначе оно завернется обратно в слышимый диапазон в виде алиасинга. Идеального фильтра, который пропускает 20 000 Гц и полностью давит 20 001 Гц, в природе нет, поэтому между полосой пропускания и частотой Найквиста нужен зазор, в котором фильтр успеет спуститься с нуля децибел до уровня шума. При 44 100 Гц частота Найквиста равна 22 050 Гц, зазор получается 2 050 Гц, то есть около десяти процентов от полосы, и на этом месте учебник с чувством выполненного долга обычно заканчивается.
Но если присмотреться, это рассуждение дает только нижнюю границу: больше 40 кГц и с каким-нибудь запасом. Под него одинаково хорошо подходят 44 000, 44 800, 45 000 или 46 000, и ничего в нем не объясняет, почему запас должен быть ровно 2 050 Гц. Фильтр с зазором в 2 000 Гц ничем принципиально не отличается от фильтра с зазором в 2 050, зато число 44 000 и записывать, и запоминать гораздо приятнее. Значит, кто-то просто ткнул пальцем в небо у лишних ста герц должна быть отдельная причина, и я пошла ее искать.
Подозрительно круглое число
Первое, что я сделала, это разложила 44 100 на простые множители (ну а что еще делать с подозрительным числом, правда?). Получилось вот что:
И это очень красивый результат, потому что перед нами квадрат произведения первых четырех простых чисел. У такого числа 81 делитель, оно делится на все от 1 до 10, кроме восьмерки, и в голову сразу лезет гипотеза, что инженеры выбирали частоту ради удобной делимости: на таймеры, на тактовые генераторы, на кратные частоты для передискретизации.
Я потратила на эту версию какое-то время и в итоге от нее отказалась. Делимость на 49 ничего полезного электронике не дает, а делимость на 8 и 16, которая как раз пригодилась бы двоичным делителям частоты, у 44 100 отсутствует. Кроме того, если бы кто-то подбирал число ради удобства, он бы в первую очередь позаботился о дружбе с соседними стандартами, а 44 100 относится к 48 000 как 147 к 160, и ресемплинг между ними до сих пор требует довольно неприятной арифметики.
Так что гипотеза про изящную делимость отправилась в корзину, но само разложение я запомнила. Семерка в квадрате выглядит как отпечаток пальца: где-то в исходных данных, из которых получилось это число, сидит 49 или что-то кратное ему, и если найти это место, найдется и ответ.
Video Killed the Radio Star
Чтобы понять, откуда в стандарте берутся конкретные числа, полезно представить, в какой обстановке его придумывали. Конец семидесятых, звук уже умеют оцифровывать с приличным качеством, но цифру совершенно негде хранить. Посчитаем, сколько данных дает стерео с параметрами CD:
Это примерно 176 килобайт в секунду, 10,6 мегабайта в минуту и около 635 мегабайт в час, причем без коррекции ошибок, которую в реальном носителе придется добавить сверху. Жесткие диски того времени, насколько я понимаю, были шкафами, которые стояли в машинных залах и стоили соответственно, так что держать на них часы музыки никто всерьез не планировал.
Обычный магнитофон тоже не спасает, потому что аналоговая звуковая дорожка рассчитана на полосу порядка 20 кГц, а 16-битному PCM-потоку нужна аналоговая полоса около 1–1,5 МГц, то есть в пятьдесят с лишним раз больше. Можно пойти в лоб, гнать ленту быстрее, сузить зазор головок и размазать данные по куче параллельных дорожек, и такие цифровые магнитофоны со стационарной головкой действительно появились, но это была дорогая студийная техника.
И тут японские инженеры посмотрели по сторонам и заметили, что у них уже есть массовое, дешевое и хорошо отлаженное устройство, которое пишет на ленту сигнал с полосой в несколько мегагерц, причем вращающимися головками, которые как раз решают проблему скорости. Это видеомагнитофон, и нужно всего лишь убедить его, что ему подают телевизионную картинку.
Так появились PCM-адаптеры. Представьте, да, коробку, которая берет цифровой звук, раскладывает биты по строкам телевизионного кадра в виде черных и белых точек, добавляет строчные и кадровые синхроимпульсы и отдает на выход самый обычный видеосигнал. Видеомагнитофон пишет его как кино, а при воспроизведении адаптер ловит строки, считывает из них точки и собирает звук обратно. Если вывести такую запись на телевизор, на экране будет дрожащая черно-белая шахматка, похожая на помехи, внутри которой на самом деле едет музыка.
У Sony первым таким устройством стал PCM-1 в 1977 году, в 1979 появился студийный PCM-1600, который работал в паре со специально доработанными видеомагнитофонами U-matic, а в начале восьмидесятых вышел PCM-F1, подключавшийся к домашнему Betamax. Кстати, доработки у студийных U-matic были очень показательные: в них отключали обработку цветности и компенсатор выпадений, которые рассчитаны на картинку и только портили бы данные, и переносили момент переключения видеоголовок в кадровый гасящий интервал, чтобы грязь от переключения не попадала на строки со звуком.
Считаем строки
Теперь самое интригующее, и для него придется вспомнить устройство телевизионного кадра. Кадр состоит из строк, и развертка рисует их через одну: сначала нечетные, потом четные, и каждая такая половина кадра называется полем. В американском NTSC в кадре 525 строк и 30 кадров в секунду, то есть 60 полей по 262,5 строки. В европейском PAL 625 строк и 25 кадров, то есть 50 полей по 312,5 строки.
Записать звук на все строки поля нельзя, потому что часть из них занята кадровым гасящим интервалом с синхроимпульсами, а заодно туда же, как мы помним, переехало переключение видеоголовок. В формате, который описан еще в заметке Мартина Уиллкокса в JAES за июль 1978 года, из поля NTSC под данные берут 245 строк, из поля PAL 294, и в каждую строку кладут по три отсчета на канал, то есть шесть слов на стерео плюс слова коррекции ошибок и контрольную сумму CRC. Смотрим:
Система |
Полей в секунду |
Строк в поле |
Строк с данными |
Отсчетов на канал в строке |
Частота, Гц |
|---|---|---|---|---|---|
NTSC (черно-белый) |
60 |
262,5 |
245 |
3 |
44 100 |
PAL |
50 |
312,5 |
294 |
3 |
44 100 |
60 × 245 = 14 700 строк в секунду, и 50 × 294 тоже дает 14 700 строк в секунду. Обе системы отдают под звук ровно одинаковое число строк в секунду, и после умножения на три отсчета получается одна и та же частота, 44 100 Гц, которая одинаково ложится и на американскую, и на европейскую видеотехнику. Одна частота на весь мир, одна и та же запись, которую можно сделать в Токио и смонтировать в Лондоне, и именно ради этого число строк подбирали так хитро.
Но давайте все-таки вернемся к отпечатку пальца. 245 = 5 × 7², 60 = 2² × 3 × 5, и вместе с тройкой отсчетов получается 2² × 3² × 5² × 7², ровно тот набор множителей, который меня так впечатлил. С PAL то же самое: 294 = 2 × 3 × 7², 50 = 2 × 5², плюс тройка, и снова те же самые квадраты. Красивое 210² оказалось побочным эффектом телевизионной арифметики, а семерка в квадрате приехала к нам из числа строк.
Но расивое совпадение еще не доказательство, поэтому мне захотелось проверить, насколько вообще уникально число 44 100 в этой системе ограничений. Если частота должна одинаково получаться в обоих стандартах целым числом строк, то вариантов на самом деле немного, и их проще перебрать, чем придумывать. Я написала десяток строк на питоне:
# ищем частоты, которые одинаково получаются в NTSC (60 полей) и PAL (50 полей) for k in range(1, 6): # отсчетов на канал в одной строке for n in range(1, 263): # строк с данными в поле NTSC (всего 262,5) rate = 60 * n * k if rate % (50 * k): # в PAL должно выйти целое число строк continue p = rate // (50 * k) # строк с данными в поле PAL (всего 312,5) if p <= 312 and 40_000 <= rate <= 50_000: print(f"k={k} NTSC {n:3d} стр. PAL {p:3d} стр. -> {rate} Гц")
И вот что он выдал:
k=3 NTSC 225 стр. PAL 270 стр. -> 40500 Гц k=3 NTSC 230 стр. PAL 276 стр. -> 41400 Гц k=3 NTSC 235 стр. PAL 282 стр. -> 42300 Гц k=3 NTSC 240 стр. PAL 288 стр. -> 43200 Гц k=3 NTSC 245 стр. PAL 294 стр. -> 44100 Гц k=3 NTSC 250 стр. PAL 300 стр. -> 45000 Гц k=3 NTSC 255 стр. PAL 306 стр. -> 45900 Гц k=3 NTSC 260 стр. PAL 312 стр. -> 46800 Гц k=4 NTSC 170 стр. PAL 204 стр. -> 40800 Гц k=4 NTSC 175 стр. PAL 210 стр. -> 42000 Гц k=4 NTSC 180 стр. PAL 216 стр. -> 43200 Гц k=4 NTSC 185 стр. PAL 222 стр. -> 44400 Гц k=4 NTSC 190 стр. PAL 228 стр. -> 45600 Гц k=4 NTSC 195 стр. PAL 234 стр. -> 46800 Гц k=4 NTSC 200 стр. PAL 240 стр. -> 48000 Гц k=4 NTSC 205 стр. PAL 246 стр. -> 49200 Гц k=5 NTSC 135 стр. PAL 162 стр. -> 40500 Гц k=5 NTSC 140 стр. PAL 168 стр. -> 42000 Гц k=5 NTSC 145 стр. PAL 174 стр. -> 43500 Гц k=5 NTSC 150 стр. PAL 180 стр. -> 45000 Гц k=5 NTSC 155 стр. PAL 186 стр. -> 46500 Гц k=5 NTSC 160 стр. PAL 192 стр. -> 48000 Гц k=5 NTSC 165 стр. PAL 198 стр. -> 49500 Гц
С одним или двумя отсчетами на строку в выдаче пусто, потому что строк в поле просто не хватает, чтобы набрать 40 кГц. Начиная с трех отсчетов варианты появляются, и при k = 3 они идут ровно с шагом 900 Гц, поскольку наименьшее общее кратное 60 и 50 полей равно 300, а 300 × 3 = 900. Этот же разбор, кстати, есть и в английской википедии про PCM-адаптеры, так что мой перебор просто сошелся с ним по всем восьми строкам.
Дальше работает простая логика: чем больше отсчетов в строке, тем меньше места достается каждому из них, а значит, тем меньше бит на отсчет и хуже коррекция ошибок. На практике места и при трех отсчетах было впритык: бытовые адаптеры предлагали выбор между 14 битами с нормальной защитой от выпадений ленты и 16 битами, у которых защиты почти не оставалось. Поэтому k = 3 минимально возможное значение, и к четырем отсчетам никто переходить не хотел, хотя при k = 4 и 200 строках, как видите, получилось бы даже 48 000 Гц.
Внутри k = 3 нижние варианты сжимают переходную полосу фильтра: при 43 200 Гц зазор между 20 кГц и частотой Найквиста был бы всего 1 600 Гц. Верхние варианты съедают строки гасящего интервала: при 45 000 Гц на синхронизацию и переключение головок осталось бы по 12,5 строки на поле, а при 44 100 их остается 17,5 в NTSC и 18,5 в PAL. Выходит, что 44 100 Гц оказалась самой высокой частотой из тех, что еще оставляли видеомагнитофону запас строк на служебные нужды, и никакой другой причины у лишних ста герц нет.
59,94 оттенка серого
Внимательный читатель мог заметить, что в таблице выше NTSC подписан как черно-белый, и это сделано нарочно. Когда в пятидесятых американское телевидение становилось цветным, частоту полей чуть-чуть уменьшили, ровно в 1,001 раза, чтобы поднесущая цветности не создавала биений со звуковой несущей (про то, почему именно так, я оставлю для отдельной статьи). С тех пор цветной NTSC живет на 59,94 поля в секунду, и если подставить это в нашу формулу, получится вот что:
Это и есть та самая частота 44,056 кГц, которую можно встретить в описаниях старой техники. Большинство PCM-адаптеров писали 44,1 кГц для PAL и монохромного NTSC и 44,056 кГц для цветного, так что у японских и американских владельцев бытовых адаптеров записи получались на 0,1% медленнее, чем у европейских.
Разница крошечная, и я посчитала, во что она обходится, если просто проиграть запись на чужой частоте. Скорость меняется в 1,001 раза, высота тона сдвигается на 1200 × log₂(1,001) ≈ 1,7 цента, а час музыки становится короче примерно на 3,6 секунды. Услышать сдвиг в 1,7 цента не сможет, по-моему, вообще никто, и в профессиональной прессе прямо писали, что для каких-то задач записи на одной частоте можно воспроизводить на другой. Но для мастеринга CD так жить нельзя, и студийные видеомагнитофоны под PCM-адаптеры гоняли в режиме 525 строк на ровно 60 полей, то есть в честном черно-белом NTSC образца до 1953 года, где 60 × 245 × 3 дает ровные 44 100.
Получается забавная картина: в студиях начала восьмидесятых стояли профессиональные видеомагнитофоны, у которых специально выключали цвет и возвращали черно-белую развертку, и все ради того, чтобы на них можно было записывать музыку.
Как кассета попала на диск
Осталось понять, как частота студийной видеотехники стала частотой потребительского диска, и тут лучше всего послушать участника событий. Кес Имминк из Philips входил в совместную рабочую группу Sony и Philips и в 2007 году подробно описал ее работу в статье Shannon, Beethoven, and the Compact Disc для IEEE Information Theory Society Newsletter. Союз двух компаний оформили в октябре 1979 года, инженеры встречались попеременно в Токио и Эйндховене, и на третьей встрече, 20 декабря 1979 года, каждая сторона записала свои пожелания к будущему диску:
Параметр |
Philips |
Sony |
|---|---|---|
Частота дискретизации, кГц |
44,0–44,5 |
44,1 |
Разрядность, бит |
14 |
16 |
Время звучания, мин |
60 |
60 |
Диаметр, мм |
115 |
100 |
Забавно, что у Philips в графе частоты стоит целый диапазон, у Sony конкретное число, и уже по этому видно, у кого в руках была работающая студийная цепочка. Имминк пишет, что в 1978 году каждый производитель цифровой аудиотехники выбирал свою частоту где-то между 32 и 50 кГц, так что никакого общего стандарта не существовало. Зато надежный способ записать мастер и доставить его на завод существовал ровно один, через PCM-адаптер и видеокассету, поэтому, по его словам, выбирать группе пришлось между 44,1 и 44,056 кГц при разрядности до 16 бит. На четвертой встрече в Токио, 18 и 19 марта 1980 года, Philips согласилась и на 16 бит, и на 44,1 кГц.
И вот моя любимая деталь. Почему из двух видеочастот оставили 44,1, если 44,056 была ничем не хуже? Имминк пишет, что причина была одна: 44,1 проще запомнить. Помните, в начале я ворчала, что 44 000 запоминать было бы приятнее? Удобство запоминания тут действительно сыграло роль, просто выбирать приходилось между двумя видеочастотами, и в такой паре 44,1 выигрывает без вариантов.
С битами вышло похоже, и Имминк прямо признает, что желание Philips получить 14 бит держалось только на том, что у компании уже был готовый 14-битный ЦАП. Выкрутились в Эйндховене красиво: в первых проигрывателях Philips этот самый ЦАП работал с четырехкратной передискретизацией и выдавал качество, сопоставимое с 16 битами.
В итоге, как формулирует Имминк, звук компакт-диска повторил звук адаптера PCM-1600, потому что логистически другого выбора не было. Студия писала звук через PCM-1600 (а позже через PCM-1610 и PCM-1630) на кассету U-matic, монтировала на тех же видеомагнитофонах с помощью специального контроллера, и готовую кассету отправляли на завод, где с нее резали стеклянный мастер-диск. До девяностых видеокассета оставалась единственным способом доставить цифровой звук из студии на производство дисков, и только потом ее сменили ленты Exabyte и болванки CD-R. Любая другая частота на диске означала бы пересчет частоты дискретизации на каждом заводе, а преобразование частоты в реальном времени в начале восьмидесятых, насколько я понимаю, требовало отдельной дорогой железки, которую никто не горел желанием ставить в цепочку.
Остаться должен только один
В цифровом звуке по идее должна была остаться одна частота, но остались две, и вторая, 48 кГц, живет по соседству с первой до сих пор. Ее любят видео и вещание, и причина опять в кадрах: 48 000 делится на 25 и на 50 без остатка, в кадр PAL помещается ровно 1 920 отсчетов, а в цветном NTSC набегает 1 601,6 отсчета на кадр, которые за пять кадров складываются в целые 8 008. Мой скрипт, кстати, нашел 48 000 и среди видеочастот, при четырех отсчетах на строку и 200 строках в поле NTSC, однако PCM-адаптеры так не делали, и происхождение у 48 кГц свое, вещательное.
В результате профессиональный звук для видео живет на 48 кГц, музыку по традиции, заложенной компакт-диском, до сих пор массово мастерят в 44,1, а ваш компьютер, стоит только включить ролик поверх плейлиста, почти наверняка пересчитывает одно в другое. Где-то в системном микшере в этот момент крутится ресемплер с тем самым неудобным отношением 147 к 160, и все потому, что в 1979 году у Sony был работающий PCM-1600 с черно-белым видеомагнитофоном, а у остальных не было.
Напоследок одна деталь из той же статьи Имминка, которая добила меня окончательно. Про 74 минуты компакт-диска обычно рассказывают красивую историю о Девятой симфонии Бетховена в исполнении Фуртвенглера, которая должна была поместиться на один диск целиком. Имминк к этой истории относится скептически и объясняет диаметр 120 мм тем, что у Philips уже был готов завод под 115-миллиметровые диски, и Sony не хотела отдавать конкуренту такую фору, однако меня заинтересовало другое. Теоретически диск вмещал 74 минуты 33 секунды, но на практике предел задавала все та же кассета U-matic, на которую помещалось только 72 минуты, поэтому та самая запись Фуртвенглера вышла целиком на одном компакт-диске лишь в 1988 году, когда у студий появились другие носители для мастеров.
Комментарии (50)

Radisto
30.09.2026 10:33Срыв покровов)))))
А есть еще такого?

MainEl Автор
30.09.2026 10:33Покровы старые, но пыль с них стряхнула))

a3d
30.09.2026 10:33Зачем по чти во всех современных видеохостингах и стандартных рипах видео аудиодорожки почти всегда 48000 Гц? По логики нафиг это не надо даже 44100 много, хватило бы 44000 даже с запасом на златоухих которые до 19кГц слышат ;)
п.с. Ой, сори дочитал, та же проблема с делением на частоту кадров.
... хотя самый популярный формат ютуба и в целом цифрового видео это 30 и 60 fps, а самые популярные форматы кино это 24 fps, и тогда с 48000 опять возникают вопросы.

ssj100
30.09.2026 10:33По логики нафиг это не надо даже 44100 много, хватило бы 44000
Все упирается в размер зада римской лошади.

ganzmavag
30.09.2026 10:33Интересно почему сейчас на стримингах уже не выпускать бы 48 кГц для новых записей. И ещё интересно, насколько этот ресемплинг 147 к 160 влияет на качество звука, особенно насколько он влиял на ранних схемах. На фото, например, очень заметны такие преобразования разрешения.

voldemar_d
30.09.2026 10:33насколько этот ресемплинг 147 к 160 влияет на качество звука
Ресэмплинг можно делать с разным качеством - и так, что будут слышны искажения, и так, что их не будет слышно. Вопрос не совсем корректно поставлен.

evtomax
30.09.2026 10:33Многие и выпускают в 48 кГц. Но по-хорошему надо, чтобы стриминги умели выдавать всю музыку хоть в 44100, хоть в 48000 в зависимости от того, на какой частоте работает ЦАП устройства.
Если ресемплинг делать с высоким качеством, то влияние на звучание ничтожно, но при этом есть ощутимая нагрузка на процессор. Обычно в реальном времени используется компромиссный вариант, из-за которого качество заметно портится.
С фото другая ситуация. Если глаз различает отдельные пиксели, то сами границы между пикселями добавляют типа чёткости, если детали изображения привязаны к пиксельной сетке. А вот если пиксели неразличимы, то дробное масштабирование на чёткость никак не повлияет.

voldemar_d
30.09.2026 10:33но при этом есть ощутимая нагрузка на процессор. Обычно в реальном времени используется компромиссный вариант, из-за которого качество заметно портится.
Это общие слова. Качественный ресэмплинг можно реализовать так, что он даже на процессоре Pentium с частотой 100 МГц будет работать в реальном времени без слышимых артефактов - например, с помощью полифазных фильтров. Я такими задачами ещё лет 25 назад занимался.

ailcat
30.09.2026 10:33Проще переключить ЦАП на нужную частоту (что доступно в большинстве ЦАПов еще с нулевых, если не раньше). Благо что переключаться между двумя тактовыми генераторами научились многие десятилетия назад.
И в итоге единственная реальная причина для ресемплинга - это адаптация CD-звука для зомбоящиков (например, чтоб подложить фоновую музыку в паузах "говорящих голов"). И вычислительная мощь для этого будет стоить на порядки больше, чем второй тактовый генератор.
И пусть даже переключение займет пару секунд (на ребут DSP) или даже потребует от пользователя щелкнуть физическим переключателем - двух- и более кратная разница в цене сделает выбор подавляющего большинства покупателей очевидным :)

Antohin
30.09.2026 10:33Браво! Это настолько многогранная история -- как из разных областей науки, так и ситуативных решений бизнеса(и шоубизнеса в том числе), что читается просто как детектив!
Вместо инженерной байки про корреляцию дюз и крупа лошади всегда теперь буду рассказывать эту историю! Тем более, что в отличии от ракетной истории ни разу ни байка!

CAHbKA_IV
30.09.2026 10:33Осталось ещё развеять миф о связи нашего скрепного вершка и юнита в серверной стойке.

Antohin
30.09.2026 10:33А вот всё что выше (и ниже - не туда ткнул) было, это вообще что? Ок, мой комментарий мог восприняться как нейрослопный, но зачем тогда его комментировать? Тем более таким образом.
Объяснюсь: поскольку автор девушка, то хотелось ответить галантно (что видимо сейчас синоним нейрослопа)

Hlad
30.09.2026 10:33Пфф. Хотите узнать, как параметры вашего айфона привязаны к урожайности зерновых в Древнем Риме?

Antohin
30.09.2026 10:33Теперь всем комментаторам выше по моей ветке:
Дабы развеять миф об искусственности комментария сразу доложу: Вас в интернет не ходило, когда на “Удаве”(*) взрослые люди оттачивали лексику. На дваче и на фочане возможно тренировали ваши реплики. *Ресурс, запрещенный к посещению людьми с хрупкой организацией психики
БАШ вообще читали? Комментарий про вершка и юнита в стойке был бы забавен в абсурдном контексте, но тут-то он зачем, как и все остальные комментарии?

Loco2k
30.09.2026 10:33емнип, исторически частота шла от 8кгц, дальше 16,24,32 и т.д.
48 получается из них более простым преобразованием. Это важно для работы со старыми записями. Ну и 48 лучше в плане борьбы с шумами квантования (ещё лучше 96)

remirran
30.09.2026 10:33Хабр - торт. Когда-то искал ответ на этот вопрос, но при отсутствии источников подумал, что это инженерный компромисс. Теперь жалею что так рано сдался. Такое приятное знание. Спасибо!

voldemar_d
30.09.2026 10:33Хабр - торт, но Вы пробовали поиск? Там выдается и готовый краткий ответ от ИИ, и куча ссылок на статьи, в которых примерно то же самое написано. Но я ничуть не умаляю достоинств этой статьи.

iskatel
30.09.2026 10:33первые CD плеера, чаще всего, работали без передискретизации и цифрового фильтра, просто выдавали звук на 44100 и потом аналоговый пост-фильтр высоких порядков.
Да, это убивало (и по сей день так) детальность на высоких и (в мЕньшей степени) средних частотах, но в те времена так было дешевле. Сейчас, кстати, NOS (без передискретизации и ЦФ) ЦАП-ы тоже делают, для ценителей "чего-то такого, чтобы звук был не как у всех" .
А самые недорогие (не забываем, что в первые годы CD-эры даже недорогие модели были дороже относительно аналоговой техники того же класса) ещё и имели 1 1-канальный ЦАП на 2 канала, который попеременно выдавал отсчёты то в 1й канал, то во 2й.

voldemar_d
30.09.2026 10:33это убивало (и по сей день так) детальность на высоких и (в мЕньшей степени) средних частотах
А можно подробнее - почему такой подход "убивает детальность" на высоких и средних частотах? Казалось бы - просто восстановление аналога из цифры, зачем здесь передискретизация? Может, где-то подробнее про это прочитать можно?

iskatel
30.09.2026 10:33Эта тема и кратко, и подробно, и очень подробно освещена в сотнях (если не тысячах) статей.
наверно, Вам лучше прочитать парочку из них полностью, а не чтобы я вам их пересказывал.
гуглом находятся на раз-два.
но очень-очень кратко всё ж скажу, раз сразу не нашли.
" Казалось бы - просто восстановление аналога из цифры, зачем здесь передискретизация? "
Потому что критерий Котельникова-Шеннона говорит об критичном требовании в идеальных условиях, для восстановления синусоидального сигнала с частотой Х, а на практике у нас никогда не было, нет и не будет идеальных фильтров, ни аналоговых, ни цифровых, для такого восстановления. Далее читайте про особенности различных аналоговых и цифровых фильтров.

voldemar_d
30.09.2026 10:33освещена в сотнях (если не тысячах) статей
Можете ссылку хоть на один материал дать? Что именно искать надо?

iskatel
30.09.2026 10:33Я ж написал, " Далее читайте про особенности различных аналоговых и цифровых фильтров".
Материалов - валом. В основном на английском, но есть и на русском.
https://www.analog.com/media/en/training-seminars/tutorials/mt-017.pdf
Oversampling Interpolating DACs by Walt Kester
https://www.ti.com/lit/an/spra461/spra461.pdf?ts=1790850065008
Oversampling Techniques using the TMS320C24x Family
https://classes.engineering.wustl.edu/ese488/Lectures/DeltaSigmaHandout.PDF
Principles of Oversampling A/D conversion
https://www.analog.com/media/en/training-seminars/design-handbooks/basic-linear-design/chapter8.pdf
ANALOG FILTERS
обратить внимание на главы про
PHASE RESPONSE , TIME DOMAIN RESPONSE , IMPULSE RESPONSE , STEP RESPONSE

Hlad
30.09.2026 10:33Это всё хорошо, но реальные искажения от всех этих нюансов намного ниже, чем может различить человек. Тем более, что большинство "аудиофилов", втирающих про "воздушные высокие частоты" даже частоту в 16 кГц толком не слышат.
Вообще, заблуждение про 20 кГц очень забавно: все слышат его, кивают головой, и ищут идеальную АЧХ на высоких частотах. В реальности эти 20 кГц слышат в основном дети. А у большинства взрослых верхняя граница чувствительности уха лежит в районе 16-18 кГц, а к глубокой старости снижается килогерц до 10 и даже ниже.

iskatel
30.09.2026 10:33Речь не только про 18-20 кГц, там ещё возникают нелинейные, фазовые, временные искажения сигналов.
Искажения те хорошо слышны в любом возрасте, если слух тренирован, кроме, возможно, глубокой старости.
Не было бы проблемы, так и не занимались бы теорией и практикой фильтров все эти 40 с лишним лет.
Несколько ссылок на статьи я привёл выше.

Mixael_sas
30.09.2026 10:33Какой, у вас, однако, тон надменный. Времени на пересказ нет, а на нравоучения есть.

Tim_23
30.09.2026 10:33Насчёт требования теоремы о частоте дискретизации, которая должна как минимум в 2 раза превышать частоту Найквиста я бы уточнил . Кратность - это минимум. На самом деле никакой нормальной синусоиды при такой частоте дискретизации(2x) не получить , что можно легко проверить самому генератором синуса нужной частоты и с двойной дискретизацией (получается довольно кривая , остроугольная форма сигнала ) . Видимо спасает лишь то , что на очень высоких частотах ближе к 12-16 кГц нет значимых звуков и эти частоты лишь дают детализацию , как некий фон . Да и слышимость на данных частотах с возрастом практически пропадает.
Статья интересная, и ещё раз говорит о том , что за красивыми или интересными цифрами в инженерии иногда стоит банальная практика и удобство , а не замысловатый расчет. Хотя про частоту 59.9 меня удивил факт . Я такую же частоту(вместо 60 Гц) видел при настройке проектора. Не знаю связано это или нет , мне показалось что это странно и какой-то баг в системе.
И ещё кое-что про числа . Я в свое время работал с измерительной лабораторной звуковой техникой . Так вот там частота опроса была пропорциональна 2 в степени n. То есть это либо 32768 Гц, либо 65536 Гц для диапазонов измерения шумов на частотах ниже примерно в 2.54 раза (такой множитель был выбран производителем оборудования ) . Думаю здесь кратность связана с преобразованием Фурье.

Refridgerator
30.09.2026 10:33Я бы уточнил, что в теореме идёт речь о свёртке с функцией sinc, а не визуальной оценке отсчётов.

evtomax
30.09.2026 10:33Беру Audacity, делаю синус 20 кГц на частоте дискретизации 44100. Подключаю осциллограф к звуковой карте, вижу нормальный синус. Что я делаю не так?

Tim_23
30.09.2026 10:33Я говорил про цифровой сигнал . Попробуйте не через программу , а сами сгенерировать сигнал с нужной дискретностью, и постройте синус заданной частоты через полученные отсчёты.

evtomax
30.09.2026 10:33В цифровом PCM сигнале есть только значения в определённых точках, расположенных на расстоянии 1/ЧАСТОТА_ДИСКРЕТИЗАЦИИ друг от друга. Между этими точками значения в PCM не определены. А все угловатости в вашем случае - это результат линейной интерполяции. Интерполяция может быть разная. sinc-интерполяция, если в исходном аналоговом сигнале не было частот выше половины частоты дискретизации, позволяет восстановить именно то значение между точками, которое было в исходном аналоговом сигнале.

Tim_23
30.09.2026 10:33Теперь понял, спасибо, хотя про эту функцию и этот метод ранее не слышал.

Refridgerator
30.09.2026 10:33Вероятно потому что не читали доказательство в оригинале) Их там (у Котельникова) кстати 7.

Tim_23
30.09.2026 10:33Я пробовал генерировать сигнал в sound forge ,чистой синусоиды не получается , получается искаженный сигнал .

a3d
30.09.2026 10:33Печально что что Вы не то что теорему не понимаете, а вообще как цифровой звук устроен и чем и как он собственно восстанавливается из цифровой формы в аналоговую что бы быть воспроизведенным динамиком.
На самом деле никакой нормальной синусоиды при такой частоте дискретизации(2x) не получить , что можно легко проверить самому генератором синуса нужной частоты и с двойной дискретизацией (получается довольно кривая , остроугольная форма сигнала )
2.а) выкинте софт который вам такое показывает
2.б) а ничего что по трём точкам можно восстановить плавную синусоиду, что собственно ЦАП и делает. И эта синусоида будет точно повторять тот аналоговый сигнал, который и был оцифрован, если частота дискретизации попадает в требования теоремы Найквиста, то есть 2х от частоты в аналоговом сигнале.

20 кГц адекватный софт показывает таким каким он будет восстановлен, а не "сигнал остроугольной формы" 
Tim_23
30.09.2026 10:33На вашем графике я вижу, что программа в точности восстановила синус ,только я не понял как она это делает ? Можете объяснить алгоритм ?

beliy1
30.09.2026 10:33Хорошая статья.
переносили момент переключения видеоголовок в кадровый гасящий интервал, чтобы грязь от переключения не попадала на строки со звуком.
Тут не понял. Там было несколько головок внутри? Гасящий сигнал что гасил?

MaFrance351
30.09.2026 10:33В видеомагнитофоне используется наклонно-строчная запись. Там вращающийся наклонный барабан с несколькими головками (минимум две, в Hi-Fi и профессиональных моделях шесть, восемь или даже больше). Гасящий интервал тут - это кадровый гасящий импульс, пауза между кадрами, во время которой магнитофон переключает головки (то есть за один проход головки по ленте отображается кадр, затем головка переключается, уже другая считывает следующий).

aitras
30.09.2026 10:33Добавлю еще немного рассуждений на эту тему от @mihail2501
Насколько оправдан был выбор частоты 44.1 кГц?

nrth18
30.09.2026 10:33наша волна в двух числах дана:
частота дискретизации и её глубина.
эти два числа, подруга-друг,
дают этот тёплый транзисторный звук


sintech
Спасибо, еще один секрет раскрыт.