Что такое глубина цвета?
Глубина цвета определяется количеством бит на пиксель, которое может отображаться на экране. Данные хранятся в битах. Каждый бит представляет два цвета, потому что он имеет значение 0 или 1. Чем больше бит на пиксель, тем больше цветов может отображаться. Примеры глубины цвета показаны в следующей таблице:
| Глубина цвета 1 бит 4-битный 8-битный 24-битный |
Количество цветов 2 16 256 16 777 216 |
Истинный цвет
Изображения известны как «True Color», где каждый пиксель определяется с точки зрения его фактических значений RGB или CMYK. Каждый пиксель в истинном цветном изображении имеет 256 возможных значений для каждого из его красных, зеленых или синих компонентов (в модели RGB) или голубого, пурпурного, желтого и черного (в модели CMYK). Поскольку имеется 256 возможных значений для каждого компонента RGB или CMYK, тогда истинный цвет RGB имел бы 24-битную глубину цвета, а истинный цвет CMYK имел бы 32-битную глубину цвета. Есть миллионы возможных цветов для каждого пикселя в истинном цветном изображении. Вот почему он называется «True Color».
Изображения RGB получены из трех основных цветов: красного, зеленого и синего. В 24-битном цвете RGB каждый красный, зеленый и синий компоненты имеют 8 бит и имеют 256 вариаций интенсивности. Эти вариации представлены в шкале значений от 0 до 255, причем 0 имеет наименьшую интенсивность и 255 имеет наибольшее значение. При объединении трех компонентов имеется 256 x 256 x 256 возможных комбинаций или 16 777 216 возможных цветов.
Например, белый будет состоять из максимальной интенсивности красного, зеленого и синего света (R = 255 G = 255 B = 255), а черный будет состоять из нулевой интенсивности красного, зеленого и синего света (R = 0 G = 0 В = 0). Синий будет состоять из максимальной интенсивности синего и зеленого света и нулевой интенсивности красного света (R = 0 B = 255 G = 255).
True Color и цветная модель CMYK
Изображения, использующие цветовую модель CMYK, также являются истинным цветом. Изображения CMYK получены из 3 основных цветов голубого, пурпурного и желтого плюс черного. В 32-битном цвете CMYK каждый голубой, пурпурный, желтый и черный компоненты также имеют 8 бит и имеют 256 вариаций интенсивности. Каждый пиксель в 32-разрядном CMYK-изображении является одним из 256 x 256 x 256 возможных цветов x 256 вариантов черного. Смесь из 100% каждого из голубого, пурпурного и желтого цветов имеет черный цвет, поэтому черный компонент является дополнительным. Несмотря на то, что в модели CMYK больше бит на пиксель, на самом деле он имеет меньшие цветовые «пространства» или гамму, чем RGB.
Пример 4-битного изображения
Пример 8-битного изображения
Пример 24-битного изображения
Как работает видеокодек. Часть 1. Основы
Любое растровое изображение можно представить в виде двумерной матрицы. Когда речь заходит о цветах, идею можно развить, рассматривая изображение в виде трехмерной матрицы, в которой дополнительные измерения используются для хранения данных по каждому из цветов.
Если рассматривать итоговый цвет как комбинацию т.н. основных цветов (красного, зеленого и синего), в нашей трёхмерной матрице определяем три плоскости: первая для красного цвета, вторая для зеленого и последняя для синего.

![]()
Статья опубликована при поддержке компании EDISON.
Альтернативные способы кодирования цветного изображения
Для представления цветов, из которых состоит изображение, есть немало и других моделей. Например, можно использовать индексированную палитру, в которой потребуется только один байт для представления каждого пикселя, вместо трёх, необходимых при использовании модели RGB. В такой модели можно использовать 2D-матрицу вместо 3D-матрицы для представления каждого цвета. Это экономит память, но даёт меньшую цветовую гамму.

Например, взгляните на эту картинку ниже. Первое лицо полностью окрашено. Другие — это красная, зеленая и синяя плоскости (интенсивность соответствующих цветов показана в градации серого).

Видим, что оттенки красного в оригинале будут в тех же местах, в которых наблюдаются самые яркие части второго лица. В то время как вклад синего цвета в основном можно увидеть только в глазах Марио (последнее лицо) и элементах его одежды. Обратите внимание, куда все три цветовые плоскости вносят наименьший вклад (самые темные части изображений) — это в усы Марио.
Для хранения интенсивности каждого цвета требуется определенного количества битов — эта величина называется битовой глубиной. Допустим, тратится 8 бит (исходя из значения от 0 до 255) на одну цветовую плоскость. Тогда имеем глубину цвета в 24 бита (8 бит * 3 плоскости R/G/B).

Другое свойство изображения — это разрешение, представляющее из себя количество пикселей в одном измерении. Частенько обозначается как как ниже на изображение-примере 4 на 4.
Ещё одно свойство, с которым имеем дело при работе с изображениями/видео — это соотношение сторон, описывающее обычную пропорциональную взаимосвязь между шириной и высотой изображения или пикселя.
Когда говорят, что некий фильм или картинка имеют размер 16 на 9, обычно имеется в виду соотношение сторон дисплея (DAR — от Display Aspect Ratio). Однако иногда могут быть различные формы отдельных пикселей — в этом случае речь идёт о соотношении пикселей (PAR — от Pixel Aspect Ratio).

Хозяюшке на заметку: DVD соответствует DAR 4 на 3
Хотя реальное разрешение DVD составляет 704×480, тем не менее оно сохраняет соотношение сторон 4:3, поскольку PAR имеет значение 10:11 (704×10 / 480×11).
Ну и, наконец, можем определить видео как последовательность из n кадров за период времени, которое можно считать дополнительным измерением. А n тогда — это частота кадров или количество кадров в секунду (FPS — от Frames per Second).

Количество бит в секунду, необходимое для показа видео, является его скоростью передачи — битрейтом.
Например, для видео с 30 кадрами в секунду, 24 битами на пиксель, разрешением 480×240 потребуется 82,944,000 бит в секунду или 82,944 Мбит/с (30x480x240x24) — но это если не используется какой-либо из методов сжатия.
Если скорость передачи почти постоянна, то она называется постоянной скоростью передачи (CBR — от constant bit rate). Но она также может и варьироваться, в этом случае называется переменной скоростью передачи (VBR — от variable bit rate).
Этот график демонстрирует ограниченный VBR, когда тратится не слишком много битов в случае полностью тёмного кадра.

Изначально инженеры разработали метод удвоения воспринимаемой частоты кадров видеодисплея без использования дополнительной полосы пропускания. Этот способ известен как чересстрочное видео; в основном, он отправляет половину экрана в первом «кадре», а другую половину — в следующем «кадре».
В настоящее время визуализация сцен, в основном, происходит с использованием технологии прогрессивного сканирования. Это способ отображения, хранения или передачи движущихся изображений, в котором все линии каждого кадра прорисовываются последовательно.

Ну что ж! Теперь мы в курсе, как изображение представляется в цифровом виде, как устроены его цвета, сколько бит в секунду мы тратим, чтобы показать видео, если скорость передачи постоянная (CBR) или переменная (VBR). Знаем про заданное разрешение с использованием заданной частоты кадров, ознакомились со многими другими терминами, такие как чересстрочное видео, PAR и некоторыми другими.
Удаление избыточности
Известно, что видео без сжатия нормально использовать невозможно. Часовое видео с разрешением 720p и частотой 30 кадров в секунду занимало бы 278 Гб. К такому значению приходим, перемножив 1280 x 720 x 24 x 30 x 3600 (ширина, высота, биты на пиксель, FPS и время в секундах).
Использование алгоритмов сжатия без потерь, вроде DEFLATE (используется в PKZIP, Gzip и PNG), не даст достаточного уменьшению необходимой полосы пропускания. Приходится искать другие способы сжатия видео.
Для этого можно использовать особенности нашего зрения. Мы лучше различаем яркость, чем цвета. Видео это набор последовательных изображений, повторяющихся со временем. Между соседними кадрами одной сцены различия небольшие. Кроме того, каждый кадр содержит много областей, использующих один и тот же (или похожий) цвет.
Цвет, яркость и наши глаза
Наши глаза более чувствительны к яркости, чем к цвету. Вы можете убедиться в этом сами, посмотрев на эту картинку.

Если вы не видите, что в левой половине изображения цвета квадратов A и B на самом деле одинаковы, то это нормально. Наш мозг заставляет нас уделять больше внимания светотени, а не цвету. С правой стороны между означенными квадратами есть перемычка того же цвета — поэтому мы (т.е. наш мозг) легко определяем, что, на самом деле, там один и тот же цвет.
Давайте разберём (упрощенно) как работают наши глаза. Глаз — сложный орган, состоящий из многих частей. Однако нас больше всего интересуют колбочки и палочки. Глаз содержит около 120 миллионов палочек и 6 миллионов колбочек.
Рассмотрим восприятие цвета и яркости как отдельные функции определённых частей глаза (на самом деле, всё обстоит несколько сложнее, но мы упростим). Палочковые клетки, в основном, отвечают за яркость, в то время как колбочковые клетки отвечают за цвет. Колбочки подразделяются на три типа, в зависимости от содержащегося пигмента: S-колбочки (синий цвет), M-колбочки (зеленый цвет) и L-колбочки (красный цвет).
Поскольку у нас гораздо больше палочек (яркость), чем колбочек (цвет), можно сделать вывод, что мы более способны различать переходы между темнотой и светом, чем цвета.

Функции контрастной чувствительности
Раз известно, что мы более чувствительны к яркости изображения, можно попытаться использовать этот факт.
Цветовая модель
Мы немножко разобрались, как работать с цветными изображениями, используя RGB-схему. Есть и другие модели. Существует модель, которая отделяет яркость от цветности и она известна как YCbCr. Кстати, есть и другие модели, которые делают аналогичное разделение, но мы рассмотрим только эту.
В этой цветовой модели Y — это представление яркости, а также используются два цветовых канала: Cb (насыщенный синий) и Cr (насыщенный красный). YCbCr может быть получен из RGB, равно как возможно и обратное преобразование. Используя эту модель, мы можем создавать полноцветные изображения, как видим ниже:

Преобразование между YCbCr и RGB
Кто-то возразит: как возможно получить все цвета, если не используется зеленый?
Чтобы ответить на этот вопрос, преобразуем RGB в YCbCr. Воспользуемся коэффициентами, принятыми в стандарте BT.601, который был рекомендован подразделением МСЭ-Р. Это подразделение определяет стандарты цифровом видео. Например: что такое 4K? Каковы должны быть частота кадров, разрешающая способность, цветовая модель?
Сначала вычислим яркость. Воспользуемся константами, предложенные МСЭ, и заменим значения RGB.
Y = 0.299R + 0.587G + 0.114B
После того, как мы получили яркость, отделим синий и красный цвет:
Cb = 0.564(B — Y)
Cr = 0.713(R — Y)
И мы также можем преобразовать обратно и даже получить зеленый с помощью YCbCr:
R = Y + 1.402Cr
B = Y + 1.772Cb
G = Y — 0.344Cb — 0.714Cr
Как правило, дисплеи (мониторы, телевизоры, экраны и т. д.) используют только модель RGB. Но эта модель может быть организована по-разному:

Цветовая субдискретизация
С изображением, представленным в виде комбинации яркости и цветности, мы можем использовать более высокую чувствительность человеческой зрительной системы к яркости, чем к цветности, если будем выборочно удалять информацию. Цветовая субдискретизация — это метод кодирования изображений, с использованием меньшего разрешения для цветности, чем для яркости.

Насколько допустимо уменьшать разрешение цветности?! Оказывается, уже есть некоторые схемы, которые описывают, как обрабатывать разрешение и слияние
Эти схемы известны как системы субдискретизации и выражаются в виде 3-кратного соотношения — , которое определяет число выборок яркостных и цветоразностных сигналов.
a — эталон горизонтальной выборки (как правило, равен 4)
x — количество выборок цветности в первой строке пикселей (горизонтальное разрешение по отношению к a)
y — количество изменений выборок цветности между первой и второй строками пикселей.
Общие схемы, используемые в современных кодеках:
- 4:4:4 (без субдискретизации)
- 4:2:2
- 4:1:1
- 4:2:0
- 4:1:0
- 3:1:1
YCbCr 4: 2: 0 — пример слияния
Вот объединенный фрагмент изображения с использованием YCbCr 4:2:0. Обратите внимание, что мы тратим только 12 бит на пиксель.

Вот так выглядит одно и то же изображение, закодированное основными типами цветовой субдискретизации. Первый ряд — это окончательный YCbCr, нижний ряд показывает разрешение цветности. Весьма достойные результаты, учитывая небольшие потери в качестве.

Помните, мы насчитали 278 Гб дискового пространства для хранения часового видеофайла с разрешением 720p и 30 кадрами в секунду? Если воспользуемся YCbCr 4:2:0, то этот размер сократится наполовину — 139 Гб. Пока что всё равно далеко до приемлемого результата.
Вы можете сами получить гистограмму YCbCr с помощью FFmpeg. В этом изображении синее превалирует над красным, что хорошо видно на самой гистограмме.

Цветность, яркость, цветовая гамма — видеообзор
Рекомендуется к просмотру вот это обалденное видео. Тут объясняется, что такое яркость, да и вообще расставлены все точки над ё о яркости и цвете.
Типы кадров
Двигаемся дальше. Попробуем устранить избыточность по времени. Но сначала давайте определим некоторую базовую терминологию. Предположим, у нас есть фильм с 30 кадрами в секунду, вот его первые 4 кадра:


Мы можем видеть много повторений в кадрах: например, синий фон, не изменяющийся от кадра к кадру. Чтобы решить эту проблему, мы можем абстрактно классифицировать их как три типа кадров.
I-кадр (Intro Frame)
I-кадр (кадр-ссылка, ключевой кадр, внутренний кадр) является автономным. Вне зависимости от того, что нужно визуализировать, I-кадр является, по сути, статичной фотографией. Первый кадр обычно является I-кадром, однако будем регулярно наблюдать I-кадры и среди далеко не первых кадров.

P-кадр (Predicted Frame)
P-кадр (прогнозируемый кадр) использует преимущество того факта, что почти всегда текущее изображение может быть воспроизведено с использованием предыдущего кадра. Например, во втором кадре единственным изменением является движущийся вперёд мяч. Мы можем получить кадр 2 просто немного видоизменив кадр 1, только используя разницу между этими кадрами. Для построения кадра 2 ссылаемся на предшествующий ему кадр 1.
← 
B-кадр (Bi-predictive Frame)
А как насчет ссылок не только на прошлые, а заодно и на будущие кадры, чтобы обеспечить еще лучшее сжатие?! Это, в основном и есть B-кадр (двунаправленный кадр).
←
→ 
Промежуточный вывод
Эти типы кадров используются для обеспечения наилучшего сжатия. Мы разберём, как это происходит, в следующем разделе. А пока отметим, что наиболее «дорогим» по затраченной памяти является I-кадр, P-кадр обходится заметно дешевле, а вот самым выгодным вариантом для видео является B-кадр.

Временна́я избыточность (межкадровое прогнозирование)
Давайте рассмотрим какие у нас есть возможности для минимизации повторений по времени. Этот тип избыточности решим с помощью методов взаимного прогнозирования.
Постараемся потратить как можно меньше битов для кодирования последовательности кадров 0 и 1.

Мы можем произвести вычитание, просто вычитаем кадр 1 из кадра 0. Получаем кадр 1, только используем разницу между ним и предыдущим кадром, фактически кодируем только получающийся остаток.

Но что, если я вам скажу, что есть ещё более лучший метод, который использует еще меньше битов?! Сначала давайте разобьём frame 0 на чёткую сетку, состоящую из блоков. А затем попробуем сопоставить блоки из кадра 0 с кадром 1. Иными словами, оценим движение между кадрами.
Из Википедии — блочная компенсации движения
Блочная компенсация движения делит текущий кадр на непересекающиеся блоки и вектор компенсации движения сообщает, происхождение блоков (распространенное заблуждение состоит в том, что предыдущий кадр делится на непересекающиеся блоки, а векторы компенсации движения сообщают, куда переходят эти блоки. А фактически наоборот — анализируется не предыдущий кадр, а последующий, выясняется не куда перемещаются блоки, а откуда они появились). Обычно исходные блоки перекрываются в исходном кадре. Некоторые алгоритмы сжатия видео собирают текущий кадр из частей даже не одного, а сразу нескольких ранее переданных кадров.

В процессе оценивания видим, что шар переместился с на , значения x и y определяют вектор движения. Еще один шаг, который мы можем сделать, чтобы сохранить биты, — это кодировать только разность векторов движения между последней позицией блока и прогнозируемой, поэтому конечный вектор движения будет
В реальной ситуации этот шарик был бы разделен на n блоков, но сути дела это не меняет.
Объекты в кадре перемещаются в трёх измерениях, поэтому при движении шарика он может стать визуально меньше (или больше, если движется в сторону зрителя). Это нормально, что не будет идеального соответствия между блоками. Вот совмещенный вид нашей оценки и реальной картины.

Но видим, что когда применяем оценку движения, данных для кодирования заметно меньше, чем при использовании более простого метода высчитывания дельты между кадрами.

Как будет выглядеть реальная компенсация движения
Эта методика применяется сразу ко всем блокам. Зачастую наш условный движущийся мячик будет разбит сразу на несколько блоков.

Вы можете сами пощупать эти концепции, используя Jupyter.
Чтобы увидеть векторы движения можно создать видео с внешним предсказанием с помощью ffmpeg.

Ещё можно воспользоваться Intel Video Pro Analyzer (он платный, но есть бесплатная пробная версия, которая ограничена только первыми десятью кадрами).

Пространственная избыточность (внутренний прогноз)
Если проанализировать каждый кадр в видео, то обнаружим множество взаимосвязанных областей.

Пройдемся по этому примеру. Эта сцена в основном состоит из синего и белого цветов.

Это I-кадр. Предыдущие кадры для прогнозирования взять не можем, но получится его сжать. Закодируем выделение красного блока. Если мы посмотрим на его соседей, то замечаем, что вокруг него есть кое-какие цветовые тенденции.

Предполагаем, что в кадре цвета распространяются по вертикали. Что означает, что цвет неизвестных пикселей будут содержать значения его соседей.

Такой прогноз может оказаться и неверным. Именно по этой причине нужно применить этот метод ( внутренний прогноз), а затем ещё вычесть реальные значения. Это даст нам остаточный блок, что приведёт к гораздо более сжатой матрице по сравнению с оригиналом.

Если хотите попрактиковаться с внутренними предсказаниями, то можете создать видео с макроблоками и их предсказаниями с помощью ffmpeg. Чтобы понять значение каждого цвета блока придётся ознакомиться с документацией ffmpeg.

Или же можно использовать Intel Video Pro Analyzer (как я уже упоминал выше, в пробной бесплатной версии ограничение на первые 10 кадров, но вам этого на первых порах хватит).
Решение задач.
Итак, мы с вами сегодня разберем из чего состоит изображение, как оно кодируется и как из изображений получают видео.
Перевод обычного изображения (картина и др. рисунки) в цифровой вид называется пространственной дискретизацией.Дискретизация это процесс разбиение непрерывного аналогового представления информации в дискретное, состоящее из множества частей. Например, у нас может происходить дискретизация звука.
Разбивается изображение на пиксели — это минимальная единица изображения.
У пикселя есть параметрцвет.
Цветов может быть разное количество, кодируются цвета в битах и называется этот параметр глубиной цвета.
Глубиной цветаназывается количество информации, которое используется для кодирования цвета каждой точки (пикселя) изображения.
Количество цветов и глубина цвета связанны формулой: N = 2 I ,
где N – кол-во возможных цветов пикселя, а I – вес цвета пикселя в битах.
Пусть количество цвет N = 128, получаем 128(N) = 2 7( I) , I = 7 бит – вес одного пикселя.
Мы разобрали, как найти вес одного пикселя. Теперь разберем, как найти вес изображения, ведь оно состоит из массива пикселей.
У изображения есть свойство разрешение.
Например, у сканера или фотокамеры, называется разрешающей способностью, то есть с какой детализацией они могут сканировать (фотографировать) изображение.
Разрешение состоит из двух параметров количества пикселейпогоризонталиивертикали.
Если перемножить одно на другое то получим сколько всего пикселей в изображении.
Например: разрешение 100 пикселей по горизонтали и 100 пикселей по вертикали.
Всего пикселей будет 100*100 = 10000 пикселей.
Выше мы нашли вес одного пикселя 7 бит. Зная, общее количество пикселей, 10000 найдем вес всего изображения. 10000 * 7 = 70000 бит —вес всего изображения.
Итак, мы можем находить вес одного изображения, найдем вес видеофайла.
Видео состоит из последовательности картинок идущих одна за другой. Если смена картинок происходи достаточно быстро, то нам кажется, что изображение двигается непрерывно.
В кино есть стандарт 24 кадра в секунду. Кадр это одно изображение.
В телевидении стандарт 25 кадров в секунду.
Исходя из всего вышеперечисленного, делаем вывод, что вес видео – это
вес 1 картинки * на количество картинок в секунду*на количество секунд.
Решение задач.
Дано: Разрешение 1024 * 800, цветов у пикселя может быть 65536.
Найти информационный вес изображения в мегабайтах.
Решение: 1024*800 = 819200 пикселей –всего пикселей
65536 = N, 65536 = 2 16 , I = 16 бит – это вес одного пикселя.
819200 * 16 = 13107200 бит — вес всего изображения
Переведем в мб.13107200 / 8 = 1638400 байт / 1024 = 1600 кб / 1024 = 1,5625 мб
Дано: Разрешение 800*600, глубина кодирования 24 бита, видео длиной 2 минуты, 25 кадров в секунду.
Найти: объем одного изображения и всего видео, в мегабайтах.
Решение: 800*600 = 480000 пикселей
480000 * 24 = 11520000 бит
11520000 бит / 8 = 1440000 байт / 1024 = 1406,25 кб / 1024 = 1,3733 мб — вес одной картинки.
Теперь найдем вес видео: 1,3733 * 25= 34,3325 мб –вес одной секунды записи.
Всего запись длилась — 2 минуты = 120 секунд. –длиться вся видеозапись
34,3325 * 120= 4119,9 мб –вес всей видеозаписи.
Идет трансляция футбольного матча. Используется телевизионный стандарт.
Дано: Разрешение 720*576 пикселей, 25 кадров в секунду, объем изображения 3037500 кб.
Показано 100 секунд матча.
Найти: глубину кодирования и количество цветов в трансляции.
Решение: 3037500 кб за 100 сек. — 3037500 / 100 = 30375 кб за 1 секунду – вес 1 сек записи
Переведем в биты 30375 кб * 1024 = 31104000 байт * 8 = 248832000 бит – вес 1 сек записи
720 * 576 = 414720 пикселей на 1ой картинке
248832000 (т.к. вес 1 сек. записи) / 25 (кадров в сек) = 9953280 бит – вес 1ой картинки
9953280 бит (на картинке) / 414720 пикселе (на картинке) = 24 бита – глуб. кодирования
По формуле N = 2 I , находим кол-во цветов. N = 2 24 , N = 16777216 цветов –кол-во возможных цветов на картинке.