C++. Секреты быстрой компиляции
Введение
Основная масса программистов на С++ принимает долгую компиляцию как должное. Совсем по другому эту ситуацию воспринимают программисты, перешедшие на С++ с других языков, в которых используются быстрые компиляторы (Basic, Delphi). Подход к программированию во многом зависит от скорости компиляции и линковки: если компилятор собирает проект за несколько минут – вы не будете пользоваться им для тестирования небольших изменений, используя же быстрый компилятор вы имеете возможность без потери времени оттестировать практически каждое изменение в коде. Здесь не будет рассматриваться вопрос «зачем нужна быстрая компиляция», здесь я расскажу как сделать С++ компилятор быстрым.
Статья состоит из нескольких разделов, посвященных отдельным инструментам и настройкам, позволяющим ускорить работу компилятора.
Выбор компилятора.
Ничто так не ускоряет работу компилятора как его правильный выбор. Многие программисты выбирают OpenSource-решения в духе MinGW, надеясь сэкономить или из принципиальных побуждений. MinGW весьма медленный компилятор. Intel — немного быстрее. Лучшие результаты по скорости компиляции показывает Microsoft Visual C++. Если хотите еще более быстрой компиляции — отключите все оптимизации.
Precompiled headers
Precompiled headers – это набор заголовочных файлов, которые собираются один раз и при повторной сборке проекта очень быстро линкуются. В список precompiled headers нужно добавлять все те заголовочные файлы, которые содержат стабильный неизменный код или меняются очень редко. Для MSVC++ по умолчанию список этих файлов содержится в stdafx.h, который должен быть подключен во все cpp файлы самым первым.
IncrediBuild
IncrediBuild – инструмент, который интегрируясь в MS Visual Studio, позволяет распараллеливать компиляцию по всем подключенным к IB компьютерам в сети. Безусловно, замечательный инструмент, но с серьезным недостатком: скорость линковки ниже, чем при обычной сборке, да и необходимость рассылать всем исходные коды и получать результат, сказывает отрицательно. Выигрыш в скорости вы получите только если проводите rebuild проекта. При штатной разработке IncrediBuild обычно работает немного медленней обычной компиляции.
Ram Disk
Ram Disk – это виртуальный винчестер, с которым система работает как с обычным винчестером, но физически расположенный в оперативной памяти. Объем такого диска весьма ограничен, но 100 мегабайт достаточно, чтобы хранить все скомпилированное приложение. Использование Ram Disk – один из самых эффективных способов ускорить компиляцию и сборку С++ проекта, в этом случае основная нагрузка ложится на процессор и нет торможения из-за медленной скорости чтения/записи винчестера.
ВАЖНО! Ram Disk – работает с оперативной памятью, а значит любой сбой в работе вашего ПК потенциально может привести к полной потери информации. В связи с чем не стоит переносить исходные коды на Ram Disk, размещайте на нем только сборку.
Qt
Qt — замечательный инструмент для разработки приложений, но входящий в него qmake работает очень медленно. Поработав с этим инструментом, мы пришли к следующему принципу его использования: при разработке кода ядра и кода игры не используется Qt, следовательно не требуется запуск qmake. При этом весь инструментарий использует Qt для интерфейсов и для реализации внутренней логики, не связанной с кодом движка.
Есть в этом некоторое кощунство – использовать Qt как редактор интерфейса, но полноценное использование функционала Qt в разработке игр несет больше проблем, чем реальной пользы.
Модульность
По возможности выделяйте для каждого класса отдельный модуль. Чем меньше кода нужно переработать компилятору – тем быстрее он это сделает. Готовые модули добавляйте в список precompiled headers.
Итоги
Самый быстрый компилятор – Microsoft Visual C++ с полностью отключенными оптимизациями кода.
Для того, чтобы убрать зависимость от скорости работы винчестера, лучше использовать Ram Disk, не забывая при этом периодически сбрасывать исходные коды на винчестер.
IncrediBuild хорошо помогает при rebuild проекта, но в обычной работе только мешает.
Qt – это хорошо, но слишком медленно и для больших игр не годится.
Код разбивайте на логические блоки и по возможности храните эти блоки в отдельных модулях.
Применив эти нехитрые приемы, вы добьетесь удивительного результата: одна секунда компиляции на код, содержащий несколько мегабайт текста.
Kак ускорить исполнение данного кода?
Есть код, очень — очень медленный, нужно ускорить ну пару хотя-бы раз в 16. конструктор и деструктор не учитываются в бенчмарке Какие есть идеи?


Не использовать float и обойтись только целыми?
Thanx
Я просил не оптимизировать конструктор 🙂
а распараллелить это хорошо. но только даст буст перформансу только в несколько раз (на количество доступных cores, обычно это 4 или 8) чтоб еще сделать для того чтоб ускорить как минимум в 16 раз
постaновка задачи на флоат
какие результаты с int?

Для начала улучшить локальность данных, я считаю. Координаты и направления у тебя лежат в 4х смежных кусках памяти. В конструкторе ты работаешь с ними адекватно их расположению, а в process() у тебя постянные cache misses, потому что ты сначала схватил в начале буфера, потом прыгаешь в конец, потом в середину. x,y,dir_x, dir_y – внутрь структуры, заодно в конструкторе вместо 4х циклов можно сделать один.
Не знаю, не интересует. float ето одно из условий задачи.
Навскидку: у вас очень неудачное расположение данных в памяти. Вам нужны x(i) и dir_x(i), но они отстоят друг от друга на count элементов. Аналогично с y(i) и dir_y(i). Плюс к тому вы в одном цикле делаете обработку и x и y, что дает еще больше промахов мимо кэша.
Можно было бы попробовать делать два массива структур < float v, dir; >и обрабатывать их в двух независимых циклах.
PS. Откуда такое задание: от преподавателя или от работодателя?
если я не ошибаюсь, у моего core i7 размер cache L1 32kb, каждый лайн по 64 байта. в каждом лайне находится по 16 флоатов. и каждый лайн не зависит от другого. так что там ето не должно повлиять. по крайней мере в профайлере ничего не поменялось. в добавок почти весь буффер помещается в L2, так что не особенно должно влиять.
но спасибо, еще идеи?
Вам нужны x(i) и dir_x(i), но они отстоят друг от друга на count элементов.
Это не проблема. Напротив, для векторизации его раскладка — более удобная.

Что это за условие и зачем оно, если у тебя все равно все числа кратны целым и нет ни одного деления?

А числа с фиксированной точкой не подойдут?

Второе, что приходит на ум, это двойная индексация массивов в цикле. Поскольку компилятор может быть не уверен, что в теле цикла i не меняется, то dir в двух местах породит две пачки инструкций по вычислению адреса. Так что, предполагая, что у нас теперь структура, а не 4 массива, делаем:
Далее можно почитать про strict aliasing. Сутьв том, что компилятор не может проверить, что *b – единственный рабочий указатель. Всегда предполагается, что помимо *b может быть ещё один указатель, через который область, на которую *b сылается, может быть изменена. Это приводит к тому, что каждый раз встречая чтение b->x, компилятор генерит код, заново читающий эту область памяти на случай, если её поменяли. Аналогично для записи: изменения сразу коммитятся в оперативную память, вдруг кто-то другой захочет прочитать. Но можно объявить указатель через restricted, этим объявлением мы берём на себя обязательство, что наш указатель *b – единственный, через который мы с памятью работаем. Исчезают дополнительные проверки, код записи данных по указателю может быть собран в одну кучку, т.е. вся структура обновится целиком, а не отдельными элементами.
Ты хочешь запилить физику шаров. Дело в том, что скорее всего:
1) считатать 15000 process не нужно. Нужно выделить шары, входящие в определенную область интересов и уже в ней решать эту задачу на небольшом количестве шаров.
2) нужно использовать GPU. Он на раз-два справится с этой задачей, только хорошо подумай сначала над 1 пунктом. Я почему-то почти уверен, что без GPU можно обойтись

по крайней мере в профайлере ничего не поменялось.
Оптимизация кода

С ростом навыков и созданием всё более глобальных проектов вы столкнётесь с тем, что “Ардуина” перестанет справляться с тем объёмом работы, который вы хотите от неё получить. Может банально не хватать быстродействия в расчётах, обновлении информации на дисплеях, отправки данных и прочих ресурсозатратных действий, а ещё может просто закончиться память! Самое страшное, когда заканчивается оперативная память: она может это сделать абсолютно незаметно и устройство начнёт вести себя неадекватно, перезагрузится или попросту зависнет. Как этого избежать? Нужно оптимизировать свой код! Информации по этому поводу в Интернете очень мало, поэтому я опишу всё, с чем сталкивался лично.
С чем компилятор справится сам
Модификатор volatile
Компилятор оптимизирует действия с переменными, которые не помечены как volatile , так как это прямая команда “не оптимизируй меня”. Это важный момент, потому что действия с такими переменными (если они нужны) надо оптимизировать вручную. Компилятор не будет оптимизировать вычисления, вырезать неиспользуемые переменные и конструкции с их применением!
Вырезание неиспользуемых переменных и функций
Компилятор вырезает из кода переменные, а также реализацию функций и методов класса, если они не используются в коде. Таким образом даже если мы подключаем огромную библиотеку, но используем из неё лишь пару методов, объём памяти не увеличится на размер всей библиотеки. Компилятор возьмёт только то, что используется.
Оптимизация вычислений
Компилятор оптимизирует некоторые вычисления:
- Заменяет типы данных на более оптимальные там, где это возможно и не повлияет на результат. Например val /= 2.8345 выполняется в 4 раза дольше, чем val /= 2.0 , потому что 2.0 была заменена на 2 .
- Заменяет операции целочисленного умножения на степени двойки (2^n) битовым сдвигом. Например, val * 16 выполняется в два раза быстрее, чем val * 12 , потому что будет заменена на val << 4 .
- Примечание: для операций целочисленного деления такая оптимизация не проводится и её можно сделать вручную: val >> 4 выполняется в 15 раз быстрее, чем val / 16 .
Вырезание условий и свитчей
Компилятор вырежет целую ветку условий или свитчей, если заранее будет уверен в результате сравнения или выбора. Как его в этом убедить? Правильно, константой! Рассмотрим элементарный пример: условие или свитч с тремя вариантами:
Если объявить num как обычную переменную – в скомпилированный код попадёт вся конструкция целиком, три условия или весь свитч. Если num сделать константой const или дефайном #define – компилятор вырежет весь блок условий или свитч и оставит только содержимое, которое получается при заданном num . В этом очень легко убедиться, скомпилировав код и посмотрев на объём занимаемой памяти в логе компилятора. При помощи данного трюка можно ускорить выполнение некоторых функций и уменьшить занимаемое ими место в памяти, например для создания универсальной библиотеки.
Рассмотрим весьма полезный пример: функция быстрого чтения состояния цифрового пина для ATmega328 (остальные быстрые аналоги ищи тут):
Вызов fastRead(переменная) занимает 6 тактов процессора (0.37 мкс), вызов fastRead(константа) – 1 такт (0.0625 мкс)! Для сравнения, вызов стандартной digitalRead(переменная) занимает 58 тактов, а digitalRead(константа) – 52 такта. То есть при помощи оптимального кода и понимания логики работы компилятора можно сделать “digitalRead()” в 58 раз быстрее, чем это предлагает библиотека Arduino.h, при том ничуть не теряя в удобстве использования!
Если вы пишете свою библиотеку или класс, то всё будет чуть труднее: константы внутри класса не являются для компилятора весомым поводом для вырезания условий и свитчей, даже если это const и он объявлен в списке инициализации класса. Для того, чтобы компилятор вырезал условие или свитч внутри реализации методов класса, ему нужна внешняя константа/дефайн или шаблон template . Напомню, что шаблон позволяет также создавать внутри класса массив заданного размера, об этом рассказывал в уроке про библиотеки.
Тестовый класс с дигиталРидами (для AVR) разных вариантов:
Результаты бенчмарка в тактах процессора (для AVR):
volatile variable constant define external const template const digitalRead 58 58 58 52 52 52 pinRead 6 6 6 1 1 1 bitRead(PIND, pin); 3 1 1 1 1 1 Оптимизация скорости
Делюсь инструментом для замера времени выполнения кода с точностью до одного такта процессора (0.0625 мкс для 16 МГц клока), выводит время выполнения в “тиках” процессора и микросекундах, а также частоту выполнения. Работает на таймере 1. Скачать можно с FTP сайта по прямой ссылке (нажать правой кнопкой – сохранить файл), также код находится ниже под спойлером. Код для ATmega328 (Arduino NANO).
Использовать переменные соответствующих типов
Тип переменной/константы не только влияет на занимаемый ей объём памяти, но и на скорость вычислений! Привожу таблицу для простейших не оптимизированных компилятором вычислений. В реальном коде время может быть меньше. Примечание: время приведено для AVR и кварца 16 МГц.
Тип данных Время выполнения, мкс Сложение и вычитание Умножение Деление, остаток int8_t 0.44 0.625 14.25 uint8_t 0.44 0.625 5.38 int16_t 0.89 1.375 14.25 uint16_t 0.89 1.375 13.12 int32_t 1.75 6.06 38.3 uint32_t 1.75 6.06 37.5 float 8.125 10 31.5 Как вы можете заметить, время вычислений отличается в разы даже для целочисленных типов данных, так что всегда нужно прикидывать, какая максимальная величина будет храниться в переменной и выбирать соответствующий тип данных. Стараться не использовать 32-битные числа там, где они не нужны, а также по возможности не использовать float . В то же время, умножить long на float будет выгоднее, чем делить long на целое число. Такие моменты можно считать заранее как 1/число и умножать вместо деления в критических ко времени выполнения моментах кода. Также читай об этом чуть ниже.
Отказаться от float
Из таблицы выше можно увидеть, что на действия с числами с плавающей точкой микроконтроллер тратит в несколько раз больше времени по сравнению с целочисленными типами. Дело в том, что у большинства микроконтроллеров AVR (что стоят на Ардуинах) нет аппаратной поддержки вычислений float чисел и эти вычисления производятся программными средствами. На взрослых микроконтроллерах ARM такая поддержка, к слову, имеется. Что же делать? Просто избегайте использования float там, где задачу можно решить целочисленными типами. Если нужно перемножить-переделить кучу float ‘ов, то можно перевести их в целочисленный тип, умножив на 10-100-1000, смотря какая нужна точность, вычислить, а затем результат снова перевести в float . В большинстве случаев это получается быстрее, чем вычислять float напрямую:
Существует также такая штука как fixed point – числа с фиксированной точкой. С точки зрения пользователя они являются обычными десятичными дробями, но по факту являются целочисленными типами и вычисляются соответственно быстрее. Нативной поддержки fixed point в Arduino нет, но можно работать с ними при помощи самописных функций, макросов или библиотек, под спойлером найдёте пример, который можно использовать на практике:
Также у меня есть простенькая библиотека для работы с такими числами.
Выбирать множители степенями двойки
Как рассказано в первой главе, компилятор заменяет целочисленные операции умножения на (2^n) битовыми сдвигами, которые выполняются гораздо быстрее. Как это использовать: по возможности писать свои алгоритмы так, чтобы в математических операциях получались степени двойки (2 4 8 16 32 64 128…). Например, умножение числа на 16 выполняется в два раза быстрее, чем на 15. Речь идёт о нескольких микросекундах, но иногда и это бывает важно. Примечание: слово целочисленный здесь не просто так, для float трюк не работает!
Заменить деление битовым сдвигом
Что касается целочисленного деления на степени двойки, то компилятор не заменяет его сдвигом и это можно и нужно сделать вручную. Например, деление long числа на 16 ( val / 16 ) выполняется в 15 раз дольше, чем операция сдвига с таким же результатом: val >> 4 (сдвинуть на 4 бита, 16 == 2 в степени 4). Для лонгов получаем 40 мкс на деление, и 2.5 мкс на сдвиг. Экономия! Примечание: слово целочисленный здесь не просто так, для float трюк не работает!
Заменить деление умножением на float
Опять же по таблице выше можно увидеть, что деление для всех типов данных выполняется гораздо дольше умножения, поэтому иногда бывает выгоднее заменить деление на целое число умножением на float . И да, пытаться усидеть на двух стульях, стараясь не использовать float и использовать его вместо деления:
Заменить возведение в степень умножением
Для возведения в степень у нас есть удобная функция pow(a, b) , но в целочисленных расчётах лучше ей не пользоваться: она выполняется гораздо дольше ручного перемножения, потому работает с float , даже если скормить ей целое:
Оптимизировать остаток от деления
Операция остаток от деления % выполняется сравнительно долго, как и само деление. Нужно помнить, что компилятор оптимизирует остаток от деления на 2^n , заменяя его битовой маской, взятие которой выполняется за пару тактов процессора, что в несколько десятков раз быстрее! Например val % 8 будет автоматически оптимизировано в val & 0b111 . Нужно по возможности писать свой алгоритм так, чтобы остаток от деления искался именно от 2^n . Например, при работе с кольцевым буфером можно сделать его размер равным 16, 32, 64, 128… и ускорить тем самым операцию перехода в начало буфера, как это обычно делается buffer_pos % buffer_size .
Предварительно вычислять то, что можно вычислить
Некоторые сложные вычисления требуют выполнения одних и тех же действий несколько раз. Гораздо быстрее будет создать локальную переменную, в неё “посчитать” и использовать в дальнейших расчётах. Примечание: большинство расчётов компилятор оптимизирует сам, например действия с константами и конкретными цифрами.
Ещё хороший пример: расчёт величин, которые ведут себя предсказуемо, например гармонические функции sin() и cos() . На их вычисление уходит довольно-таки много времени – 119.46 мкс! На практике синусы/косинусы практически никогда не вычисляют средствами микроконтроллера, их вычисляют заранее и сохраняют в виде массива. Да, опять два стула: тратить время на вычисление или занимать память уже посчитанными данными. Также не забываем, что компилятор сам оптимизирует вычисления и делает это весьма неплохо.
Не использовать delay() и подобные задержки
Вполне очевидный совет: не используйте delay() там, где можно обойтись без него. А это 99.99% случаев. Используйте таймер на millis() , как мы изучали в уроке про многозадачность.
Заменить Ардуино-функции их быстрыми аналогами
Если в проекте очень часто используется периферия микроконтроллера (АЦП, цифровые входы/выходы, генерация ШИМ…), то нужно знать одну вещь: Ардуино (на самом деле Wiring) функции написаны так, чтобы защитить пользователя от возможных ошибок. Внутри этих функций находится куча различных проверок и защит “от дурака”, поэтому они выполняются гораздо дольше, чем могли бы. Также некоторая периферия микроконтроллера настроена так, что работает очень медленно. Пример: digitalWrite() и digitalRead() выполняются около 3.5 мкс, когда прямая работа с портом микроконтроллера занимает 0.5 мкс, что почти на порядок быстрее. analogRead() выполняется 112 мкс, хотя если его настроить чуть по-другому, он будет выполняться почти в 10 раз быстрее, не особо потеряв в точности. О таком “разгоне” Ардуино мы поговорим в отдельном уроке. В статье полезные алгоритмы для Arduino я выложил несколько “быстрых и лёгких” аналогов Ардуино-функциям.
Использовать switch вместо else if
В ветвящихся конструкциях со множественным выбором по значению целочисленной переменной стоит отдавать предпочтение конструкции switch-case , она работает быстрее else if (изучали в уроках про условия и выбор). Но помните, что:
- switch работает только с целочисленными данными
- “Кейсы” должны быть константами
Помнить про порядок условий
Если проверяется одновременно несколько логических выражений, то при наступлении первого результата, при котором всё условие однозначно получит известное значение, остальные выражения даже не проверяются. Например:
Если flag имеет значение false , функция getSensorState() даже не будет вызвана! if будет сразу пропущен (или выполнен else , если он есть). Этим нужно пользоваться, расставляя условия в порядке возрастания процессорного времени, которое требуется для их вызова/выполнения, если это функции. Например, если наша getSensorState() тратит какое-то время для выполнения, то мы ставим её после флага, который является просто переменной. Это позволит сэкономить процессорное время в те моменты, когда флаг имеет значение false .
Использовать битовые операции
Используйте битовые трюки и вообще битовые операции, часто они помогают ускорить код. Читайте в отдельном уроке.
Использовать указатели и ссылки
Вместо передачи “объекта” в качестве аргумента функции, передавать его по ссылке или по указателю: процессор не будет выделять память под копию аргумента и создавать эту копию в качестве формальной переменной – это сэкономит время! Подробнее про указатели и ссылки читайте в отдельном уроке.
Использовать макро и встроенные функции
Каждая созданная функция имеет свой адрес в памяти, и для её вызова процессор обращается по этому адресу, что занимает время. Время очень малое, но иногда даже оно бывает критичным, поэтому такие критичные ко времени вызовы можно заменить на макро-функции или на встроенные функции, подробнее читайте в уроке про функции.
Использовать константы
Константы ( const или #define ) “работают” гораздо быстрее переменных при передаче их в качестве аргументов в функции. Делайте константами всё, что не будет меняться в процессе работы программы! Пример:
Почему это происходит? Компилятор оптимизирует код, и с константными аргументами он может выбросить из функции почти весь лишний код (если там есть, например, блоки if-else ) и она будет работать быстрее.
Миновать loop
Функция loop() является вложенной во внешний цикл с некоторыми дополнительными проверками, поэтому если вам очень важно минимальное время между итерациями loop() – просто работайте в своём цикле for(;;) , например вот так:
Кодить на ассемблере (шутка)
Arduino IDE поддерживает ассемблерные вставки, в которых на одноимённом языке можно давать прямые команды процессору, что обеспечивает максимально быстрый и чёткий код. Но у нас в семье о таком не шутят =)
Оптимизация памяти
Чаще всего мы сталкиваемся с нехваткой памяти: постоянной Flash или оперативной SRAM. После компиляции кода мы получаем сообщение о занимаемом объёме Flash/SRAM, это ценная информация. Flash память можно забивать на 99%, её объём не изменяется в процессе работы устройства, чего не скажешь о SRAM. Допустим, на момент запуска программы у нас занято 80% оперативной памяти, но в процессе работы могут появляться и исчезать локальные переменные, которые добьют занимаемый объём до 100% и устройство скорее всего перезагрузится или зависнет. Опасность ещё в том, что “раздел” оперативной памяти начинает фрагментироваться, т.е. появляются маленькие пустые места, которые микроконтроллер не может занять новыми появляющимися данными. Да, всё как на компьютере, только кнопки “дефрагментировать” у нас нет. Поэтому нужно или учиться вручную заниматься менеджментом памяти, или стараться оставлять побольше свободной SRAM.
Прилагаю скетч-пример с функцией, которая выводит объём свободной SRAM. Скачать с FTP сайта (нажать правой кнопкой – сохранить файл).
Использовать переменные соответствующих типов
Как вы помните из урока о типах данных, каждый тип имеет ограничение на максимально хранимое значение, от чего прямо зависит вес этого типа в памяти. Вот они все:
Название Вес Диапазон boolean 1 байт 0 или 1, true или false char (int8_t) 1 байт -128… 127 byte (uint8_t) 1 байт 0… 255 int (int16_t) 2 байта -32 768… 32 767 unsigned int (uint16_t) 2 байта 0… 65 535 long (int32_t) 4 байта -2 147 483 648… 2 147 483 647 unsigned long (uint32_t) 4 байта 0… 4 294 967 295 float (double) 4 байта -3.4028235E+38… 3.4028235E+38 Просто не используйте переменные более тяжёлых типов там, где это не нужно.
Использовать define
Для хранения констант в стиле номеров пинов, каких-то настроек и постоянных значений используйте не глобальные переменные, а #define . Таким образом константа будет храниться в коде программы, во Flash памяти, которой много.
Использовать директивы препроцессора
Если у вас какой-то комплексный проект, где перед прошивкой включаются/выключаются некоторые куски кода или библиотеки – используйте условную компиляцию при помощи директив #if , #elif , #ifdef и прочие, о которых мы говорили в уроке про условия
Использовать progmem
Для хранения больших объемов постоянных данных (массив битмапов для вывода на дисплеи, строки с текстом, “таблицы” синуса или других корректирующих значений) используйте PROGMEM – возможность хранить и читать данные во Flash памяти микроконтроллера, которой гораздо больше, чем оперативной. Особенность состоит в том, что данные во Flash пишутся во время прошивки, и изменить их потом будет нельзя, можно только прочитать и использовать.
Читайте подробный урок по PROGMEM.
Использовать F() макро
Если в проекте используется вывод в COM порт фиксированных текстовых данных, то каждый символ будет занимать один байт оперативной памяти, также это относится к строковым данным и выводам на дисплей. У нас есть на вооружении встроенный инструмент, который позволяет хранить строки во Flash памяти, использовать его удобнее того же PROGMEM . Работает очень просто и эффективно, позволяя делать девайс с расширенным общением/отладкой через Serial порт и не думать о забитой оперативке:
Не использовать float
Как мы обсуждали в уроке про типы данных, поддержка вычислений с float является программной (для AVR), то есть грубо говоря для вычислений “подключается библиотека”. Однократно использовав в коде все арифметические действия с float , вы подключите около 1000 байт кода во Flash память для поддержки этих вычислений. Также продублирую пример из предыдущей главы: если нужно хранить много float значений в оперативной или EEPROM памяти, то есть смысл заменить их целочисленными. Как это сделать без потери точности:
Не использовать объекты классов Serial и String
Пожалуй самые “жирные” по занимаемой памяти библиотеки – это стандартные объекты Serial и String. Если в коде появляется Serial, он сразу же забирает себе минимум 998 байт Flash (3% для ATmega328) и 175 байт SRAM (8% для ATmega328). Как только начинаем использовать строки String – прощаемся с 1178 байтами Flash (4% для ATmega328). Если Serial всё таки нужен – попробуйте использовать сильно облегчённый аналог стандартной библиотеки – microUART.
Использовать однобитные флаги
Вы должны быть в курсе, что логический тип данных boolean занимает в памяти Arduino не 1 бит, как должен занимать, а целых 8, т.е. 1 байт. Это вселенская несправедливость, ведь по сути мы можем сохранить в одном байте 8 флагов true / false , а на деле храним только один. Но выход есть: паковать биты вручную в байт, для чего нужно добавить несколько макросов. Пользоваться этим не очень удобно, но в критической ситуации, когда важен каждый байт, можно и заморочиться. Смотрите примеры: