VI Международная студенческая научная конференция Студенческий научный форум — 2014

ЭКОНОМЕТРИЧЕСКОЕ МОДЕЛИРОВАНИЕ СТОИМОСТИ АВТОМОБИЛЯ TOYOTA CAMRY НА ВТОРИЧНОМ РЫНКЕ, ПРИМЕР, РАСЧЕТЫ
Введение
Даннаяработапосвященаанализу предложений на автомобиль ToyotaCamry на вторичном рынке, выявления тенденций, а также прогнозирования стоимости на конкретное авто с заданными значениями факторов. Эта задача представляет интерес и актуальна для дилеров, автосалонов, для оценки и назначение адекватной цены на авто.
Целью работы является проведение анализа предложений автомобиля ToyotaCamry, полученное с сайта auto.ru по состоянию на 17.12.2013. По этим данным будет построенарегрессионнаямодель, а также произведена оценка качества модели. Для выполнения исследования использовался программный продукт MicrosoftExcel.
Результирующей (эндогенной) переменной будем считать стоимость автомобиля.
Факторы выбраны следующие:возраст автомобиля, пробег (км),количество владельцев, тип коробки — фиктивная переменная (0 — автомат, 1 — механика), тип салона — фиктивная переменная (0 — ткань, 1 — кожа), наличие легкосплавных дисков — фиктивная переменная (0 — нет в комплекте в предложении, 1 — есть в комплекте), наличие люка — фиктивная переменная (0 — нет, 1 — есть).
Исходные данные получены с сайта auto.ru по состоянию на 17 декабря 2013 года — были выбраны предложения автомобиля ToyotaCamry модификации 2,4i 2011 -2013 годов выпуска. Получена выборка по 70 предложениям.
Реализация
Схема проведения количественной оценки взаимосвязей финансовых показателей при решении данной задачи будет выглядеть следующим образом:
1. Выбор факторов для регрессионного анализа
1.1. Корреляционный анализ данных, включая проверку теста Фаррара-Глоубера на мультиколлинеарность факторов
Получим матрицукоэффициентов парной корреляции для всех факторова с помощью инструмента Корреляция из пакета Анализ данных в Excel.
Для выявления мультиколлинеарности факторов выполним тест Фаррара-Глоубера по факторам: возраст авто, пробег, количество владельцев, тип коробки, тип салона, наличие легкосплавных дисков, наличие люка.
Проверка теста Фаррара-Глоубера на мультиколлинеарность факторов включает несколько этапов, реализация которых представлена ниже:
1) Проверка наличия мультиколлинеарности всего массива переменных:
Построим матрицу межфакторных корреляций R и найдем её определительdet[R] = 0,075234492 с помощью функции МОПРЕД.
Определитель матрицы R стремится к нулю, что позволяет сделать предположение об общей мультиколлинеарности факторов. Подтвердим это предположение оценкой статистики Фаррара-Глоубера.
Вычислим наблюдаемое значение статистики Фаррара — Глоубера по формуле:,где n = 70 — количество наблюдений (компаний); k = 7 — количество факторов (переменных анализа).157,3846837
Фактическое значение этого критерия сравниваем с табличным значением критерия с степенью свободы и уровне значимости α=0,05. Табличное значение 32,67057334можно найти с помощью функции ХИ2ОБР. ХИ2.ОБР.ПХ(0,05; 21).Так как (953,87>32,67), то в массиве объясняющих переменных существует мультиколлинеарность.
2) Проверка наличия мультиколлинеарности каждой переменной с другими переменными:
Вычислим обратную матрицу с помощью функции ExcelМОБР.
ВычислимF-критерим, где — диагональные элементы матрицы .
Фактические значения F-критериев сравниваются с табличным значением при n1= 7 и n2 = n — k — 1=70-7-1=62 степенях свободы и уровне значимости α=0.05, где k — количество факторов.
Так как все значения F-критериев больше табличного, то все исследуемые независимые переменные мультиколлинеарны с другими. Больше других влияет на общуюмультиколлинеарность факторов фактор возраст авто, меньше — фактор легкосплавные диски.
3) Проверка наличия мультиколлинеарностикаждой пары переменных
Вычислим частные коэффициенты корреляции по формуле , где — элементы матрицы . Матрицу коэффициентов частной корреляции получим вручную с помощью MicrosoftExcel.
Вычислимt-критерии по формуле .
Фактические значения t-критериев сравниваются с табличным значением при степенях свободы (n — k — 1)=70-7-1=62 и уровне значимости α=0,05.
По результатам выполненных действий можно сделать вывод, что две пары факторов возраст авто и пробег, возраст авто и тип салонаимеют высокую статистически значимую частную корреляцию, то есть являются мультиколлинеарными. Для того, чтобы избавиться от мультиколлинеарности, можно исключить одну из переменных коллинеарной пары. В паре возраст авто и пробегоставляем возраст авто, так как у нее меньше связи с другими факторами; в паре возраст авто и тип салона оставим оба фактора, с экономической и логической точки зрения.
Таким образом, в результате проверки теста Фаррара-Глоубера остается шесть факторов: возраст авто, количество владельцев, тип коробки, тип салона, наличие легкосплавных дисков, наличие люка.
Уточнение набора факторов, наиболее подходящих для регрессионного анализа, осуществим другими методами отбора.
1.2. Пошаговый отбор факторов методом исключения из модели статистически незначимых переменных
В соответствии с общим подходом, пошаговый отбор следует начинать с включения в модель всех имеющихся факторов, то есть в нашем случае с семифакторной регрессии. Но мы не будем включать в модель факторы из заранее известных коллинеарных пар (в связи с наличием коллинеарности ранее были исключен из рассмотрения пробег). Таким образом, пошаговый отбор факторов начнем с шестифкаторного уравнения.
Статистически незначимыми () оказалсяфактор легкосплавные диски. На следующем этапе пошагового отбора удаляем статистически незначимый фактор с наименьшим значением t-критерия, то есть фактор количество владельцев.
Аналогично поступаем до тех пор, пока не получим уравнение, в котором все факторы окажутся статистически значимыми. Из модели исключены последовательно факторы: количество владельцев, наличие люка, тип коробки.
Таким образом, в результате пошагового отбора получено двухфакторное уравнение регрессии, все коэффициенты которого (кроме свободного члена) значимы при 5%-ном уровне значимости, вида где — возраст авто, — тип салона (1 — кожа, 0 — ткань).
Экономический смысл коэффициентов уравнения: при увеличении возраста автомобиля на 1 год стоимость его уменьшается в среднем на 62062 р., кожаный салон в сравнении с велюровым добавляет к стоимости 60216 р.
2. Оценка качества модели регрессии. Проверка статистической значимости уравнения с помощью F-критерия Фишера
Расчетное значение F-критерия Фишера можно найти в регрессионном анализе.
.2,75548072. Так как , то уравнение двухфакторной регрессии статистически значимо на 95% уровне значимости. Таким образом, связь стоимости с включенными в модель факторами существенна.
3. Оценка уровня точности модели
Уровень точности модели характеризует степень отклонения в среднем фактических значений результативной переменной стоимость авто от ее значений, полученных по модели регрессии (предсказанных). Для оценки уровня точности используются различные ошибки: средняя относительная, стандартная и другие.
Cтандартная ошибка модели выводится в первой таблице «Регрессионная статистика» отчета по регрессионному анализу.
Точность модели тем лучше, чем меньше ее стандартная ошибка (это же имеет место и при использовании для оценки уровня точности других видов ошибок). Однако, понятие «чем меньше» является относительным и зависит от порядка чисел, представляющих данные задачи. Поэтому модель считается точной, если стандартная ошибка модели меньше стандартной ошибки (среднеквадратического отклонения) результативного признака Y. Стандартную ошибку легко найти в Excel с помощью статистической функции СТАНДОТКЛОН.
В нашем случае стандартная ошибка модели , а среднеквадратическое отклонение (или стандартная ошибка) ЧП =80815,45939. Так как <, то трехфакторная модель регрессии является точной.
Заключение
Итак, в данной работе проведен анализ предложений автомобиля ToyotaCamry на вторичном рынке. В процессе решения поставленной задачи была простроена регрессионная модель.
Методом пошагового отбора были получены только статистически значимые факторы. В частности, из решения задачи можно сделать вывод, что пробег не оказывает влияния на стоимость автомобиля.Полученное регрессионное уравнение позволяет сделать вывод: как изменится в цене автомобиль с кожаным салоном в отличие от автомобиля с тканевым; насколько в среднем автомобиль потеряет в цене при увеличении возраста.
Полученные данные могут быть использованы автомобильными дилерами для назначения адекватной цены своим предложениям.
Источники
2. Экономико-математические методы и модели: компьютерное моделирование: Учеб.пособие / И.В. Орлова, В.А. Половников — М.: Вузовский учебник, 2011.
3. Многомерный статистический анализ в экономических задачах: компьютерное моделирование в SPSS: Учебное пособие / Под ред. И.В. Орловой. — М.: Вузовский учебник, 2009. — 309 .
Как программист машину покупал. Часть II
В предыдущей статье на примере покупки Mercedes-Benz E-klasse не старше 2010 года выпуска стоимостью до 1.5 млн рублей в Москве была рассмотрена задача поиска выгодных автомобилей. Под выгодными следует понимать предложения, цена которых ниже рыночной в текущий момент среди объявлений, собранных со всех наиболее авторитетных сайтов по продаже б/у автомобилей в РФ.
На первом этапе в качестве метода машинного обучения была выбрана множественная линейная регрессия, были рассмотрены правомерность ее использования, а также плюсы и минусы. Простая линейная регрессия была выбрана в качестве ознакомительного алгоритма. Очевидно, что существует еще много методов машинного обучения для решения поставленной задачи регрессии. В этой статье я хотел бы рассказать вам, как именно я выбирал наиболее оптимальный алгоритм машинного обучения для исследуемой модели, который в настоящее время используется в реализованном мною сервисе — robasta.ru.

Выбор алгоритма
Претенденты на звание “чемпиона”:
Помимо Mercedes-Benz E-klasse мне импонировала Audi A5, особенно с дизельным двигателем мощностью 239 л.с., обладающая хорошей динамикой (6 сек. до 100 км/ч) и приемлемым налогом. Взглянув на зависимость цены от мощности двигателя этого творения немецких инженеров (визуализация ниже), многие вопросы отпадают сами собой.
О линейной зависимости тут не может идти и речи, поэтому алгоритмы, в основе которых лежит линейная зависимость объясняемой переменной (стоимости, в нашем случае) от регрессоров, можно смело отбросить. Использование полиномиальных и нелинейных моделей неправомерно по той причине, что заранее неизвестен вид зависимости того или иного регрессора от цены для каждой отдельной взятой модели автомобиля.
Таким образом, приняв вышеизложенные рассуждения во внимание, нам остается рассмотреть только алгоритмы, в основе которых лежат деревья принятия решений — Random forest и Xgboost (с двумя видами бустинга — xgbDart, xgbTree), и выбрать из них оптимальный.
Следует оговориться, что оптимальный алгоритм — это тот, который покажет себя наилучшим образом (min RMSE) при перекрестной проверке (cross-validation) и отложенной выборке.
Прежде чем переходить к “слепому” применению выбранных алгоритмов, в следующей главе я хотел бы более подробно осветить вопрос их настройки.
Cross-validation
Для оценки реальных возможностей модели и настройки ее параметров в задачах машинного обучения зачастую используют перекрестную проверку (Cross-validation, СV). Выделяется некоторое множество разбиений исходной выборки на обучающую и контрольную подвыборки. Для каждого из разбиений алгоритм настраивается по обучающей подвыборке, затем на контрольной оценивается его средняя ошибка.
Оценкой перекрестной проверки называется средняя по всем разбиениям величина ошибки на контрольных подвыборках.
Для несмещенности оценки вероятности ошибки, полученной посредством кросс-валидации, необходимо, чтобы обучающая и контрольная выборки образовывали непересекающееся подмножество, во избежании явления переобучения.
Разновидности перекрестной проверки:
-
k-блочная кросс-валидация (k-fold cross-validation).
В общем случае смещение метода кросс-валидации зависит от размера валидационной выборки. Если размер валидационной выборки составляет 50% исходных данных (2-блочная кросс-валидация), итоговая оценка СКО будет более смещенной, чем в случае, когда этот размер составляет 10% исходных данных. С другой стороны, меньший размер валидационной выборки увеличивает дисперсию, поскольку каждая валидационная выборка содержит меньше данных для получения стабильного значения СКО.
Таким образом, когда речь идет о k-блочной кросс-валидации, то для минимизации смещения следует выбирать максимальное k, а для уменьшения дисперсии применять многократный k-блочный метод, который справляется с этой задачей лучше однократного.
Что же касается МККВ, то для этого вида перекрестной проверки размер валидационной выборки имеет немного большее влияние на дисперсию, чем количество повторений процесса. Следует также отметить, что количество повторений процесса не оказывает существенного влияния на смещение.
Таким образом, для метода МККВ можно порекомендовать использовать валидационную выборку малого размера (например, 10%) и выполнять большое количество повторений, чтобы уменьшить дисперсию.
Однако, при прочих равных, использование многократной 10-блочной КВ обеспечивает меньшую дисперсию, что в первую очередь обусловлено тем, что для этого метода, один и тот же элемент данных не может встречаться в разных выборках, в отличие от МККВ.
В завершении наших рассуждений, хотелось бы сделать оговорку, что при больших объемах данных 10-блочная или даже 5-блочная однократная КВ дает вполне приемлемые результаты, в нашей же задаче, для настройки модели мы будем использовать многократную 10-блочную перекрестную проверку.
Random forest
«Случайный Лес» — алгоритм, который для полученных данных случайным образом создает множество деревьев принятия решений и потом усредняет результаты их предсказаний. Алгоритм построения дерева очень быстр, поэтому не составляет большого труда сделать столько деревьев, сколько будет нужно.
С практической точки зрения у описанного выше метода есть одно огромное преимущество: он почти не требует конфигурации. Если мы возьмем любой другой алгоритм машинного обучения, будь то регрессия или нейронная сеть, они все имеют множество параметров, и их надо уметь подбирать под конкретную задачу. RF, по-сути, имеет лишь один важный параметр требующий настройки — mtry (размер случайного подмножества, выбираемого на каждом шаге построения дерева). Однако, даже используя значение по-умолчанию, можно получить весьма приемлемые результаты.
Как и в предыдущей статье, заменим отсутствующие значения (N/A) на медианные для всех регрессоров, исключим из выборки объем двигателя (ввиду сильной корреляции параметра с мощностью) и посмотрим на возможности этого алгоритма.
Для перекрестной проверки будем использовать пакет caret, который имеет больше возможностей для оценки качества модели, чем rfcv.
292 samples
15 predictor
No pre-processing
Resampling: Cross-Validated (10 fold, repeated 10 times)
Summary of sample sizes: 262, 262, 262, 263, 263, 263,…
Resampling results across tuning parameters:
mtry RMSE Rsquared
2 134565.8 0.4318963
8 117451.8 0.4378768
15 122897.6 0.3956822
RMSE was used to select the optimal model using the smallest value.
The final value used for the model was mtry = 8.
Построим график, наглядно иллюстрирующий важность каждого из предикторов модели.

Полученная средняя ошибка оценки стоимости автомобиля эквивалентна этой же величине полученной для линейной регрессии. Напомню, что при построении линейной модели, в отличие от RF, мы избавлялись от выбросов, что приводило к дополнительным неточностям в оценках стоимости автомобилей. Таким образом, можно утверждать о робастности “случайного леса” к выбросам.
XGboost
Идея градиентного бустинга состоит в построении ансамбля последовательно уточняющих друг друга элементарных моделей. Каждая последующая элементарная модель обучается на “ошибках” ансамбля из предыдущих элементарных моделей, ответы моделей взвешенно суммируются.
“Бустить” можно практически любые модели — общие линейные, обобщенные линейные, деревья решений, K-ближайших соседей и многие другие.
К особенностям реализации алгоритма бустинга в xgboost можно отнести, во-первых, использование помимо первой еще и второй производной от функции потерь, что повышает эффективность алгоритма. Во-вторых, наличие встроенной регуляризации, что помогает бороться с переобучением. И наконец, возможность задавать пользовательские функции потерь и метрики качества.
Благодаря экспериментальному параметру num_parallel_tree можно задать количество одновременно создаваемых деревьев и представить Random Forest, как частный случай бустинговой модели с одной итерацией. А если использовать больше одной итерации, то получится бустинг “случайных лесов”, когда каждый “случайный лес” выступает в качестве элементарной модели.
В рамках статьи рассмотрим только один вид бустинга — xgbTree, т.к. xgbDart даёт схожие результаты.
eXtreme Gradient Boosting
292 samples
15 predictor
No pre-processing
Resampling: Cross-Validated (10 fold, repeated 10 times)
Summary of sample sizes: 263, 262, 262, 263, 264, 263,…
Resampling results across tuning parameters:
eta max_depth colsample_bytree nrounds RMSE Rsquared
0.3 1 0.6 50 114131.1 0.4705512
0.3 1 0.6 100 113639.6 0.4745488
0.3 1 0.6 150 113821.3 0.4734121
0.3 1 0.8 50 114234.6 0.4694687
0.3 1 0.8 100 113960.5 0.4712563
0.3 1 0.8 150 114337.1 0.4685121
0.3 2 0.6 50 115364.6 0.4604643
0.3 2 0.6 100 117576.4 0.4472452
0.3 2 0.6 150 119443.6 0.4358365
0.3 2 0.8 50 116560.3 0.4494750
0.3 2 0.8 100 119054.2 0.4350078
0.3 2 0.8 150 121035.4 0.4222440
0.3 3 0.6 50 117883.2 0.4422659
0.3 3 0.6 100 121916.7 0.4162103
0.3 3 0.6 150 125206.7 0.3968248
0.3 3 0.8 50 119331.3 0.4296062
0.3 3 0.8 100 124385.7 0.3987044
0.3 3 0.8 150 128396.6 0.3753334
0.4 1 0.6 50 113771.6 0.4727520
0.4 1 0.6 100 113951.6 0.4717968
0.4 1 0.6 150 114135.0 0.4710503
0.4 1 0.8 50 114055.0 0.4700165
0.4 1 0.8 100 114345.5 0.4680938
0.4 1 0.8 150 114715.8 0.4655844
0.4 2 0.6 50 116982.1 0.4499777
0.4 2 0.6 100 119511.9 0.4347406
0.4 2 0.6 150 122337.9 0.4163611
0.4 2 0.8 50 118384.6 0.4379478
0.4 2 0.8 100 121302.6 0.4201654
0.4 2 0.8 150 124283.7 0.4015380
0.4 3 0.6 50 118843.2 0.4356722
0.4 3 0.6 100 124315.3 0.4017282
0.4 3 0.6 150 128263.0 0.3796033
0.4 3 0.8 50 122043.1 0.4135415
0.4 3 0.8 100 128164.0 0.3782641
0.4 3 0.8 150 132538.2 0.3567702
Tuning parameter ‘gamma’ was held constant at a value of 0
Tuning parameter ‘min_child_weight’ was held constant at a value of 1
RMSE was used to select the optimal model using the smallest value.
The final values used for the model were nrounds = 100, max_depth = 1, eta = 0.3, gamma = 0, colsample_bytree = 0.6 and min_child_weight = 1.
Построим график, демонстрирующий важность каждого из предикторов модели.

XGboost для данного конкретного случая показал немного более точные оценки стоимости автомобилей. Вызывает опасение большое число гиперпараметров, которые требуют перенастройки в зависимости от выбранной марки и модели авто. В связи с этим, для использования на сервисе robasta.ru предпочтение было отдано алгоритму Random Forest.
Апробация выбранного алгоритма
Теперь, когда с выбором “чемпиона” покончено, самое время посмотреть на него в деле.
Как и для линейной регрессии в прошлой статье, построим график зависимости выгоды от цены.

А теперь посчитаем выгоду в процентном соотношении.
Полученные результаты имеют крайне слабое сходство с результатами, полученными с помощью линейной регрессии, и выглядят более правдоподобно, несмотря на практически идентичное СКО для обоих моделей.
Для сравнения результатов в этой статье мы использовали выборку из прошлой публикации, поэтому давайте посмотрим много ли выгодных предложений Mercedes-Benz E-klasse не старше 2010 года выпуска, стоимостью до 1.5 млн рублей в Москве на рынке сейчас.

Резюмируя все сказанное выше, могу с уверенностью заявить, что для подбора б/у автомобилей мы получили мощный инструмент, не чувствительный к “фейковым” объявлениям, работающий в режиме реального времени. Вам больше не нужно просиживать часами на нескольких сайтах с объявлениями по продаже машин и ездить смотреть потенциально невыгодные предложения.
Но это еще не все, теперь, используя рассмотренный математический аппарат, Робаста может помочь не только тем, кто хочет купить, но и тем, кто хочет продать свой автомобиль.
Продажа автомобиля
При продаже своей машины вы, разумеется, хотите как минимум не продешевить и продать ее в короткий срок. Для быстрой и выгодной продажи вашего автомобиля нужно понимать вклад различных характеристик в его стоимость.
Для решения этой задачи, на основе все того же “случайного леса”, был разработан сервис для оценки авто. Вы заполняете все поля формы поиска, в соответствии с параметрами вашего автомобиля, после чего модель обучается на основе рыночных предложений в текущий момент. В случае если нашлось пять и более объявлений на рынке, алгоритм для заполненных вами данных предсказывает цену и выдает несколько интересных особенностях в зависимости от общей картины рынка. Стоит подчеркнуть, что для достижения наибольшей точности, для анализа выбираются только автомобили того же поколения, что и ваш. Результаты оценки вашего автомобиля формируются в виде pdf-отчета, стоимость которого составляет 99 ₽.

Напоследок
В настоящее время прорабатываются различные направления дальнейшего развития, среди которых основными можно назвать следующие:
Относительно новые автомобили (пробег до 100 тыс. км) часто продают перед крупными дорогими ТО, эти данные полезно учитывать в модели. Поэтому сейчас я нахожусь в поиске надежных партнеров среди средних и крупных автодилеров.
Открытие оффлайн-центра по подбору и оценке автомобилей в Москве, который, благодаря реализованному алгоритму, будет гораздо менее затратным чем у конкурентов.
Создание удобного API для предоставления функционала “интеллектуальным перекупщикам”.
Вы хотите чем-то помочь в реализации озвученных мной задач или предложить свои идеи? Пишите, я всегда готов рассмотреть любые виды сотрудничества.
KrlvIvn / Praktikum Goto Github PK
Подготовьте прототип модели машинного обучения для «Цифры». Компания разрабатывает решения для эффективной работы промышленных предприятий. Модель должна предсказать коэффициент восстановления золота из золотосодержащей руды. В вашем распоряжении данные с параметрами добычи и очистки. Модель поможет оптимизировать производство, чтобы не запускать предприятие с убыточными характеристиками.
- Подготовить данные;
- Провести исследовательский анализ данных;
- Построить и обучить модель.
Вам нужно защитить данные клиентов страховой компании «Хоть потоп». Разработайте такой метод преобразования данных, чтобы по ним было сложно восстановить персональную информацию. Обоснуйте корректность его работы. Нужно защитить данные, чтобы при преобразовании качество моделей машинного обучения не ухудшилось. Подбирать наилучшую модель не требуется.
- Загрузите и изучите данные;
- Ответьте на вопрос и обоснуйте решение. Признаки умножают на обратимую матрицу. Изменится ли качество линейной регрессии? (Её можно обучить заново.) a. Изменится. Приведите примеры матриц. b. Не изменится. Укажите, как связаны параметры линейной регрессии в исходной задаче и в преобразованной.
- Предложите алгоритм преобразования данных для решения задачи. Обоснуйте, почему качество линейной регрессии не поменяется.
- Запрограммируйте этот алгоритм, применив матричные операции. Проверьте, что качество линейной регрессии из sklearn не отличается до и после преобразования. Примените метрику R2.
Сервис по продаже автомобилей с пробегом «Не бит, не крашен» разрабатывает приложение для привлечения новых клиентов. В нём можно быстро узнать рыночную стоимость своего автомобиля. В вашем распоряжении исторические данные: технические характеристики, комплектации и цены автомобилей. Вам нужно построить модель для определения стоимости. Заказчику важны:
- качество предсказания;
- скорость предсказания;
- время обучения.
- Загрузите и подготовьте данные.
- Обучите разные модели. Для каждой попробуйте различные гиперпараметры.
- Проанализируйте скорость работы и качество моделей.
Интернет-магазин «Викишоп» запускает новый сервис. Теперь пользователи могут редактировать и дополнять описания товаров, как в вики-сообществах. То есть клиенты предлагают свои правки и комментируют изменения других. Магазину нужен инструмент, который будет искать токсичные комментарии и отправлять их на модерацию. Обучите модель классифицировать комментарии на позитивные и негативные. В вашем распоряжении набор данных с разметкой о токсичности правок. Постройте модель со значением метрики качества F1 не меньше 0.75.