Какой была бы Госдума без фальсификаций?
Мы восстановили итоги выборов по протоколам бумажных участков. «Единая Россия» теряет большинство, Москва поддерживает антивоенных кандидатов
Мы уже рассказывали о том, что последние выборы в России прошли очень грязно. Привычные инструменты электоральной статистики позволяют оценить масштабы искажений. Но можно ли восстановить реальный уровень поддержки каждой партии и кандидата? Электоральный аналитик, пожелавший остаться анонимным, сделал это с помощью более сложной модели. «Новая-Европа» вместе с двумя экспертами проверила его расчеты. Рассказываем, как выглядел бы российский парламент при честном подсчете голосов.
Особый путь Москвы
Прошедшие выборы отметились беспрецедентными фальсификациями. Вбросы, массовые удаления наблюдателей, неверный подсчет голосов и переписывание итоговых протоколов — про это массово писали в СМИ и соцсетях. Люди делились личными историями: в одной и той же школе на одном избирательном участке результат «Единой России» составил 20%, а буквально по коридору напротив — 80%. Как правило, на участке с низким результатом партии власти оказывался принципиальный наблюдатель или член комиссии.
«Новая-Европа» уже публиковала графики, демонстрирующие массовые вбросы за «Единую Россию» по всей стране. Любопытно, что в Москве фальсификации были иные: не вбросы, а перекладывания бюллетеней от оппозиции в пользу партии власти и ее кандидатов. Чтобы понять, в чём отличие, нужно сравнить две диаграммы.
Слева — честное голосование в Москве в Госдуму 2021-го. Честное только потому, что нужный результат тогда обеспечило электронное голосование. Но это — хороший пример того, как выглядят выборы без фальсификаций: облако участков образует компактное симметричное «ядро», а обе его проекции (явка и процент ЕР) — те самые кривые Гаусса.
Мы привыкли к тому, что обычно партии власти просто приписывают несуществующие голоса, что увеличивает и явку, и процент ЕР. Красивое ядро размывается, и получается «комета» — ее хвост уходит в правый верхний угол.
Однако посмотрим на правый график — это данные прошедших выборов в Москве. «Комета» хорошо видна, правда ее хвост необычно направлен вверх, а не по диагонали, а ее ядро уже неотличимо. Так выглядят выборы, где вместо вбросов использовали «перекладывания», то есть существующие бюллетени за оппозиционные партии засчитывали в счет «Единой России». При этом общее число бюллетеней не меняется — именно поэтому распределение явки сохраняет свой нормальный колоколообразный вид.
Причина такой столичной «особенности» проста: только в Москве используется электронный список избирателей. Это означает, что старых добрых «амбарных книг», где ручкой расписываются за получение бюллетеня, больше нет, а есть единый облачный реестр, который учитывает и голосующих бумажными бюллетенями, и электронно. Подправлять результаты нужно и там, и там, поэтому существует «разделение ответственности»: офлайновые комиссии подтасовывают свои бюллетени, а электронные — свои.
Вброс же требует не только фальшивого бюллетеня, но и фальшивой отметки о его выдаче, и тут комиссии ходят по тонкому льду. Что, если поставить роспись за не пришедшего на участок избирателя, а он потом проголосует электронно? Во избежание таких ситуаций вбрасывать в Москве запретили.
Что показывают «честные» результаты?
Теперь, когда мы поняли, каким образом фальсифицировали выборы, постараемся восстановить реальные результаты, очищенные от фальсификаций. Обычно это делается по методу Сергея Шпилькина. Если коротко, то берутся «ядра» комет для каждой партии и вычисляются координаты их центров — это и есть реальные результаты голосования. Однако в Москве и во многих регионах ядер комет просто не разглядеть — настолько много украли голосов.
Поэтому мы впервые применили анализ стохастической границы (Stochastic Frontier Analysis, SFA) — продвинутый метод экономической статистики, который разработали для систем, где случайные факторы (Гаусс) сочетаются с систематическими потерями (фальсификации).
Метод позволил разработать математическую «модель фальсификатора» и примерно описать картину разброса голосов за партию и кандидатов власти. Мы разложили наблюдаемую картину на компоненты: гауссиану, соответствующую реальному волеизъявлению (стохастическая граница), и искаженные компоненты — предположительно, результат действий фальсификаторов, которые вбрасывают или перекладывают голоса по определенному принципу (например, вбрасывают 30% за «Единую Россию»).
Впрочем, все комиссии разные, каждая фальсифицирует в разном масштабе. Результат партии власти и провластных кандидатов они сдвигают вправо, а результат оппозиции — влево. Иногда результат оппозиции просто обнуляют, но ради приличия оставляют небольшой процент — опять же, каждая комиссия — в меру своей щедрости. Но не все комиссии занимаются фальсификациями — многие считают честно. Их вклад показан цветными гауссианами.
Полученные результаты сильно отличаются от официальных.
Во-первых, мы видим значительно более скромный процент поддержки «Единой России» в стране — около 33% вместо 57%. Во-вторых, в Москве произошло консолидированное голосование за антивоенных кандидатов и партии, в наименьшей степени поддерживающие войну. Оппозиционные кандидаты набрали более трети голосов и получили бы 12 мандатов из 16.
«Единая Россия» оказывается практически на одном уровне с КПРФ и «Новыми людьми». Поддержка партии власти в столице существенно уменьшилась с прошлых выборов.
То есть при честном подсчете «Единая Россия» могла и не набрать простого большинства в Госдуме даже с учетом своих одномандатников
(правда в 64 округах фальсификации были тотальными и определить результаты оказалось невозможным, а 13 округов были нами исключены, т. к. находятся за пределами международно признанной территории России). Из числа кандидатов, поддержанных Юлией Навальной и Максимом Кацем, мандаты могли получить 23 человека.
Помимо бумажного голосования, на выборах использовалось дистанционное электронное голосование — ДЭГ. В этот раз система окончательно превратилась в «черный ящик»: опубликованы практически только итоговые результаты, исходный код закрыт, а полноценное независимое наблюдение за подсчетом отсутствует. Проверить, отражают ли эти цифры реальное волеизъявление, мы не можем, поэтому результаты ДЭГ в расчетах не учитываем.
При этом мы сравнили бумажные участки с высокой и низкой долей избирателей, выбравших электронное голосование, и не обнаружили значительных различий в поддержке партий. Такое сравнение дает основания предполагать, что предпочтения электронных избирателей в целом близки к предпочтениям голосующих на бумаге и при честном подсчете их голоса не изменили бы общую картину результатов выборов кардинально.
Как мы считали
Масштаб и характер фальсификаций на этих выборах существенно осложняют восстановление результатов. Привычные инструменты электоральной статистики, в том числе метод Шпилькина, позволяют оценить масштаб искажений, но их возможностей недостаточно для восстановления поддержки каждой партии и кандидата. Поэтому мы использовали более сложную методику.
Наши оценки — результат моделирования, со своими погрешностями и ограничениями. При расчете большого числа округов возможны и отдельные ошибки. Мы не претендуем на абсолютную точность, однако считаем полученную картину значительно более правдоподобной, чем результаты, опубликованные ЦИК. Ниже объясняем, на каких предположениях основана модель и какие проверки и ограничения помогают ей работать.
Структура данных
Для анализа мы использовали официальные протоколы всех избирательных участков с бумажным голосованием, результаты ДЭГ в расчет не входили. Для каждой партии и каждого кандидата известна доля голосов на каждом УИК. Сначала мы смотрели на распределения этих долей в целом, по всей стране и отдельно по Москве: по ним видны основные закономерности, и по ним мы выбрали, какими функциями описывать искажения. Затем модель адаптировалась по данным отдельных участков в каждом округе: и для партийных списков, и для одномандатников. Каждый УИК учитывается со своей долей голосов и весом по числу бюллетеней.
Как устроена модель
Мы используем метод, основанный на идее стохастического анализа границ (Stochastic Frontier Analysis, SFA). В экономике SFA был разработан в 1970-х годах для того, чтобы разделять два вида отклонений: обычный случайный разброс, который может происходить в обе стороны, и дополнительное систематическое отклонение, направленное только в одну сторону.
Мы применяем ту же идею к результатам выборов. Предполагается, что без систематического вмешательства результаты участков образуют некоторое исходное распределение. Отдельные участки могут естественным образом отклоняться от среднего как вверх, так и вниз. Но помимо этого может существовать дополнительный процесс, который сдвигает результат участника преимущественно в одну сторону — например, увеличивает его результат или, наоборот, уменьшает его.
Сам по себе такой статистический сдвиг еще не доказывает фальсификацию. В нашей модели он рассматривается как компонент, который может соответствовать результату фальсификаций.
Модель пытается представить наблюдаемые на УИКах результаты как смесь нескольких компонент.
V — исходная компонента.
Она описывает распределение результатов, которое мы ожидали бы в отсутствие систематического одностороннего сдвига. В простейшей версии модели мы приближаем его нормальным, то есть гауссовым распределением.
U — компонента со сдвигом вправо.
Она описывает участки, на которых результат участника оказался систематически выше исходного уровня.
W — компонента со сдвигом влево.
Она, наоборот, описывает участки, где результат оказался систематически ниже исходного уровня.
Важно, что U и W не являются совершенно независимыми распределениями. Они строятся из того же исходного распределения V, но к результату каждого участка добавляется положительный или отрицательный сдвиг.
Размер этого сдвига тоже различается от участка к участку. Для его описания мы задаем отдельное распределение — например, гамма-распределение (мы тестировали разные функции и подбирали оптимальную для каждой партии, и отдельно для Москвы и России). Оно определяет, насколько часто модель ожидает небольшие, средние и крупные сдвиги.
Математически получение U из V можно представить как свертку двух распределений: исходного разброса результатов и распределения величины дополнительного сдвига.
На практике часто достаточно двух компонент. Например, для кандидата, которому предположительно могли добавлять голоса, модель состоит из:
- исходной компоненты V;
- компоненты U, сдвинутой вправо.
Наблюдаемое распределение F тогда является их смесью:
- [F=P_0V+(1-P_0)U],
- где (P_0) — доля исходной компоненты, а (1-P_0) — доля сдвинутой.
Аналогично, если рассматривается возможное уменьшение результата участника, вместо U используется компонента W, сдвинутая влево. Иногда присутствуют сразу два сдвига: так, например, в нескольких московских округах, на одних УИК голоса ЛДПР перераспределяли в пользу «Единой России», а на других — от других оппозиционных партий в пользу ЛДПР. Также мы использовали граничные компоненты, когда комиссии рисовали результат, близкий к нулю или к 100%, никак не коррелировавший с реальным результатом.
Параметры модели подбираются методом максимального правдоподобия: программа ищет такое их сочетание, при котором фактически совокупность всех наблюдаемых результатов на всех УИКах наиболее вероятна.
Двухкомпонентная модель содержит несколько свободных параметров: среднее и ширину исходного распределения, параметры распределения величины сдвига и долю исходной компоненты (P_0). При одновременном анализе нескольких участников число параметров быстро растет. Разные их комбинации иногда могут описывать данные почти одинаково хорошо, из-за чего решение становится неустойчивым. Поэтому в многомерной модели мы дополнительно вводим ограничения, связывающие параметры разных участников.
Для того чтобы избежать неустойчивости системы по V, мы ввели дополнительное ограничение для полуширины в диапазоне 0,3–1,6 от эталонной полуширины, которая была установлена с помощью эмпирической зависимости, описывающей полуширины распределений результатов партий бумажного голосования в Москве на выборах 2021 года. Оно использовалось в качестве эталонного, т. к. на тех выборах все фальсификации были в ДЭГе. Наш анализ показал, что в выбранный диапазон полуширин попадают более 90% распределений в честных регионах на разных выборах.
Также мы использовали более простое условие: сумма исходных результатов всех участников должна равняться 100%. Поэтому положения кривых подбираются совместно: результат одной партии или кандидата ограничивает допустимые результаты остальных.
Первый цикл расчета и первичная оценка «честности округа»
За пределами Москвы модель должна учитывать и вбросы, и перераспределение голосов между участниками. Это увеличивает число свободных параметров и делает подбор неустойчивым. Поэтому в первом цикле мы задаем дополнительное ограничение на P₀: долю честной компоненты распределения. Начальную оценку получаем по избыточной явке, используя подход, близкий к методу Шпилькина: определяем, насколько наблюдаемая явка превышает ожидаемую, и на этой основе рассчитываем величину P₀ с помощью кусочно-линейной функции явки.
При нормальной явке, в том числе в Москве, такой способ не позволяет заранее оценить масштаб вмешательства: перераспределение голосов может происходить без изменения числа бюллетеней. Поэтому первый расчет начинаем с предположения, что все участки честные: P₀ = 1. В этом случае модель описывает данные только исходными гауссовыми распределениями V, без искаженных компонент U и W.
После подбора параметров проверяем, насколько полученное решение соответствует официальным данным. Хорошее совпадение означает, что распределения согласуются с предположением о честном подсчете. Если же расхождение велико, первоначальная оценка честности оказалась слишком высокой. Мы измеряем это расхождение — неувязку — и на его основе пересчитываем ограничение на P₀. Так первый цикл дает не только предварительное решение, но и уточненную оценку честности для повторного расчета.
Второй цикл расчета
Во втором цикле мы используем уточненную оценку P₀ и заранее выбранные функции, описывающие искажения. Их форму мы определили по распределениям голосов за каждую партию или кандидатов от партии на интегральных данных — отдельно для Москвы и для остальной России. Это позволило подобрать функции, которые лучше всего воспроизводят характерные для каждой партии аномалии.
Фиксируем уточненное значение P₀, а остальные параметры подбираем заново в рамках принятых ограничений. При этом меняются как параметры сдвигов, так и положения исходных гауссов — искомые проценты партий и кандидатов. Мы вновь ищем максимум правдоподобия и получаем окончательную оценку результатов голосования.
Восстановление возможно, пока в протоколах сохраняется достаточно информации об исходном голосовании. Если результат практически полностью заменен нарисованными цифрами, восстановить утраченную картину статистическими средствами невозможно. Наиболее тяжелые случаи мы наблюдаем в так называемых электоральных султанатах: в частности, в Чечне, Башкортостане и Саратовской области. Для округов, где и после второго цикла модель не дает приемлемого описания данных, мы считаем, что достоверно оценить исходные результаты этой методикой не удалось. Если вид итоговых распределений существенно меняется при замене сдвиговых функций, мы считаем, что данный результат имеет пониженную точность.
Точность метода
Полная оценка погрешности такой модели — прежде всего вычислительно сложная задача, поэтому мы провели две проверки. В первой зафиксировали параметры всех участников, кроме двух основных соперников, а также P₀. Затем меняли соотношение голосов между этими двумя участниками при неизменной сумме их результатов, заново подбирая параметры сдвигов. Характерная неопределенность составила около 1%. Это показывает устойчивость баланса между соперниками, хотя проверяет лишь одно направление изменения результатов.
Во второй проверке мы рассмотрели десять наиболее чистых регионов, где распределение хорошо описывается доминирующим исходным гауссом и небольшой дополнительной компонентой. Расхождение между положением исходной гауссианы и оценкой нашей модели также составило около 1 п. п. Таким образом, в простых случаях наш подход согласуется с оценками по методу Шпилькина. Кроме того использование разных сдвиговых функций и разных стратегий оптимизации также может давать слегка отличающиеся результаты в пределах 1–2 п. п.
Эти результаты дают ориентир точности для благоприятных случаев с небольшими фальсификациями: около ±3–4 п. п. Однако считать это универсальной погрешностью нельзя. Чем сильнее искажены данные, тем выше неопределенность восстановления; непосредственно проверить его точность невозможно, поскольку исходные результаты утрачены. Для Москвы мы ожидаем более высокую точность, чем для остальных регионов: принятое в модели отсутствие вбросов позволяет дополнительно ограничить решение балансом голосов.