Генетика. T. 59, Номер 11, 2023

Генетика, 2023, T. 59, № 11, стр. 1326-1340

Описание дивергенции субпопуляций в иерархической системе при анализе изонимии. II. Вероятности неизонимных встреч

В. П. Пасеков 1*

1 Федеральный исследовательский центр “Информатика и управление” Российской академии наук
119991 Москва, Россия

* E-mail: pass40@mail.ru

Поступила в редакцию 01.05.2023
После доработки 22.05.2023
Принята к публикации 25.05.2023

Полный текст (PDF)

Аннотация

Рассматриваются типичные метапопуляции человека с иерархической подразделенностью на части (субпопуляции), соответствующие классификации на основе административно-территориального деления (скажем, село, сельсовет, район, область и так далее) или генеалогического подхода, базирующегося на этногенезе, а также на других принципах биологической классификации. Целью настоящей работы является анализ общих свойств распределения концентрации фамилии по субпопуляциям при их иерархической структуре. Внимание концентрируется на описании фамильной дивергенции субпопуляций, в качестве показателя которой рассматривается общая вероятность встреч (Hs) лиц с разными фамилиями, понимаемая как вероятность встречи в выбранной наугад субпопуляции, единицы наблюдения, из рассматриваемой метапопуляции с иерархической структурой. Данная вероятность является фамильным аналогом концентрации гетерозигот в метапопуляции со случайным скрещиванием в ее субпопуляциях, единицах наблюдения. Получено разложение Hs по уровням иерархии, обобщающее эффект Валунда в популяционной генетике. Общая вероятность неизонимных встреч в иерархически подразделенной метапопуляции меньше вероятности случайных встреч в ней на сумму средних внутригрупповых дисперсий концентрации фамилии, соответствующих отдельным уровням. Такие свойства являются чисто статистическими характеристиками иерархической структуры, а не особенностью конкретной популяционной системы и не выводятся из закономерностей той или иной модели микроэволюции. Они вычислительно формулируются одинаково для любой иерархической системы, хотя в общем случае не совпадают количественно. Полученные результаты относятся к сельским и городским иерархическим метапопуляциям как отдельным компонентам всего населения.

Ключевые слова: иерархическая структура популяций, метапопуляции, концентрации фамилии в субпопуляциях человека, характеристики неоднородности субпопуляций, разложение вероятности встреч носителей разных фамилий по уровням иерархии.

Случайный генный дрейф [1] приводит к генетической дивергенции популяций с общим происхождением. Аналогично в результате случайного дрейфа фамилий [2, 3] происходит фамильная дивергенция таких популяций. Оба этих процесса протекают синхронно в одной и той же популяции с ограниченной численностью. Фамильный состав следующего поколения с численностью N мужской составляющей можно упрощенно рассматривать как результат случайной выборки с возвращением размера N из совокупности фамилий мужчин родительского поколения. Генетический состав нового поколения диплоидной популяции при отсутствии систематических давлений является результатом выборки 4N гамет родительского поколения (2N размер популяции с учетом женщин и 4N размер выборки гамет, формирующих 2N диплоидных потомков – по две гаметы на потомка). В результате имеется полная аналогия модели фамильного дрейфа с генетической моделью диплоидной популяции со случайным скрещиванием, рассматриваемой в отношении одного аутосомного локуса с множественными аллелями. Роль фамилий играют аллели. Аналогом случайной встречи пары индивидуумов с разными фамилиями (следовательно, с разными родоначальниками) является появление гетерозиготного генотипа при случайном скрещивании, а аналогом пар однофамильцев будут гомозиготы.

Очевидно, что закономерности динамики фамильного и генетического состава популяции имеют один и тот же характер выборочного дрейфа. Когда закономерности данных процессов сходны, то по наблюдению за результатами одного из них можно делать выводы о результатах протекания другого. Однако оба процесса не идентичны. Для одной и той же диплоидной популяции случайный процесс выборочных колебаний концентраций фамилий в ряду поколений интенсивнее генного дрейфа (соответствует вчетверо меньшей выборке фамилий, чем выборка гамет). Подробнее об этом говорится в [2, 3].

Популяционно-генетический анализ оперирует с данными по генетической структуре популяций. Получение данных по фамильной структуре менее трудоемко и менее затратно. Поэтому желательно проанализировать пути экстраполяции результатов дивергенции популяций по фамильным данным в генетические выводы. При этом важно уметь описывать свойства дивергенции в типичных для населения ситуациях, и мы начнем с такого описания.

Для метапопуляций человека типична иерархическая подразделенность на части (субпопуляции), соответствующие классификации на основе административно-территориального деления (скажем, село, сельсовет, район, область и так далее) или генеалогического подхода, базирующегося на этногенезе, а также на других принципах биологической классификации. В предыдущей части [4] данной работы в качестве характеристики фамильной дивергенции в иерархически подразделенной метапопуляции служила дисперсия распределения фамилии по субпопуляциям. Теперь обратимся к другой характеристике – общей (полной) вероятности случайной встречи (столкновения) индивидуума с фиксированной фамилией с носителем какой-либо другой, которую понимаем как вероятность встречи в выбранной наугад субпопуляции, единице наблюдения, из рассматриваемой метапопуляции с иерархической структурой.

Напомним, что под иерархической системой понимается система с многоуровневой структурой, элементы которой связаны отношениями подчинения, причем отдельный элемент, в свою очередь, является иерархической системой (более низкого ранга). У нас иерархической системой является метапопуляция, подразделенная на субпопуляции различного уровня иерархии. Повторим, что вероятность рассматриваемой встречи аналогична доле (концентрации) гетерозигот в популяционной генетике. Это позволяет при соответствующих предположениях оценивать такой важный генетический показатель как коэффициент инбридинга популяции [5].

Итак, объектом нашего анализа служит реальная или теоретическая метапопуляция s с иерархической подразделенностью на субпопуляции {si} по уровням иерархии. При подразделенности системы отношение подчинения означает вхождение подсистемы низкого уровня в качестве составной части в соответствующую подсистему (группу) более высокого ранга. Например, субпопуляции (скажем, сёла) группируются в сельсоветы, районы и т.д. с уровнями иерархии 2, 3 … соответственно, и множество субпопуляций на каждом из этих уровней представляет собой разбиение рассматриваемой метапопуляции. Здесь выполняется иерархическое подчинение одной субпопуляции другой, т.е. вхождение первой в качестве части во вторую с более высоким уровнем иерархии.

Дадим несколько слов относительно обозначений и терминологии. Под концентрациями фамилий в популяции подразумеваются концентрации однофамильцев (носителей данной фамилии). Векторы набраны полужирным шрифтом, к обозначениям фамильных аналогов популяционно-генетических характеристик (дисперсии, коэффициента фамильного инбридинга) добавлено окончание s (Vs и Fs соответственно). Символ тождества (≡) у нас используется в смысле равенства по определению, а символ ◀ обозначет конец доказательства.

Напомним, что идентификацию и положение субпопуляции в иерархической структуре можно задавать с помощью мультиномеров, как это было сделано нами ранее в предыдущей части [4]. Пусть номер конкретного села (первый уровень) обозначается как s1; номер сельсовета (второй уровень), куда входит это село, как s2; номер района (третий уровень), включающего указанные сельсовет и село, как s3; и т.д. Тогда мультиномер s1 ≡ (s1, s2, s3, …) однозначно определяет рассматриваемое село среди прочих сел первого уровня, вектор s2 ≡ (s2, s3, s4, …) – идентификатор сельсовета, вектор si ≡ (si, si + 1, …) идентифицирует субпопуляцию i‑го уровня среди прочих таких же субпопуляций внутри соответствующей группы следующего уровня i + 1. Это аналогично почтовому адресу, в котором административные составляющие заменены числами.

В результате субпопуляция s1 входит в надлежащую субпопуляцию s2, а si входит в si + 1 и т.д., т.е. субпопуляция некоторого уровня иерархии включает в себя в качестве своей части соответствующие субпопуляции более низкого уровня. Между объектами и их идентификаторами имеется взаимно однозначное соответствие, и мы иногда будем писать идентификатор вместо названия объекта (села, сельсовета и т.д.). Кроме того, повторим, что множество субпопуляций на каждом отдельно выбранном уровне иерархии представляет собой разбиение всей метапопуляции, т.е. составляет ее целиком.

Данный способ нумерации приложим также к концентрации x интересующей фамилии, которую в селе s1 будем обозначать как x(s1), а концентрацию фамилии в субпопуляции i‑го уровня как x(si). Когда некоторые из номеров {si} рассматриваются как случайные величины (например, при выборе субпопуляции наугад), а другие как фиксированные, то для наглядности будем писать фиксированные величины после вертикальной черты. В частности, будем рассматривать $x(\left. {{{{\mathbf{s}}}_{{i - 1}}}} \right|{{{\mathbf{s}}}_{i}})$ как случайную величину, значениями которой являются концентрации фамилии, получаемые при выборе наугад субпопуляции (i – 1)го уровня из фиксированной группы si. Первый аргумент si – 1у $x(\left. {{{{\mathbf{s}}}_{{i - 1}}}} \right|{{{\mathbf{s}}}_{i}})$ указывает на случайно выбираемую субпопуляцию уровня i – 1, а второй (si) – на содержащую ее фиксированную группу уровня i.

Таким образом, концентрация фамилии в фиксированной субпопуляции si обозначается как x(si), а $x(\left. {{{{\mathbf{s}}}_{{i - 1}}}} \right|{{{\mathbf{s}}}_{i}})$ дает случайную величину, принимающую значения концентраций фамилии в субпопуляциях уровня i – 1, выбираемых наугад из si. Обозначим математическое ожидание (среднее значение) случайной величины $x(\left. {{{{\mathbf{s}}}_{{i - 1}}}} \right|{{{\mathbf{s}}}_{i}})$ как x(si), а ее дисперсию как Vs($x(\left. {{{{\mathbf{s}}}_{{i - 1}}}} \right|{{{\mathbf{s}}}_{i}})$).

Цель настоящей работы – продолжение анализа в [4] общих свойств распределения концентрации фамилии по субпопуляциям при их иерархической подразделенности. Они являются чисто статистическими характеристиками иерархической структуры, а не особенностью конкретной популяционной системы. Анализируемые свойства присущи любой иерархически подразделенной метапопуляции и не выводятся из закономерностей той или иной модели микроэволюции. Они вычислительно формулируются одинаково для любой иерархической системы, хотя в общем случае не совпадают количественно. Теоретически это может позволить выделить специфические особенности исследуемого материала. По-прежнему внимание концентрируется на изучении дивергенции субпопуляций, в качестве показателя которой теперь рассматривается не дисперсия концентрации фамилии в субпопуляциях [4], а вероятности встреч пары лиц с неизонимными фамилиями. Обратим внимание на то, что в рассматриваемых вероятностях учитывается порядок фамилий в паре, что не вполне традиционно.

Структура изложения материала следующая. После напоминания системы идентификации субпопуляций в метапопуляции с иерархической структурой рассматриваются вероятности встреч носителей разных фамилий в качестве показателей дивергенции субпопуляций на разных уровнях иерархии. Далее подробно рассматривается изменчивость субпопуляций в случае многоуровневой иерархической структуры метапопуляции. Выведено разложение по уровням иерархии общей (полной) вероятности неизонимныхвстреч в выбранной наугад субпопуляции, единице наблюдения. В найденном разложении каждому отдельному уровню иерархии соответствует неотрицательный компонент, равный соответствующей средней внутригрупповой дисперсии концентрации фамилии.

ПОДРАЗДЕЛЕННЫЕ МЕТАПОПУЛЯЦИИ

В случае изучения популяций человека классификация и группировка данных часто производятся на основе административно-территориального деления, имеющего иерархический характер (скажем, село, сельсовет, район, область и др.), генеалогического подхода на основе этногенеза, лингвистических данных и пр. Получаемая группировка субпопуляций приближенно является иерархической. Иерархическая структура метапопуляции отражается на ее свойствах, в частности на распределении фамилий в популяциях человека, где типична опора на официальные данные иерархического характера, сбор и обработку материалов в соответствии с ними. Настоящая статья мотивирована анализом фамильных данных с ориентацией на популяционную генетику. Использование фамилий для получения выводов о генетической структуре популяций основывается на существующих параллелях в передаче на популяционном уровне потомкам фамилий и аутосомных аллелей (см., например, [2, 3]). Плодотворность такого использования продемонстрирована в ряде работ [6–8] (изонимные браки) [9] (фундаментальная монография), в том числе в исследованиях популяций России [10] (медико-генетические аспекты).

Повторим, что у нас объектами являются субпопуляции, их совокупность образует метапопуляцию (иерархическую систему), подчинение означает принадлежность одной субпопуляции другой в качестве ее части. При этом у самой метапопуляции наивысшей уровень иерархии, и все субпопуляции являются ее частями. В роли числового признака субпопуляции может рассматриваться любая числовая характеристика, но мы ограничимся преимущественно дискретными признаками.

На популяционном уровне в качестве признака субпопуляции рассматривается среднее значение соответствующей характеристики для множества входящих в нее субпопуляций более низкого уровня. Вычисление средних значений основано на суммировании, и желательно выяснить результат разбиений метапопуляции или субпопуляции на более мелкие группы для соответствующего среднего значения признака. При его вычислении суммирование происходит по входящим в объект базовым единицам самого низкого первого уровня, которые у нас считаются заданными (служат начальными данными). Варьирование характера разбиения приводит лишь к перегруппировке слагаемых, а результат остается неизменным. Таким образом, среднее значение признака рассматриваемого объекта не зависит от характера разбиения последнего, что подробнее рассматривается далее.

Важным примером характеристики субпопуляции, состоящей из индивидуумов с дискретным признаком T, является средняя величина T, принимающего значения 1 и 0 в зависимости от его категории (1 для интересующей категории и 0 в противном случае; скажем, интересующей категорией может быть фамилия, аллель, гетерозигота и т.п.). Покажем, что среднее значение T в произвольной субпопуляции si представляет собой не что иное как концентрацию в ней носителей интересующей категории. Эта концентрация также не зависит от характера подразделенности si.

Замечание 1. Пусть субпопуляция si состоит из индивидуумов с дискретным признаком T, кодируемым единицей при интересующей категории и кодируемым нулем в противном случае.

Тогда среднее значение T в si равно концентрации носителей рассматриваемой категории в данной субпопуляции (доле ее носителей; иначе говоря, вероятности случайно встретить такого носителя в субпопуляции при одинаковых шансах встретить любого индивидуума).

Доказательство. Среднее значение T находится как сумма значений T (по условию это 1 и 0) с весами, равными вероятностям, с которыми T принимает данные значения, т.е. равно

$~1 \times Pr\{ T = 1\} + 0 \times Pr\{ T = 0\} = Pr\{ T = 1\} ,$

где Pr {T = …} обозначает вероятность наблюдения соответствующего значения T. Вероятность Pr {T = 1} интерпретируется как вероятность при выборе наугад из si индивидуума получить носителя интересующей категории. При одинаковых шансах выбрать любого индивидуума вероятность Pr {T = 1} равна доле (концентрации) носителей этой категории в si. ◀

Далее рассматривается только популяционный уровень организации, т.е. сами носители остаются за кадром, а анализируемыми объектами являются субпопуляции, характеризуемые средними значениями (концентрациями) интересующих показателей, например фамилии. Для субпопуляций самого низкого первого уровня иерархии значения концентрации фамилии полагаем заданными исходно (рассматриваем их как начальные данные).

Обратим внимание на то, что даже когда предметом изучения является единственная иерархически подразделенная метапопуляция, выводы относительно ее свойств можно делать в вероятностных терминах в результате трактовки характеристик субпопуляции как результатов ее случайного выбора из соответствующего множества субпопуляций, частей разбиения метапопуляции. При этом поскольку концентрация является средним значением для T, то к ней приложимы известные свойства средних значений (математических ожиданий).

Рассмотрим метапопуляцию sj. Покажем, что концентрация T(sj) носителей интересующей категории дискретного признака T в sj равна средней величине для его концентраций в составляющих разбиение sj субпопуляциях {si} и не зависит от разбиения.

Замечание 2. Пусть метапопуляция sj с общей численностью N(sj) разбита на какие-либо группы {si} с численностями {N(si)}. Положим численность носителей рассматриваемой категории T в метапопуляции sj обозначена как TN(sj).

Тогда концентрация T(sj) ≡ TN(sj)/N(sj) носителей данной категории T в метапопуляции sj, произвольно разбитой на группы {si}, находится как

$\begin{gathered} T({{{\mathbf{s}}}_{j}}) = \sum\limits_{{{{\mathbf{s}}}_{i}} \in {{{\mathbf{s}}}_{j}}} {T\left( {{{{\mathbf{s}}}_{i}}} \right)} \frac{{N({{{\mathbf{s}}}_{i}})}}{{N({{{\mathbf{s}}}_{j}})}} \equiv \\ \equiv \sum\limits_{{{{\mathbf{s}}}_{i}} \in {{{\mathbf{s}}}_{j}}} {T\left( {{{{\mathbf{s}}}_{i}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}}} \right) = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {T\left( {{{{\mathbf{s}}}_{i}}} \right)} \right|{{{\mathbf{s}}}_{j}}} \right\}, \\ 0 \leqslant Pr\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}}} \right) \equiv \frac{{N({{{\mathbf{s}}}_{i}})}}{{N({{{\mathbf{s}}}_{j}})}} \leqslant 1,\,\,\,\,\sum\limits_{{{{\mathbf{s}}}_{i}}} {Pr\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}}} \right)} = 1, \\ \end{gathered} $

т.е. как математическое ожидание случайной величины T(si | sj), концентрации T в si при выборе наугад si из sj с вероятностью Pr (si | sj) ≡ N(si)/N(sj). Здесь E является символом операции получения математического ожидания, нижний индекс у E указывает на используемую при усреднении переменную.

Значение T(sj) не зависит от разбиения метапопуляции sj, и T(sj) не меняется при его изменении.

Доказательство. Концентрация T(sj) рассматриваемых носителей в разбитой на группы {si} метапопуляции sj определяется как отношение их численности TN(sj) в sj, складывающейся из численностей в подгруппах {TN(si)}, к общей численности N(sj) метапопуляции sj, складывающейся из численностей ее подгрупп {N(si)}. Для субпопуляций si и sj = {si} имеем

$\begin{gathered} {{T}_{N}}({{{\mathbf{s}}}_{i}}) \equiv T({{{\mathbf{s}}}_{i}})N({{{\mathbf{s}}}_{i}}), \\ {{T}_{N}}({{{\mathbf{s}}}_{j}}) = \sum\limits_{{{{\mathbf{s}}}_{i}} \in {{{\mathbf{s}}}_{j}}} {{{T}_{N}}\left( {{{{\mathbf{s}}}_{i}}} \right)} = T\left( {{{{\mathbf{s}}}_{i}}} \right)N\left( {{{{\mathbf{s}}}_{i}}} \right), \\ \end{gathered} $
$T({{{\mathbf{s}}}_{j}}) \equiv {{{{T}_{N}}({{{\mathbf{s}}}_{j}})} \mathord{\left/ {\vphantom {{{{T}_{N}}({{{\mathbf{s}}}_{j}})} {N({{{\mathbf{s}}}_{j}})}}} \right. \kern-0em} {N({{{\mathbf{s}}}_{j}})}} = \sum\limits_{{{{\mathbf{s}}}_{i}} \in {{{\mathbf{s}}}_{j}}} {T({{{\mathbf{s}}}_{i}})} \frac{{N({{{\mathbf{s}}}_{i}})}}{{N({{{\mathbf{s}}}_{j}})}}.$

Следовательно, концентрация T(sj) в sj равняется среднему взвешенному значению для концентраций {T(si)} в составляющих разбиение sj субпопуляциях {si} с весами, равными относительным численностям субпопуляций {N(si)/N(sj)}. Очевидно, эти веса в сумме по {si} дают единицу и неотрицательны. Их значения {N(si)/N(sj)} можно интерпретировать как вероятности {Pr (si | sj)} попасть на индивидуума из соответствующей субпопуляции si при выборе наугад индивидуума из sj (как вероятности выбора субпопуляции si из sj) при одинаковых шансах каждого быть выбранным.

Таким образом, формула для T(sj) показывает, что T(sj) является математическим ожиданием для T(si | sj) при выборе наугад соответствующей субпопуляции si из sj:

$\begin{gathered} T({{{\mathbf{s}}}_{j}}) \equiv \sum\limits_{{{{\mathbf{s}}}_{i}} \in {{{\mathbf{s}}}_{j}}} {T\left( {{{{\mathbf{s}}}_{i}}} \right)} \frac{{N({{{\mathbf{s}}}_{i}})}}{{N({{{\mathbf{s}}}_{j}})}} = \\ = \sum\limits_{{{{\mathbf{s}}}_{i}} \in {{{\mathbf{s}}}_{j}}} {T\left( {{{{\mathbf{s}}}_{i}}} \right)} Pr(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}}) = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\{ \left. {T({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{j}}\} . \\ \end{gathered} $

Очевидно, приведенный вывод верен для любого разбиения sj на субпопуляции {si}. При этом ее общая численность N(sj) и общее количество носителей TN(sj) в ней не изменятся в результате выбора другого разбиения. Следовательно, их отношение (концентрация носителей) не зависит от разбиения sj и находится по такой же формуле. ◀

Типичным признаком при изучении изонимии служит концентрация x какой-либо фамилии (точнее, носителей данной фамилии). Как и для признака T, среднее значение x(sj) для концентрации фамилии в некоторой метапопуляции sj равно средней величине для концентраций в составляющих ее разбиение субпопуляциях. Скажем, если sj разбита на {s1}, то x(sj) = ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${x(s1)|sj}, а если рассматривается разбиение на {si}, то x(sj) = ${{E}_{{{{{\mathbf{s}}}_{i}}}}}${x(si)|sj}.

Это свойство средних значений признаков в подразделенных популяциях рассматривается далее с более общих позиций как выражение полного математического ожидания.

СВОЙСТВА СРЕДНИХ ЗНАЧЕНИЙ В ИЕРАРХИЧЕСКОЙ СИСТЕМЕ

Пусть дана какая-либо метапопуляция s с иерархической структурой подразделенности. На первом уровне s разбита на субпопуляции {s1}, а на i-м уровне на {si}. Понятно, что каждая из субпопуляций si, в свою очередь, подразделена на соответствующие подмножества субпопуляций первого уровня. Положим, что рассматривается случайная переменная величина T (ею может быть концентрация носителей какой-нибудь категории признака T). Пусть значения концентрации {T(s1)} заданы для всех субпопуляций первого уровня иерархии {s1}, а значения T(si) на более высоких уровнях находятся по определению как

(1)
$\begin{gathered} T\left( {{{{\mathbf{s}}}_{i}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {T\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{i}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{1}}} {T\left( {{{{\mathbf{s}}}_{1}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{i}}} \right), \\ i = 2,\,\,3,...{\text{ }};\,\,\,\,T\left( {\mathbf{s}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {T\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\}. \\ \end{gathered} $

Таким образом, на каждом из уровней иерархии i значение T(si) является средним значением для T(s1) при выборе наугад s1 из si.

Рассмотрим некоторые из свойств математического ожидания для иерархических систем, формулируемые для произвольной случайной величины T. Напомним широко используемую далее формулу полного математического ожидания (частным случаем которой является полученная выше формула для T(s) в предыдущем замечании):

$E\{ T\} = {{E}_{A}}\left\{ {{{E}_{T}}\left\{ {\left. T \right|A} \right\}} \right\} = \mathop E\limits_i {{E}_{T}}\left\{ {\left. T \right|{{A}_{i}}} \right\}Pr({{A}_{i}}).$

Здесь случайное событие A принадлежит множеству событий {Ai}, составляющих полную систему несовместимых случайных событий, реализующихся с вероятностями {Pr(Ai)} и таких, что обязательно происходит одно из них; ET{T | Ai} означает условное (условие пишем после вертикальной черты) математическое ожидание для случайной величины T (нижний индекс у E указывает на переменную, которая служит для усреднения) при условии реализации соответствующего случайного события Ai.

У нас при выборе наугад субпопуляции si из sj роль полной системы случайных событий играет множество субпопуляций {si}, представляющих собой разбиение рассматриваемой популяции sj. Аналогично при случайном выборе s1 из sj полную систему образуют субпопуляции {s1}. Тогда для случайной величины T формула полного математического ожидания выглядит следующим образом:

(2)
$\begin{gathered} E\left\{ {T({{{\mathbf{s}}}_{j}})} \right\} \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{j}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. {T({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{i}}} \right\}} \right|{{{\mathbf{s}}}_{j}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{j}}} \right\}, \\ \end{gathered} $

т.е. среднее значение T у некоторой группы sj является средним для математических ожиданий ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${T(s1)|si} ≡ ≡ T(si) у разбивающих ее подгрупп {si}. Это согласуется с полученными ранее формулами для среднего значения случайной величины T или для концентрации x в подразделенной популяции.

В частности, при j = i + 1 получаем рекуррентное уравнение

(3)
$T({{{\mathbf{s}}}_{{i + 1}}}) = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left. {\left. {\left. {\left\{ {T({{{\mathbf{s}}}_{i}})} \right\}} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right\}} \right\}.$

Если в (2) вместо sj рассматривать всю метапопуляцию s, разбитую на {si}, по формуле полного математического ожидания и определению (1)

(4)
$\begin{gathered} T\left( {\mathbf{s}} \right) = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {T\left( {{{{\mathbf{s}}}_{i}}} \right)} \right|{\mathbf{s}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left. {\left. {\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {T\left( {{{{\mathbf{s}}}_{1}}} \right)} \right\}} \right|{{{\mathbf{s}}}_{i}}} \right\}} \right|{\mathbf{s}}} \right\} = \\ = \sum\limits_{{{{\mathbf{s}}}_{i}}} {T\left( {{{{\mathbf{s}}}_{i}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{\mathbf{s}}} \right),\,\,\,\,i = 1,\,\,2, \ldots , \\ \end{gathered} $

т.е. ${{E}_{{{{{\mathbf{s}}}_{i}}}}}${${{E}_{{{{{\mathbf{s}}}_{1}}}}}${T(s1)|si}|s} = ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${T(s1)|s}.

Мы имеем два выражения для одного и того же значения T(s) – по определению (1) и по формуле (4), т.е.

(5)
$\begin{gathered} T({\mathbf{s}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{1}})} \right|{\mathbf{s}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{i}})} \right|{\mathbf{s}}} \right\}, \\ i = 1,\,\,2,\,\,3, \ldots ,\,\,\,\,T({{{\mathbf{s}}}_{i}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{i}}} \right\}. \\ \end{gathered} $

Эта формула показывает в явном виде равенство полного (общего) среднего значения T(s) средней величине для математических ожиданий отдельных частей {T(si)} одного и того же уровня иерархии i, какими бы ни были эти части и выбранный уровень (i принимает значения, соответствующие отдельным уровням иерархии метапопуляции s). Поскольку разбиение s на {si} может быть любым, то T(s) не зависит от характера подразделенности s.

Аналогичная формула верна для T(sj), когда sj разбита на субпопуляции {si}. Если s состоит из {sj}, а sj из {si}, то

(6)
${{E}_{{{{{\mathbf{s}}}_{j}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{i}}}}}\left. {\left\{ {\left. {T({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{j}}} \right\}} \right|{\mathbf{s}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{i}})} \right|{\mathbf{s}}} \right\}.$

Повторим, что здесь случайная величина T принимает значения {T(si)} с вероятностями {Pr(si | sj)} выбора наугад соответствующей субпопуляции si на уровне иерархии i из субпопуляции sj на уровне j. Среднее значение ${{E}_{{{{{\mathbf{s}}}_{i}}}}}${T(si) | sj} для T(si | sj) обозначается как T(sj) и характеризует составную часть sj метапопуляции s. Это среднее значение само является случайной величиной T(sj | s), если sj наугад выбирается из фиксированной метапопуляции s ≡ {sj}. Согласно формуле полного математического ожидания полное (общее) среднее значение рассматриваемой случайной величины T(si | sj) для всей метапопуляции s ≡ {sj} равно математическому ожиданию для средних значений в ее отдельных частях {sj}, что формально отображается формулами (5)(6).

Признак T определен для субпопуляций на любом уровне иерархии. При этом его базовыми значениями являются значения {T(s1)}, заданные для субпопуляций {s1} первого уровня. Через них выражаются величины T для субпопуляций последующих уровней как средние значения в соответствующих группировках базовых значений. Поэтому обозначение T(si) подразумевает вычисление при условии значений {T(s1)}, а средние величины T для ряда субпопуляций одного и того же уровня не зависят от выбранного уровня и совпадают с величиной для всей метапопуляции s:

$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {T\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {T\left( {{{{\mathbf{s}}}_{i}}} \right)} \right|{\mathbf{s}}} \right\} = \\ = \ldots {{E}_{{{{{\mathbf{s}}}_{j}}}}}\left\{ {\left. {T({{{\mathbf{s}}}_{j}})} \right|{\mathbf{s}}} \right\} = \ldots = T({\mathbf{s}}), \\ \end{gathered} $

что говорит о независимости значения T(s) от разбиений s, в том числе неиерархических.

ПРИМЕРЫ СЛУЧАЙНЫХ ВЕЛИЧИН ПРИ ИЗУЧЕНИИ ИЗОНИМИИ

Далее в качестве случайных величин будем рассматривать такие признаки субпопуляции как концентрация фамилии x и вероятность Hs неизонимных встреч (столкновений) в субпопуляции. Проанализируем также свойства дисперсии Vsin(x(si | sj)), т.е. дисперсии стоящего в скобках аргумента (случайной величины x(si | sj)).

КОНЦЕНТРАЦИЯ ФАМИЛИИ

Рассмотрим подразделенную субпопуляцию s2. Положим, что в качестве T рассматривается концентрация x носителей интересующей фамилии, x(s2) обозначает концентрацию фамилии во всей фиксированной подразделенной субпопуляции s2. Она находится по определению (1) как среднее значение для концентраций {x(s1 | s2)} в субпопуляциях единицах наблюдения первого уровня иерархии {s1} внутри s2:

$x\left( {{{{\mathbf{s}}}_{2}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \left. {Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right\}.$

Среднее значение концентрации фамилии x(s3) для распределения {x(s1 | s3)} в фиксированной субпопуляции s3 находится по определению (1) и по формуле полного математического ожидания (4) как

$\begin{gathered} x({{{\mathbf{s}}}_{3}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{3}})} \right\} = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {\left. {x({{{\mathbf{s}}}_{2}})} \right|{{{\mathbf{s}}}_{3}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. {x({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right|{{{\mathbf{s}}}_{3}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{2}}} {x({{{\mathbf{s}}}_{2}})} Pr(\left. {{{{\mathbf{s}}}_{2}}} \right|{{{\mathbf{s}}}_{3}}). \\ \end{gathered} $

Согласно (4) для произвольного уровня иерархии j (при j > i, когда si входит в sj как составная часть, элемент разбиения sj)

$\begin{gathered} x({{{\mathbf{s}}}_{j}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{j}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x({{{\mathbf{s}}}_{1}})} Pr(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{j}}) = \\ = \sum\limits_{{{{\mathbf{s}}}_{i}}} {x({{{\mathbf{s}}}_{i}})} Pr(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}}),\,\,\,\,{{{\mathbf{s}}}_{j}} = \left\{ {{{{\mathbf{s}}}_{i}}} \right\}. \\ \end{gathered} $

Если здесь вместо sj взять всю метапопуляцию s, то ясно, что концентрация фамилии x(s) не зависит от использования при ее подсчетах уровня разбиения s (как мы видели для произвольной случайной величины T в (5)).

Для иерархически подразделенной метапопуляции s мы имеем при заданных значениях {x(s1)}:

$\begin{gathered} x\left( {{{{\mathbf{s}}}_{i}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{i}}} \right\} = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x\left( {{{{\mathbf{s}}}_{1}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{i}}} \right),\,\,\,\,{{{\mathbf{s}}}_{i}} = \left\{ {{{{\mathbf{s}}}_{1}}} \right\}; \\ \end{gathered} $
$\begin{gathered} x({{{\mathbf{s}}}_{j}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{j}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {x({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{j}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. {x({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{i}}} \right\}} \right|{{{\mathbf{s}}}_{j}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{i}}} {x({{{\mathbf{s}}}_{i}})} Pr(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}}), \\ {{{\mathbf{s}}}_{j}} = \left\{ {{{{\mathbf{s}}}_{i}}} \right\},\,\,\,\,{{{\mathbf{s}}}_{i}} = \left\{ {{{{\mathbf{s}}}_{1}}} \right\}; \\ \end{gathered} $
$\begin{gathered} x\left( {\mathbf{s}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {x\left( {{{{\mathbf{s}}}_{i}}} \right)} \right|{\mathbf{s}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{i}}} {x\left( {{{{\mathbf{s}}}_{i}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{\mathbf{s}}} \right). \\ \end{gathered} $

При i = j – 1 получаем еще одну запись рекуррентного уравнения x(sj) ≡ ${{E}_{{{{{\mathbf{s}}}_{{j - 1}}}}}}${x(sj– 1)|sj}, которую можно исследовать с целью получения выражения для x(sj) на произвольном уровне иерархии j в зависимости от начальных значений {x(s1)}.

КЛАССИФИКАЦИЯ ДИСПЕРСИИ КОНЦЕНТРАЦИИ

Рассмотрим внутригрупповую дисперсию Vsin(s2) ≡ Vs(x(s1 | s2)) концентрации x(s1) по субпопуляциям {s1} внутри s2, т.е. дисперсию распределения {x(s1)} значений x у субпопуляций {s1}, являющихся единицами наблюдения и содержащихся в s2. Она является случайной при выборе наугад s2 из s3. Признак Vsin определен для субпопуляций с уровнем не ниже второго (говорить о внутригрупповой дисперсии для s1 не имеет смысла, так как в ней нет субпопуляций, различия между которыми характеризуются дисперсией). Формально можно определить значение Vs(x(sn|sn)) равным нулю.

Начальные значения для случайной величины x заданы для субпопуляций первого уровня иерархии как {x(s1)}. Эти значения {x(s1)} внутри s2 определяют начальные значения для Vs(x(s1|s2)) = = Vsin(x(s1|s2)), внутригрупповой дисперсии Vsin для s2. Повторим, что данные значения случайны, если s2 наугад выбирается из фиксированной субпопуляции s3.

Напомним классификацию дисперсий в случае метапопуляции s3 с тремя уровнями иерархии. Здесь выделяют три типа дисперсий. Под общей (полной) дисперсией Vstot(x(s1|s3)) метапопуляции понимают дисперсию распределения концентрации {x(s1)} признака по субпопуляциям первого уровня иерархии, содержащимся в s3. Рассматриваемая метапопуляция s3 разбита на группы (субпопуляции) {s2} и дисперсия Vsbetw(x(s2|s3)) распределения концентрации {x(s2)} по этим группам называется межгрупповой дисперсией в метапопуляции. Наконец, каждая группа состоит из соответствующих субпопуляций {s1} с концентрациями {x(s1)}. Дисперсия Vs(x(s1|s2)) распределения концентраций {x(s1)} внутри s2 называется внутригрупповой дисперсией Vsin(x(s1|s2)) группы s2. Метапопуляция s3 в целом характеризуется средней внутригрупповой дисперсией ${{E}_{{{{{\mathbf{s}}}_{2}}}}}${Vsin(x(s2|s3))}.

Ремарка 3. Когда у метапопуляции количество уровней иерархии более трех, приведенная классификация дисперсии становится расплывчатой. Отметим, что дисперсия Vs полностью определяется ее аргументом, а индексы tot, betw, in служат только для облегчения ориентации в отношении аспекта рассмотрения данной дисперсии. Без них свободно можно было бы обойтись без ущерба для логики изложения.

При многоуровневой иерархии метапопуляцию s по-прежнему можно охарактеризовать, скажем, в отношении концентрации x некоторого признака полной дисперсией Vstot(x(s1|s), являющейся дисперсией распределения признака по субпопуляциям самого низкого, первого, уровня иерархии, содержащимся в s.

Еще одной характеристикой субпопуляции s является межгрупповая дисперсия s на уровне i, т.е. дисперсия Vs(x(si|s)) распределения концентрации фамилии по группам уровня i, на которые разбита исходная субпопуляция s. Для каждого из промежуточных уровней у s будет своя межгрупповая дисперсия.

Другой характеристикой s служит внутригрупповая дисперсия Vsin(si|sj) субпопуляции sj, на уровне i, т.е. дисперсия распределения {x(si|sj)} значений x у субпопуляций si в sj. Внутригрупповую дисперсию можно интерпретировать когда i равно единице как полную дисперсию sj, т.е. когда в sj субпопуляции {si} являются единицей наблюдения.

Напомним, что внутригрупповая дисперсия носит случайный характер при выборе наугад sj из s. Тогда вся субпопуляция s характеризуется математическим ожиданием для {Vsin(si|s)}, иначе говоря, средней внутригрупповой дисперсией на уровне i для субпопуляций j-го уровня иерархии в s:

${{E}_{{{{{\mathbf{s}}}_{j}}}}}\left\{ {V{{s}_{{in}}}\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}})} \right|{\mathbf{s}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{j}}} {V{{s}_{{in}}}} (\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{j}})Pr(\left. {{{{\mathbf{s}}}_{j}}} \right|{\mathbf{s}}).$

Вспомним, что при анализе концентрации фамилии x ее среднее значение в субпопуляции (метапопуляции) высокого уровня, скажем, в sk выражается согласно (5) через значения у входящих в нее субпопуляций уровнем ниже как x(sk) = ${{E}_{{{{{\mathbf{s}}}_{j}}}}}${x(sj)|sk}. Казалось бы, если в (5) положить T(sj) = Vsin(si|sj), то аналогично Vsin(si|sk) = Esj{Vsin(si|sj)|sk}. Однако это равенство неверно, что мы подробно проанализируем далее. Суть в том, что перетасовка данных при группировке субпопуляций {sj} не приводит к изменению результатов для концентрации фамилии как показано ранее, в отличие от дисперсии концентрации.

ВЕРОЯТНОСТИ ВСТРЕЧ (СТОЛКНОВЕНИЙ) В ПОДРАЗДЕЛЕННОЙ МЕТАПОПУЛЯЦИИ

Рассмотрим концентрацию (вероятность) Hs(s) встреч (столкновений) индивидуума с данной фамилией с носителем какой-либо другой в метапопуляции s, определяемую как среднее значение Hs для групп одного уровня иерархии. Согласно свойствам средних значений (5) результат усреднения не зависит от того, какое при этом используется разбиение s на группы на данном уровне и от самого уровня. Поскольку концепция встреч Hs скорее умозрительная, чем дающая легко доступный метод определения Hs в произвольной популяции (за исключением случая брачных пар), то возникает проблема как задать Hs на базовом уровне.

Здесь приходится прибегать к косвенным методам, основанным на дополнительных предположениях. Таким предположением является допущение о случайном характере встреч в группах {s1}. Оно разумно, когда разбиение метапопуляции состоит из территориально малых групп (базовых субпопуляций {s1} самого низкого уровня иерархии), в каждой из которых существованием каких-либо препятствий для встреч (столкновений) индивидуумов и нарушениями внешних границ при встречах можно пренебречь.

При случайной встрече двух индивидуумов комбинирование ее участников в пары происходит независимо. В результате независимости участников случайных столкновений вероятность встречи равна произведению вероятностей встретить каждого из участников по отдельности, равных их концентрациям. Так, вероятность Hs(x(s1)) встречи индивидуума с интересующей фамилией (с концентрацией x(s1) ее носителей в s1) и индивидуума с какой-либо иной с учетом порядка участников, очевидно, находится как Hs0(x(s1)) ≡ x(s1)(1 – x(s1)). Эта формула аналогична выражению для концентрации гетерозигот по закону Харди–Вайнберга в популяционной генетике при учете порядка аллелей в гетерозиготе, поскольку в обоих случаях наблюдаем случайные объединения в парах.

Метапопуляция, состоящая из неподразделенных субпопуляций, характеризуется средней величиной для значений Hs по субпопуляциям. Например, общая (полная) вероятность Hs(x(s1|s2)) встречи индивидуумов с разными фамилиями в подразделенной метапопуляции s2 (скажем, в сельсовете s2, подразделенном на села) определяется как среднее значение Hs(x(s1)) для входящих в нее субпопуляций (сeл {s1}), под которой понимается вероятность при выборе наугад субпопуляции s1 из рассматриваемой метапопуляции. Тем самым подразумевается, что встречи происходят только внутри отдельных сeл по аналогии с рядом моделей популяционной генетики, в которых случайное скрещивание идет внутри отдельной элементарной популяции после формирования ее генетического состава к моменту скрещивания с учетом всех факторов динамики. Чтобы подчеркнуть, что когда речь идет о средней вероятности встреч в метапопуляции, а не в отдельной неподразделенной субпопуляции, то среднее значение вероятности встреч называем общей (полной) вероятностью Hs(x(s2)).

Очевидно, при произвольном разбиении метапопуляции s на {s1} у нас нет аргументов в пользу случайного характера встреч в каждой из субпопуляций {s1} и соответственно в пользу вероятности встреч в виде Hs(s1) = Hs0(s1) ≡ x(s1)(1 – x(s1)). При разбиении метапопуляции s на {s1}, когда в {s1} встречи случайны,

$\begin{gathered} Hs\left( {\mathbf{s}} \right) = \sum\limits_{{{{\mathbf{s}}}_{1}}} {H{{s}_{0}}\left( {{{{\mathbf{s}}}_{1}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right) = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \left( {1{\text{ }}--x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right). \\ \end{gathered} $

Здесь и далее для краткости мы пишем Hs(s) вместо Hs(x(s)).

Повторим, что роль вероятности Hs(s1) = Hs(x(s1)) случайной встречи рассматриваемых индивидуумов с учетом порядка их фамилий в неподразделенной субпопуляции s1 с концентрацией интересующей фамилии x(s1) играет x(s1)(1 – x(s1)), а вероятность встречи Hs(s2) в метапопуляции s2 = {s1} определяется как среднее значение Hs(s1) при выборе наугад s1 из метапопуляции s2. Таким образом, полной вероятностью встречи Hs(s2) в метапопуляции s2 будет

$Hs({{{\mathbf{s}}}_{2}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{2}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x({{{\mathbf{s}}}_{1}})(1{\text{ }}--x({{{\mathbf{s}}}_{1}}))} \right|{{{\mathbf{s}}}_{2}}} \right\}.$

Напомним, что Pr(s1|s2) обозначает вероятность случайного выбора села s1 из фиксированного сельсовета s2; ${{E}_{{{{{\mathbf{s}}}_{1}}}}}$ – символ операции получения математического ожидания (среднего значения) случайной величины, стоящей в фигурных скобках; нижний индекс s1 у ${{E}_{{{{{\mathbf{s}}}_{1}}}}}$ указывает на служащую для усреднения переменную s1. По определению вероятность Hs(si) рассматриваемой встречи для произвольного уровня иерархии i задается формулой

$\begin{gathered} Hs\left( {{{{\mathbf{s}}}_{i}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Hs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{i}}} \right\} = \sum\limits_{{{{\mathbf{s}}}_{1}}} {Hs\left( {{{{\mathbf{s}}}_{1}}} \right)} Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{i}}} \right) = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \left( {1{\text{ }}--x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{i}}} \right). \\ \end{gathered} $

На примере вероятности (концентрации) Hs мы видим, что в качестве характеристики субпопуляций может служить не только концентрация фамилии x, но и функция Hs от x. В каждой субпопуляции s1 значение Hs находится как функция x(1 – x) от концентрации x в s1. Казалось бы естественно предположить, что среднее значение Hs по субпопуляциям s1, составляющим si, т.е. Hs(x(si)), находится как такая же функция x(1 – x) теперь от значения x в si. Однако Hs(x(si)) не равно x(si)(1 – – x(si)), что на первый взгляд может показаться парадоксальным.

ВЕРОЯТНОСТЬ ВСТРЕЧ В ПОДРАЗДЕЛЕННОЙ МЕТАПОПУЛЯЦИИ И КОЭФФИЦИЕНТ ФАМИЛЬНОГО ИНБРИДИНГА

Обратимся к анализу вероятности (доли, концентрации) встреч Hs, являющейся аналогом концентрации гетерозигот в популяционной генетике. Как уже говорилось, эту концентрацию можно уподобить вероятности соответствующего столкновения в некоторой совокупности частиц. Напомним, что здесь подразумевается отыскание Hs(si) в подразделенной популяции при условии заданных значений вероятности столкновений в субпопуляциях первого уровня.

На первом уровне иерархии вероятность встречи Hs(s1) в субпопуляции s1 двух индивидуумов (с заданной фамилией с концентрацией x(s1) и какой-либо другой с учетом их порядка) находится в предположении случайных столкновений как Hs(s1) ≡ Hs0(s1) = x(s1)(1 – x(s1)) аналогично закону Харди–Вайнберга. Для субпопуляций более высокого уровня i используется обозначение Hs(si), в котором зависимость от значений Hs(s1) неявна. Концентрация Hs(si) находится как среднее значение для {Hs(s1)} в субпопуляциях {s1}, составляющих разбиение si. Когда Hs(s1) = x(s1)(1 – – x(s1))(1 – F(s1)), для вероятности Hs(si) используется обозначение Hs(si|Fs1), явным образом указывающее на вид Hs(s1).

По определению значение Hs для каждой субпопуляции уровня иерархии i выше единицы равно средней величине для значений Hs у всех входящих в si субпопуляций на первом уровне (или на одном из других предшествующих i уровней) согласно (5), а на первом уровне в предположении случайного характера встреч равно x(s1)(1 – x(s1)):

(7)
$\begin{gathered} Hs\left( {{{{\mathbf{s}}}_{1}}} \right) \equiv H{{s}_{0}}\left( {{{{\mathbf{s}}}_{1}}} \right) \equiv x\left( {{{{\mathbf{s}}}_{1}}} \right)\left( {1{\text{ }}--x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right), \\ Hs\left( {{{{\mathbf{s}}}_{i}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {H{{s}_{0}}\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{i}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {x\left( {{{{\mathbf{s}}}_{1}}} \right)\left. {\left( {1{\text{ }}--x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)} \right|{{{\mathbf{s}}}_{i}}} \right\} = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \left( {1{\text{ }}--x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{i}}} \right),\,\,\,\,i = 2,\,\,3, \ldots \,\,. \\ \end{gathered} $

Иначе говоря, полная вероятность случайной встречи (концентрация Hs(si)) в si находится как среднее значение Hs(s1) при выборе наугад субпопуляции s1из si. По формуле полного математического ожидания (5)

$\begin{gathered} Hs({{{\mathbf{s}}}_{j}}) \equiv {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{2}})} \right|{{{\mathbf{s}}}_{j}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{j}}} \right\}, \\ j > i > 1. \\ \end{gathered} $

В частности, значения Hs на соседних уровнях иерархии связывает рекуррентное соотношение

(8)
$\begin{gathered} Hs({{{\mathbf{s}}}_{{i + 1}}}) \equiv {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right\},\,\,{\text{или}} \\ Hs({{{\mathbf{s}}}_{i}}) \equiv {{E}_{{{{{\mathbf{s}}}_{{i - 1}}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{{i - 1}}})} \right|{\mathbf{s}}} \right\}; \\ Hs({{{\mathbf{s}}}_{1}}) \equiv x({{{\mathbf{s}}}_{1}})(1 - x({{{\mathbf{s}}}_{1}})). \\ \end{gathered} $

Отсюда вытекает согласующаяся с (6) запись формулы полного математического ожидания для Hs

(9)
${{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{{i - 1}}}}}}\left. {\left\{ {\left. {Hs({{{\mathbf{s}}}_{{i - 1}}})} \right|{{{\mathbf{s}}}_{i}}} \right\}} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right\}.$

Повторим, что (8) означает, что полная вероятность рассматриваемых встреч в субпопуляции si является средней величиной для вероятностей встреч в субпопуляциях {si –1}, вместе составляющих разбиение si. Выясним зависимость вероятности подобной встречи от фамильной дивергенции между субпопуляциями, рассмотренной нами ранее в первой части [4] в терминах дисперсии концентрации рассматриваемой фамилии.

Результат 4 (фамильный аналог эффекта Валунда). Пусть дана метапопуляции s, разбитая на субпопуляции {s1} с концентрациями {x(s1)} рассматриваемой фамилии в них и с вероятностями рассматриваемых неизонимных встреч {x(s1)(1 – x(s1))}.

Тогда общая (полная) вероятность Hs(s) случайной встречи двух индивидуумов (с фиксированной фамилией и c какой-либо иной при учете порядка фамилий) в наугад выбранной из s субпопуляции s1имеет вид

$\begin{gathered} Hs\left( {\mathbf{s}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Hs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\} = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \left( {1{\text{ }}--x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right) = \\ = x\left( {\mathbf{s}} \right)\left( {1{\text{ }}--x\left( {\mathbf{s}} \right)} \right) - V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right), \\ \end{gathered} $
(10)
$\begin{gathered} V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right) \equiv Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right) = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {{{{\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {\mathbf{s}} \right)} \right)}}^{2}}} Pr\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right). \\ \end{gathered} $

Здесь Vsbetw(x(s1|s)) обозначает межгрупповую дисперсию концентраций {x(s1|s)} рассматриваемой фамилии в субпопуляциях (группах) {s1}, составляющих разбиение метапопуляции s; Pr(s1|s) дает вероятность случайного выбора субпопуляции s1из метапопуляции s.

Иным образом общую (полную) вероятность Hs(s) можно представить как

$\begin{gathered} Hs({\mathbf{s}}) = x({\mathbf{s}})(1 - x({\mathbf{s}}))\left( {1 - \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}))}}{{x({\mathbf{s}})(1 - x({\mathbf{s}}))}}} \right) = \\ = x({\mathbf{s}})(1 - x({\mathbf{s}}))(1 - Fs({\mathbf{s}})), \\ \end{gathered} $
(11)
$Fs({\mathbf{s}}) \equiv \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}))}}{{x({\mathbf{s}})(1 - x({\mathbf{s}}))}} = \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}))}}{{H{{s}_{0}}({\mathbf{s}})}} \geqslant 0,$

где Fs(s) является фамильным аналогом коэффициента инбридинга С. Райта в популяционной генетике.

Доказательство. Пусть неподразделенная субпопуляция s1 рассматривается как единица наблюдения. Например, в сельском населении это может быть село, а метапопуляция s соответствует, скажем, сельсовету. Дисперсия Vsbetw(x(s1|s)) относится к распределению концентрации заданной фамилии по селам {s1} внутри фиксированного сельсовета s. Данная дисперсия Vsbetw(x(s1|s)) характеризует фамильную дивергенцию сел внутри сельсовета.

Напомним, что для любой случайной величины x выполняется равенство E{x2} = (E{x})2 + V(x), так как V(x) ≡ E{x2} – (E{x})2. Для дальнейшего эту формулу с учетом равенства ${{E}_{{{{{\mathbf{s}}}_{i}}}}}${x(si)|si + 1} = x(si+ 1) удобно представить как

(12)
$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {{{x}^{2}}\left. {({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right\} = {{\left( {{{E}_{{{{{\mathbf{s}}}_{i}}}}}\left\{ {\left. {x({{{\mathbf{s}}}_{i}})} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right\}} \right)}^{2}} + \\ + \,\,Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right)} \right) = {{x}^{2}}({{{\mathbf{s}}}_{{i + 1}}}) + Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right)} \right). \\ \end{gathered} $

Как уже говорилось, для субпопуляции s1 первого уровня иерархии вероятность случайной встречи рассматриваемой пары индивидуумов с учетом их порядка равна x(s1)(1 – x(s1)) подобно закону Харди–Вайнберга в популяционной генетике. Значение Hs(s) для s по определению находится как среднее значение Hs(s1) при случайном выборе s1 из s, т.е.

$Hs\left( {\mathbf{s}} \right) = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Hs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\} = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {x\left( {{{{\mathbf{s}}}_{1}}} \right)\left. {\left( {1 - x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)} \right|{\mathbf{s}}} \right\} = $
$\begin{gathered} = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\} - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {{{x}^{2}}\left. {\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\} = \\ = x\left( {\mathbf{s}} \right) - \left( {Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right) + {{{\left( {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{\mathbf{s}}} \right\}} \right)}}^{2}}} \right) = \\ = x\left( {\mathbf{s}} \right)\left( {1 - x\left( {\mathbf{s}} \right)} \right) - Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right) \\ \end{gathered} $

согласно (12). Очевидно, данное выражение Hs(s) можно переписать с использованием коэффициента фамильного инбридинга как x(s)(1 – x(s))(1 – – Fs(s)), т.е. формула (11) верна. ◀

Согласно доказанному результату в метапопуляции s, разбитой на несколько неподразделенных субпопуляций {s1}, в среднем вероятность указанной встречи в субпопуляции s1 из s меньше на величину межгрупповой дисперсии Vs(x(s1|s)), чем вероятность независимых сочетаний фамилий двух индивидуумов во всей метапопуляции s. Эта формула является практически полным аналогом эффекта Валунда в популяционной генетике (см., например, [1]). Чем больше фамильная дивергенция субпопуляций {s1}, тем меньше общая вероятность Hs(s).

Изложенное показывает важность дисперсии распределения концентрации рассматриваемой фамилии по субпопуляциям для анализа их дивергенции. Это вызывает интерес к изучению компонентов дисперсии концентрации. К данному случаю приложимо правило сложения дисперсий, которое в нашей ситуации выглядит следующим образом.

Замечание 5 (правило сложения дисперсий). Пусть метапопуляция s разбита на субпопуляции {s2}, каждая из которых состоит из соответствующих неподразделенных групп {s1}, являющихся единицами наблюдения с концентрациями {x(s1)} рассматриваемой фамилии в них.

Тогда общая (полная) дисперсия Vstot(x(s1|s)) распределения концентрации фамилии по единицам наблюдения {s1} во всей метапопуляции s равна сумме межгрупповой дисперсии Vsbetw(x(s2|s)), характеризующей дивергенцию концентраций фамилии {x(s2)} между субпопуляциями {s2}, и средней внутригрупповой дисперсии W(x(s1|s2)|s) ≡ ${{E}_{{{{{\mathbf{s}}}_{2}}}}}${Vsin(x(s1|s2))|s}, характеризующей среднюю фамильную дивергенцию концентраций x(s1) субпопуляций {s1} внутри отдельных субпопуляций из множества {s2}:

(13)
$\begin{gathered} V{{s}_{{tot}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right) = V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{2}}} \right|{\mathbf{s}}} \right)} \right) + \\ + \,\,{{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {V{{s}_{{in}}}\left. {\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right|{\mathbf{s}}} \right\}. \\ \end{gathered} $

Доказательство. По определению полная (общая) дисперсия Vstot(x(s1|s)) популяции s равна ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${(x(s1) – – ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${x(s1)|s}|s)2}. Вспомним, что ${{E}_{{{{{\mathbf{s}}}_{2}}}}}${x(s2)|s} = x(s), ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${x(s1)|si} = x(si), т.е. Vstot(x(s1|s)) = ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${(x(s1) – ‒ x(s))2|s}. Представим (x(s1) – x(s))2 в виде

$\begin{gathered} {{\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right) + x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right)}^{2}} = \\ = {{\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)}^{2}} + {{\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right)}^{2}} + \\ + \,\,2\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right). \\ \end{gathered} $

Математическое ожидание правой части равно сумме средних значений ее отдельных слагаемых, которые находим с применением формулы полного математического ожидания (2). При этом учтем, что за знак E можно выносить независящие от усредняемой величины сомножители.

$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {{{{\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)}}^{2}}} \right|{\mathbf{s}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. {{{{\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)}}^{2}}} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right|{\mathbf{s}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {V{{s}_{{in}}}\left. {\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right|{\mathbf{s}}} \right\}, \\ \end{gathered} $

т.е. первое слагаемое равно средней внутригрупповой дисперсии.

Для второго слагаемого находим

$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {{{{\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right)}}^{2}}} \right|{\mathbf{s}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. {{{{\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right)}}^{2}}} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right|{\mathbf{s}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {{{{\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right)}}^{2}}{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. 1 \right|{{{\mathbf{s}}}_{2}}} \right\}} \right|{\mathbf{s}}} \right\} = V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{2}}} \right|{\mathbf{s}}} \right)} \right), \\ \end{gathered} $

т.е. получаем межгрупповую дисперсию.

Наконец, покажем, что среднее значение третьего слагаемого равно нулю:

$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {2\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)\left. {\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right)} \right|{\mathbf{s}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {2\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right) - x\left( {\mathbf{s}} \right)} \right){{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {\left. {\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right|{\mathbf{s}}} \right\} = 0, \\ \end{gathered} $

так как среднее отклонение от средней величины ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${(x(s1) – x(s2))|s2} всегда равняется нулю.

В итоге получаем требуемое выражение для полной дисперсии

$\begin{gathered} V{{s}_{{tot}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{\mathbf{s}}} \right)} \right) = V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{2}}} \right|{\mathbf{s}}} \right)} \right) + \\ + \,\,{{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {V{{s}_{{in}}}\left. {\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right|{\mathbf{s}}} \right\}.\,\,\blacktriangleleft \\ \end{gathered} $

Данное правило приложимо к любой совокупности, разбитой на группы ее элементов, характеризуемых числовым признаком. В частном случае метапопуляции с произвольным количеством уровней иерархии общая дисперсия концентрации фамилии в ней равна сумме межгрупповой дисперсии распределения концентации по субпопуляциям (группам) одного и того же произвольно выбранного уровня k плюс средняя внутригрупповая дисперсия концентраций в них. Скажем, в разбитой на субпопуляции {s1} метапопуляции s = = sm с m уровнями иерархии правило сложения дисперсий выполняется, когда вместо субпопуляций {s2} рассматриваются {sk}:

(14)
$\begin{gathered} V{{s}_{{tot}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{m}}} \right)} \right) = V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{k}}} \right|{{{\mathbf{s}}}_{m}}} \right)} \right) + \\ + \,\,{{E}_{{{{{\mathbf{s}}}_{k}}}}}\left\{ {V{{s}_{{in}}}\left. {\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{k}}} \right)} \right)} \right|{{{\mathbf{s}}}_{m}}} \right\},\,\,\,\,2 < k < m. \\ \end{gathered} $

Выше мы считали, что встречи индивидуумов в субпопуляциях {s1} низшего уровня иерархии (единицах наблюдения) случайны. Благодаря этому Hs(s1) = Hs0(s1) = x(s1)(1 – x(s1)). В реальных исследованиях данное условие может не выполняться (скажем, при существовании скрытой подразделенности в s1 или из-за иных причин), и желательно рассмотреть такую ситуацию, поскольку для нее приведенный аналог результата Валунда неверен.

В абстрактном случае, скажем, в совокупности сталкивающихся частиц нескольких типов предположение о случайной природе их столкновений не гарантировано. Распространенным выражением для вероятности Hs неслучайных столкновений частиц рассматриваемого типа с концентрацией x с иными типами является используемая в популяционной генетике вероятность столкновений вида

$\begin{gathered} Hs = x(1 - x)(1 - Fs) = H{{s}_{0}}(1 - Fs), \\ 0 \leqslant Hs \leqslant 1,\,\,\,\,0 \leqslant \left| {Fs} \right| \leqslant 1. \\ \end{gathered} $

При Fs > 0 происходит своего рода отталкивание, и разноименные частицы сталкиваются реже, чем чисто случайно. Обратим внимание, что здесь неявно предполагается независимость Fs от типа сталкивающихся частиц (в противном случае рассматриваемая вероятность столкновения зависит от концентраций всех типов). В случае только двух типов (рассматриваемого и искусственного объединения всех прочих типов) коэффициент Fs имеет смысл корреляции между сталкивающимися типами.

Следствие 6. Рассмотрим метапопуляцию s2, разбитую на субпопуляции {s1} с концентрациями {x(s1)} носителей рассматриваемой фамилии в них. Пусть вероятность Hs(s1) их встреч в s1с носителями иной фамилии неслучайна и формулируется как

$\begin{gathered} Hs({{{\mathbf{s}}}_{1}}) = x({{{\mathbf{s}}}_{1}})(1 - x({{{\mathbf{s}}}_{1}}))(1 - Fs({{{\mathbf{s}}}_{1}})) = \\ = H{{s}_{0}}({{{\mathbf{s}}}_{1}})(1 - Fs({{{\mathbf{s}}}_{1}})),\,\,\,\,{{{\mathbf{s}}}_{2}} = \{ {{{\mathbf{s}}}_{1}}\} , \\ \end{gathered} $

где Hs0(s1) обозначает вероятность x(s1)(1 – x(s1)) чисто случайной встречи в субпопуляции s1на первом уровне иерархии.

Тогда общая (полная) вероятность Hs(s2|Fs1) рассматриваемой встречи в наугад выбранной из s2субпопуляции s1при независимости концентрации x рассматриваемой фамилии и коэффициента фамильного инбридинга Fs(s1) в субпопуляциях {s1} имеет вид

(15)
$\begin{gathered} Hs\left( {\left. {{{{\mathbf{s}}}_{2}}} \right|F{{s}_{1}}} \right) = \left( {x\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right) - } \right. \\ \left. { - \,\,V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right)\left( {1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {Fs\left. {\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right) \\ V{{s}_{{betw}}}\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right) = Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right) = \\ = \sum\limits_{{{{\mathbf{s}}}_{1}}} {{{{\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right) - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)}}^{2}}} Pr\left( {{{{\mathbf{s}}}_{1}}{\kern 1pt} |{\kern 1pt} {{{\mathbf{s}}}_{2}}} \right). \\ \end{gathered} $

Здесь Vsbetw(x(s1|s2)) обозначает межгрупповую дисперсию распределения концентрации {x(s1|s2)} рассматриваемой фамилии по субпопуляциям (группам) {s1}, составляющим разбиение метапопуляции s2; Pr(s1|s2) дает вероятность случайного выбора субпопуляции s1из метапопуляции s2.

Иным образом общую (полную) вероятность Hs(s2|Fs1) можно представить как

(16)
$\begin{gathered} Hs\left( {\left. {{{{\mathbf{s}}}_{2}}} \right|F{{s}_{1}}} \right) = H{{s}_{0}}\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}))}}{{x({{{\mathbf{s}}}_{2}})(1 - x({{{\mathbf{s}}}_{2}}))}}} \right) \times \\ \times \,\,\left( {1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Fs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right) = H{{s}_{0}}\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - Fs\left( {{{{\mathbf{s}}}_{2}}} \right)} \right) \times \\ \times \,\,\left( {1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Fs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right), \\ Fs\left( {{{{\mathbf{s}}}_{2}}} \right) \equiv \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}))}}{{x({{{\mathbf{s}}}_{2}})(1 - x({{{\mathbf{s}}}_{2}}))}} \geqslant 0, \\ \end{gathered} $

где Fs(s2) является фамильным аналогом случайного коэффициента инбридинга FST, а средний коэффициент фамильного инбридинга ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${Fs(s1)|s2} для субпопуляций {s1} в s2служит аналогом коэффициента FIS неслучайного инбридинга С. Райта в популяционной генетике.

Доказательство. Общая вероятность Hs(s2) рассматриваемых встреч в метапопуляции s2 по определению находится как математическое ожидание для значений Hs(s1) в субпопуляциях {s1}, составляющих разбиение s2:

$\begin{gathered} Hs\left( {{{{\mathbf{s}}}_{2}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {Hs\left. {\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {x\left( {{{{\mathbf{s}}}_{1}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)\left. {\left( {1 - Fs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}. \\ \end{gathered} $

При независимости x и Fs данное выражение равно произведению математических ожиданий сомножителей и

$\begin{gathered} Hs\left( {{{{\mathbf{s}}}_{2}}} \right) = {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {x\left( {{{{\mathbf{s}}}_{1}}} \right)\left. {\left( {1 - x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\} \times \\ \times \,\,{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {1 - Fs\left. {\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\} = x\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right) \times \\ \times \,\,\left( {1 - Fs\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)(1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {Fs\left. {\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}. \\ \end{gathered} $

Здесь коэффициент фамильного инбридинга Fs(s2) характеризует подразделенность метапопуляции s2 (фамильную дивергенцию субпопуляций s1 внутри s2) и по определению равен отношению дисперсии распределения концентрации фамилии по субпопуляциям {s1} к вероятности случайных встреч Hs0(s2) ≡ x(s2)(1 – x(s2)) в s2:

$\begin{gathered} Fs\left( {{{{\mathbf{s}}}_{2}}} \right) \equiv \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}))}}{{x({{{\mathbf{s}}}_{2}})(1 - x({{{\mathbf{s}}}_{2}}))}} = \frac{{V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}))}}{{H{{s}_{0}}({{{\mathbf{s}}}_{2}})}}, \\ H{{s}_{0}}\left( {{{{\mathbf{s}}}_{2}}} \right) \equiv x\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right). \\ \end{gathered} $

Он соответствует коэффициенту случайного инбридинга FST в популяционной генетике, отражающему генетическую дивергенцию между субпопуляциями.

Коэффициент ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${Fs(s1)|s2} является аналогом неслучайного коэффициента инбридинга FIS в генетике популяций и отражает усредненное нарушение случайного характера встреч (закона Харди–Вайнберга) внутри субпопуляций, служащих единицей наблюдения. ◀

Повторим, что здесь неявно предполагается независимость Fs(s1) и концентрации x рассматриваемой фамилии. Коэффициенты {Fs(s1)} для субпопуляций первого уровня заданы изначально и по ним находятся средние коэффициенты неслучайного фамильного инбридинга для субпопуляций более высоких уровней. Для единообразия записи вероятности встреч метапопуляции s2 можно использовать коэффициент общего инбридинга FIT в s2. В популяционной генетике он учитывает одновременно влияние как дивергенции между субпопуляциями, так и нарушения закона Харди–Вайнберга внутри них на гетерозиготность H метапопуляции s2 (и на корреляцию между гаметами генотипа):

$\begin{gathered} H\left( {{{{\mathbf{s}}}_{2}}} \right) = x\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)\left( {1{\text{ }}--{{F}_{{IT}}}} \right), \\ 1 - {{F}_{{IT}}} \equiv \left( {1 - {{F}_{{ST}}}} \right)\left( {1 - {{F}_{{IS}}}} \right). \\ \end{gathered} $

РАЗЛОЖЕНИЕ ПО УРОВНЯМ ИЕРАРХИИ ВЕРОЯТНОСТИ ВСТРЕЧ ПРИ ИЕРАРХИЧЕСКОЙ ПОДРАЗДЕЛЕННОСТИ МЕТАПОПУЛЯЦИИ

Рассмотренный случай подразделенности метапопуляции на неподразделенные группы первого уровня можно считать простейшим случаем иерархической структуры. Теперь обратимся к подразделенной метапопуляции sm с произвольным количеством уровней иерархии m. Если s = sm, то дисперсию распределения концентрации по субпопуляциям {sk} на уровне k в метапопуляции sm обозначим как Vsbetw(x(sk|sm)), k < m. В частности, Vs(x(s1|sm)) = Vsbetw(x(s1|sm)), причем Vsbetw(x(s1|sm)) одновременно является общей дисперсией Vstot (x(s1|sm)) для распределения концентрации фамилии по всем субпопуляциям, служащим единицей наблюдения.

Проанализируем выражение для вероятности встреч Hs в метапопуляции в зависимости от количества ее уровней иерархии m. Дадим решение этой задачи при независимости x и Fs путем последовательного увеличения m и индукции.

В предшествующем следствии мы нашли, что при фиксированной метапопуляции s = s2

$\begin{gathered} Hs\left( {{{{\mathbf{s}}}_{2}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Hs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\} = \\ = \,\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right)\, - \,Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right)\left( {1\, - \,{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Fs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right). \\ \end{gathered} $

Теперь зафиксируем s3, подставим в рекуррентное уравнение (8), определяющее Hs(s3), найденное значение Hs(s2), учтем эффект Валунда (11) и заменим математическое ожидание произведения произведением математических ожиданий сомножителей в силу предполагаемой независимости x и Fs:

$\begin{gathered} Hs\left( {\left. {{{{\mathbf{s}}}_{3}}} \right|F{{s}_{1}}} \right) \equiv {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {\left. {Hs\left( {{{{\mathbf{s}}}_{2}}} \right)} \right|{{{\mathbf{s}}}_{3}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {\left. {\left( {x\left( {{{{\mathbf{s}}}_{2}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{2}}} \right)} \right) - Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right)} \right|{{{\mathbf{s}}}_{3}}} \right\} \\ \left( {1 - {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{1}}}}}\left. {\left\{ {Fs\left. {\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{2}}} \right\}} \right|{{{\mathbf{s}}}_{3}}} \right\}} \right) = \\ = \left( {x\left( {{{{\mathbf{s}}}_{3}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{3}}} \right)} \right) - Vs\left( {x\left( {\left. {{{{\mathbf{s}}}_{2}}} \right|{{{\mathbf{s}}}_{3}}} \right)} \right) - } \right. \\ \left. { - {{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {Vs\left. {\left( {x\left( {\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{2}}} \right)} \right)} \right|{{{\mathbf{s}}}_{3}}} \right\}} \right)\left( {1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Fs\left( {{{{\mathbf{s}}}_{1}}} \right)} \right|{{{\mathbf{s}}}_{3}}} \right\}} \right). \\ \end{gathered} $

Ремарка 7. Заметим, что Vs(x(s2|s3)) можно записать как ${{E}_{{{{{\mathbf{s}}}_{3}}}}}${Vs(x(s2|s3))|s3}, поскольку метапопуляция s3 единственна. Поэтому

${{E}_{{{{{\mathbf{s}}}_{2}}}}}\left\{ {Hs(x\left( {\left. {{{s}_{2}}} \right|{{s}_{3}}} \right)} \right\} = \left( {x\left( {{{{\mathbf{s}}}_{3}}} \right)\left( {1 - x\left( {{{{\mathbf{s}}}_{3}}} \right)} \right) - \sum\limits_{i = 1}^2 {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left\{ {Vs\left. {\left( {x\left( {\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}} \right)} \right)} \right|{{{\mathbf{s}}}_{3}}} \right\}} \right)\left( {1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Fs\left( {x\left( {{{{\mathbf{s}}}_{1}}} \right)} \right.} \right|{{{\mathbf{s}}}_{3}}} \right\}} \right).$

Найденное выражение для Hs(s3) и ремарка подсказывают, что для субпопуляций j‑го уровня

$Hs({{{\mathbf{s}}}_{j}}) = \left( {x({{{\mathbf{s}}}_{j}})(1 - x({{{\mathbf{s}}}_{j}})) - \sum\limits_{i = 1}^{j - 1} {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left\{ {Vs(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{j}}} \right\}} \right)\left( {1 - {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Fs({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{j}}} \right\}} \right).$

С другой стороны, поскольку Hs(sj) = (x(sj)(1 – – x(sj)) – Vs(x(s1|sj)))(1 – ${{E}_{{{{{\mathbf{s}}}_{1}}}}}${Fs(s1)|sj}) согласно фамильному аналогу эффекта Валунда (11), где роль метапопуляции s играет sj, то одновременно мы видим разложение дисперсии Vs(x(s1|sj)) на сумму членов ${{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}${Vs(x(si|s+ 1))|sj}.

Результат 8. Рассмотрим иерархически подразделенную метапопуляцию sm с уровнями иерархии i = 1, 2, …, m. Положим, что в ее субпопуляциях {s1} концентрации интересующей фамилии равны {x(s1)} и встречи индивидуумов происходят случайно с вероятностями {Hs(s1) = Hs0(s1) ≡ x(s1)(1 – x(s1))}.

Пусть из sm наугад выбрана субпопуляция s1первого уровня. Тогда вероятность Hs(sm) встречи в s1пары индивидуумов с интересующей фамилией и с какой-нибудь иной с учетом их порядка (полная вероятность встречи) допускает следующее разложение:

(17)
$\begin{gathered} Hs({{{\mathbf{s}}}_{m}}) \equiv {{E}_{{{{{\mathbf{s}}}_{1}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{1}})} \right|{{{\mathbf{s}}}_{m}}} \right\} = \\ = x({{{\mathbf{s}}}_{m}})(1 - x({{{\mathbf{s}}}_{m}})) - V{{s}_{{betw}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{m}})) = \\ = H{{s}_{0}}({{{\mathbf{s}}}_{m}}) - \sum\limits_{i = 1}^{m - 1} {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left\{ {V{{s}_{{in}}}(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{m}}} \right\}. \\ \end{gathered} $

Таким образом, общая (полная) вероятность Hs(sm) равна разности между значением вероятности Hs0(sm) ≡ x(sm)(1 – x(sm)) случайной встречи такой пары во всей метапопуляции sm и разложением межгрупповой дисперсии Vsbetw(x(s1|sm)) на средние внутригрупповые дисперсии ${{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}${Vsin(x(si|si + 1))|sm}, соответствующие отдельным уровням иерархии i.

Доказательство. Воспользуемся индукцией. Выше мы видели, что разложение (17) для Hs(sm) верно при некотором m. Покажем, что тогда оно справедливо для Hs(sm+ 1). Согласно рекуррентному уравнению (8)

$\begin{gathered} Hs({{{\mathbf{s}}}_{{m + 1}}}) \equiv {{E}_{{{{{\mathbf{s}}}_{m}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{m}})} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{m}}}}}\left\{ {x({{{\mathbf{s}}}_{m}})(1 - x({{{\mathbf{s}}}_{m}})) - } \right. \\ \left. { - \,\,\sum\limits_{i = 1}^{m - 1} {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left. {\left\{ {V{{s}_{{in}}}(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{i}}_{{ + 1}}))} \right|{{{\mathbf{s}}}_{m}}} \right\}} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\} = \\ \end{gathered} $
$\begin{gathered} = {{E}_{{{{{\mathbf{s}}}_{m}}}}}\left\{ {x({{{\mathbf{s}}}_{m}})(1 - x({{{\mathbf{s}}}_{m}}))} \right\} - \\ - \,\,{{E}_{{{{{\mathbf{s}}}_{m}}}}}\left\{ {\sum\limits_{i = 1}^{m - 1} {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left. {\left\{ {V{{s}_{{in}}}(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{i}}_{{ + 1}}))} \right|{{{\mathbf{s}}}_{m}}} \right\}} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\} = \\ \end{gathered} $
$\begin{gathered} = x({{{\mathbf{s}}}_{{m + 1}}})(1 - x({{{\mathbf{s}}}_{{m + 1}}})) - Vs(x(\left. {{{{\mathbf{s}}}_{m}}} \right|{{{\mathbf{s}}}_{{m + 1}}})) - \hfill \\ - \,\,\sum\limits_{i = 1}^{m - 1} {{{E}_{{{{{\mathbf{s}}}_{m}}}}}} \left\{ {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}\left. {\left\{ {V{{s}_{{in}}}(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{m}}} \right\}} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\}. \hfill \\ \end{gathered} $

Рассмотрим отдельное слагаемое в сумме по i. Согласно (6), где роль i играет i + 1, а T(si+ 1) = = Vsin(x(si|si+ 1), имеем

$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{m}}}}}\left\{ {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}\left. {\left\{ {V{{s}_{{in}}}(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{m}}} \right\}} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\} = \\ = {{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}\left\{ {V{{s}_{{in}}}\left. {(x(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\}. \\ \end{gathered} $

Поскольку в соответствии со сделанной ремаркой Vsin(x(sm|sm+ 1)) = ${{E}_{{{{{\mathbf{s}}}_{{m + 1}}}}}}${Vsin(x(sm|sm+ 1))|sm+ 1}, этот член можно включить в рассматриваемую сумму, верхний предел которой увеличится на единицу и станет равен (m – 1) + 1 = m:

$\begin{gathered} Hs({{{\mathbf{s}}}_{{m + 1}}}) \equiv {{E}_{{{{{\mathbf{s}}}_{m}}}}}\left\{ {\left. {Hs({{{\mathbf{s}}}_{m}})} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\} = x({{{\mathbf{s}}}_{{m + 1}}})(1 - x({{{\mathbf{s}}}_{{m + 1}}})) - \\ - \,\,\sum\limits_{i = 1}^m {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left\{ {Vs(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{{m + 1}}}} \right\}. \\ \end{gathered} $

Полученное выражение совпадает с (17), если вместо m поставить m + 1. ◀

Из (17) отчетливо видно, что вероятность Hs для уровня выше первого меньше значения, соответствующего случайным встречам, и чем больше сумма средних внутригрупповых дисперсий, тем больше увеличивается указанный разрыв. Полученное разложение является некоторого рода обобщением эффекта Валунда [10]. Заметим, что здесь не требуется независимость концентрации фамилии и коэффициента фамильного инбридинга.

Следствие 9. В иерархически подразделенной метапопуляции sm с m уровнями иерархии полная дисперсия концентрации фамилии Vstot(x(s1|sm)) допускает разложение

(18)
$\begin{gathered} V{{s}_{{tot}}}(x(\left. {{{{\mathbf{s}}}_{1}}} \right|{{{\mathbf{s}}}_{m}})) = \sum\limits_{i = 1}^{m - 1} {{{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}} \left\{ {Vs(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{m}}} \right\} = \\ = \sum\limits_{i = 1}^{m - 1} {(Vs(x(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{m}}))} - Vs(x(\left. {{{{\mathbf{s}}}_{{i + 1}}}} \right|{{{\mathbf{s}}}_{m}}))). \\ \end{gathered} $

Доказательство первого равенства содержится в предыдущем результате, т.е. там попутно получено разложение дисперсии, найденное нами ранее в [4] более длинным способом.

Второе равенство вытекает из правила сложения дисперсий (14), согласно которому ${{E}_{{{{{\mathbf{s}}}_{k}}}}}${Vsin(x(sn|sk))|sm} = Vstot(x(sn|sm)) – Vsbetw(x(sk|sm)) ≥ 0. В нашем случае при n = i, k = i + 1

$\begin{gathered} {{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}\left\{ {V{{s}_{{in}}}(x\left. {(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{{i + 1}}}))} \right|{{{\mathbf{s}}}_{m}}} \right\} = Vs(x(\left. {{{{\mathbf{s}}}_{i}}} \right|{{{\mathbf{s}}}_{m}})) - \\ - \,\,Vs(x(\left. {{{{\mathbf{s}}}_{{i + 1}}}} \right|{{{\mathbf{s}}}_{m}})),\,\,\,\,n < k < m. \\ \end{gathered} $

Таким образом, полная дисперсия Vs(x(s1|sm)) равна сумме приращений межгрупповой дисперсии при переходе от уровня i + 1 к предыдущему i. Подобно тому, как пройденный путь складывается из приращений по шагам, так и при суммировании приращений дисперсии по i получим полную дисперсию Vs(x(s1|sm)), поскольку все члены в сумме сокращаются, кроме Vs(x(s1|sm)), а Vs(x(sm|sm)) разумно определить как нуль. ◀

Так как левая часть ${{E}_{{{{{\mathbf{s}}}_{{i + 1}}}}}}${Vs(x(si|si+ 1))|sm} последней формулы неотрицательна (как среднее значение неотрицательной дисперсии), то при переходе к более высокому уровню i + 1 межгрупповая дисперсия (дисперсия концентрации фамилии в субпопуляциях одного и того же уровня) не увеличивается. Это интуитивно ожидается, поскольку при группировке данных разброс значений не возрастает, и дисперсия средних значений для сгруппированных данных не может быть больше дисперсии для исходных данных.

ЗАКЛЮЧЕНИЕ

Пройдемся по основным линиям данной работы – ее мотивации, подходу к анализу, результатам. Интерес к фамильной структуре мотивирован вниманием к генеалогии, родственным связям и др. аспектам, так или иначе связанным с генетикой населения. Настоящая статья ориентирована на популяционно-генетическую сторону изучения распределения фамилий, и эта ориентация приводит к использованию и обобщениям традиционных методов анализа генетической структуры по данным о распределении концентраций маркеров в ряде популяций.

Выбор такого подхода обусловлен тем, что популярные модели процессов выборочного генного дрейфа Райта–Фишера и дрейфа фамилий в популяциях ограниченной численности при стандартных предположениях совпадают (отличаются лишь интенсивностью, см. [2, 3]). Следовательно, это должно позволить при соответствующих поправках экстраполировать результаты одного из них на ожидаемые результаты для другого. Природа процессов дрейфа с динамикой генетического и фамильного состава популяции обусловлена случайными колебаниями количества потомков у отдельных индивидуумов.

Если у некоторого родителя-мужчины больше сыновей, чем в среднем, то в следующем поколении будет больше носителей его фамилии и его генов. На популяционном уровне это приводит к случайным колебаниям фамильного и генетического составов популяции от поколения к поколению, представляющим сущность процессов дрейфа. Оба процесса приводят к дивергенции родственных популяций (генетической и фамильной). Очевидно, требуется развивать методы, характеризующие дивергенцию популяций (неоднородность системы популяций в целом) для типичных для человека популяционных структур.

Данные по фамилиям часто доступны в иерархически структурированном виде, например в соответствии с административно-территориальной подразделенностью. В качестве показателей дивергенции служат межгрупповая дисперсия распределения концентрации (кодоминантного аллеля, фамилии) в группах (субпопуляциях), нарушения закона Харди–Вайнберга с эффектом Валунда, коэффициент случайного инбридинга. Рассмотрены фамильные аналоги этих показателей и даны их обобщения для иерархически подразделенной метапопуляции с произвольным количеством уровней иерархии. Данные обобщения вычислительно универсальны в том смысле, что не зависят от характера разбиений метапопуляции на каждом из уровней, от типа микроэволюционного процесса, приведшего к текущему состоянию метапопуляции, от существования миграций и пр. Неоднородность (дивергенция) в иерархических системах характеризуется алгоритмически одинаковыми показателями, различающимися между системами количественно.

В настоящей статье в качестве основного показателя фамильной дивергенции субпопуляций рассматривается общая вероятность встреч (столкновений) Hs лиц с разными фамилиями (аналог концентрации гетерозигот), понимаемая как вероятность встречи в выбранной наугад субпопуляции, единицы наблюдения, из рассматриваемой метапопуляции с иерархической структурой субпопуляций. Получено разложение Hs по уровням иерархии, обобщающее эффект Валунда в популяционной генетике. Общая вероятность неизонимных встреч в иерархически подразделенной метапопуляции меньше вероятности случайных встреч в ней на сумму средних внутригрупповых дисперсий концентрации фамилии, соответствующих отдельным уровням.

Настоящая статья не содержит каких-либо исследований с использованием в качестве объекта животных.

Настоящая статья не содержит каких-либо исследований с участием в качестве объекта людей.

Список литературы

  1. Ли Ч. Введение в популяционную генетику. М.: Мир, 1978. 555 с.

  2. Пасеков В.П. К анализу случайных процессов изонимии. I. Структура изонимии // Генетика. 2021. Т. 57. № 10. С. 1194–1204. https://doi.org/10.31857/S001667582110009X

  3. Пасеков В.П. К анализу случайных процессов изонимии. II. Динамика дивергенции популяций // Генетика. 2021. Т 57. № 11. С. 1318–1329. https://doi.org/10.31857/S0016675821110114

  4. Пасеков В.П. Описание дивергенции субпопуляций в иерархической системе при анализе изонимии. I. Дисперсия как показатель дивергенции // Генетика. 2022. Т. 58. № 6. С. 713–727.

  5. Wright S. The interpretation of population structure by F statistics with special regard to systems of mating // Evolution. 1965. V. 19. P. 395–420.

  6. Гинтер Е.К., Зинченко P.A., Ельчинова Г.И. и др. Роль факторов популяционной динамики в распространении наследственной патологии в российских популяциях // Мед. генетика. 2004. Т. 3. № 12. С. 548–555.

  7. Ревазов А.А., Парадеева Г.М., Русакова Г.И. Пригодность русских фамилий в качестве квазигенетического маркера // Генетика. 1986. Т. 22. № 4. С. 699–703.

  8. Crow J.F., Mange A.P. Measurement of inbreeding from the frequency of marriages between persons of the same surname // Social Biology. 1982. V. 29. № 1/2. P. 101–105.

  9. Lasker W.G. Surnames and Genetic Structure. Cambridge: Cambr. Univ. Press, 1985. 148 p.

  10. Сорокина И.Н., Чурносов М.И., Балтуцкая И.В. и др. Антропогенетическое изучение населения центральной России. М.: Изд-во РАМН, 2014. 336 с.

Дополнительные материалы отсутствуют.