Когда смотришь на график цены, кажется, что всё очевидно: вот тренд, вот откат, вот точка входа. Но стоит перевести взгляд с визуального шума на язык цифр, и картина либо проясняется окончательно, либо рушится. Статистика здесь работает как диагностический инструмент — она показывает, что за движениями цены стоит не хаос, а измеримая структура. И если вы всерьёз анализируете котировки, доходности или волатильность, без трёх базовых понятий — среднего, дисперсии и корреляции — вы рискуете принимать решения, опираясь на иллюзию понимания, а не на данные.
Разберём эти метрики на реальных рыночных примерах: как считать, что они означают именно в финансовом контексте и где аналитики чаще всего ошибаются.
Почему статистика особенно важна в рыночных данных
Рынок почти никогда не ведёт себя ровно. Цена может расти, падать, резко ускоряться, долго стоять в боковике. Если смотреть только на график, легко переоценить случайные колебания и недооценить закономерности.
Статистика нужна, чтобы:
- оценивать типичное поведение инструмента;
- сравнивать активы между собой не на глаз, а численно;
- измерять риск в воспроизводимых величинах;
- проверять торговые гипотезы до того, как запускать их в реальные деньги;
- понимать, насколько надёжны сигналы модели, а не просто «работает или нет».
Один из самых частых промахов, который я вижу у начинающих аналитиков — работа напрямую с ценами. Цена может быть 100, 1000 или 10 000 — это разные масштабы, и статистически такие ряды сравнивать неудобно. Гораздо продуктивнее работать с доходностями: они приводят данные к единому виду и лучше отражают именно динамику изменений, а не абсолютный уровень.
Что такое доходность и почему её считают первой
Доходность показывает, насколько изменилась цена за период. Это первая трансформация, которую я делаю с любым ценовым рядом перед статистическим анализом. Без неё большинство метрик будут просто некорректными.
Простая доходность
Если акция стоила 100 рублей, а потом стала 105 рублей, простая доходность за период:
\[
r = \frac{105 — 100}{100} = 0{,}05 = 5\%
\]
Простая доходность интуитивно понятна и удобна для отчётности, но в моделировании у неё есть недостаток: она несимметрична. Падение на 50% требует роста на 100% для восстановления — это свойство может искажать восприятие риска.
Логарифмическая доходность
В аналитике и количественных задачах я практически всегда перехожу на лог-доходности:
\[
r_t = \ln\left(\frac{P_t}{P_{t-1}}\right)
\]
Они удобны тем, что:
- лучше складываются по времени — лог-доходность за неделю это просто сумма дневных;
- часто ближе к нормальному распределению, что важно для многих моделей;
- менее чувствительны к масштабу — рост с 10 до 11 и с 1000 до 1100 дают одинаковую лог-доходность.
Практический вывод
Если вы анализируете рынок статистически, почти всегда начинайте с доходностей, а не с цен. Я не раз видел, как среднее, посчитанное по ценам, создавало иллюзию стабильности там, где её не было. Особенно это опасно на растущем тренде, когда цены растут, а волатильность доходностей остаётся высокой.
Среднее: что оно показывает на рынке
Среднее — это усреднённое значение ряда. В финансовом контексте чаще всего считают среднюю доходность, и она отвечает на простой вопрос: сколько в среднем приносил инструмент за выбранный период.
Формула среднего
\[
\bar{x} = \frac{1}{n}\sum_{i=1}^{n}x_i
\]
Если у вас есть дневные доходности за 5 дней: 1%, -0,5%, 0,8%, 1,2%, -0,2%, то среднее будет:
\[
\bar{x} = \frac{1 — 0{,}5 + 0{,}8 + 1{,}2 — 0{,}2}{5} = 0{,}46\%
\]
Что означает среднее в рыночных данных
Средняя доходность показывает, какой результат приносил инструмент в среднем за период. Но здесь есть важный нюанс, который я постоянно подсвечиваю студентам:
- среднее не говорит, насколько результат стабильный — оно молчит о просадках;
- одно большое движение может сильно исказить картину — особенно на коротких выборках;
- на коротком горизонте среднее часто шумное и статистически неустойчивое.
Где среднее полезно
- оценка средней дневной доходности актива или стратегии;
- расчёт ожидаемой доходности для бэктеста;
- сравнение инструментов по доходности на единицу времени;
- анализ сезонности — например, средняя доходность по дням недели или месяцам.
Типичная ошибка
Смотреть только на среднюю доходность стратегии и игнорировать просадки и разброс. Стратегия со средней доходностью 0,2% в день может быть либо стабильной, либо крайне рискованной — это покажет только дисперсия. Я встречал стратегии, где средняя дневная доходность выглядела прекрасно, но максимум просадки достигал 40% — и это убивало весь смысл «хорошего среднего».
Дисперсия и стандартное отклонение: как измеряют разброс
Если среднее отвечает на вопрос «какой результат в среднем», то дисперсия отвечает на вопрос «насколько данные гуляют вокруг этого среднего». Это прямой измеритель нестабильности, и в финансах он критически важен.
Формула дисперсии выборки
\[
s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i — \bar{x})^2
\]
Стандартное отклонение — это корень из дисперсии:
\[
s = \sqrt{s^2}
\]
Оно удобнее, потому что выражается в тех же единицах, что и исходные данные — например, в процентах доходности. Дисперсия же даёт квадрат этих единиц, что для интерпретации менее наглядно.
Пример
Допустим, доходности за 5 дней:
- 1,0%
- -0,5%
- 0,8%
- 1,2%
- -0,2%
Среднее равно 0,46%. Дальше смотрим, насколько каждый день отклоняется от этого среднего. Чем сильнее отклонения, тем выше дисперсия и стандартное отклонение. Если в выборку добавить один день с доходностью -4%, стандартное отклонение подскочит значительно — среднее отреагирует слабее, а вот дисперсия «почувствует» выброс мгновенно.
Что это значит на практике
Высокое стандартное отклонение означает:
- большую волатильность — цена активно движется;
- более высокий риск — результат отдельного дня может сильно отличаться от среднего;
- менее предсказуемое поведение ряда;
- потенциально более резкие просадки стратегии.
Низкое стандартное отклонение говорит о более спокойном ряде, но не обязательно о более прибыльном. Бывает актив с нулевой средней доходностью и очень низкой волатильностью — для спекулянта он бесполезен, для хеджирования может быть интересен.
Дисперсия в трейдинге и инвестициях
На рынке дисперсия — это не сухой показатель из учебника, а одна из базовых характеристик риска. Когда я строил свои первые торговые роботы, именно дисперсия доходностей стала первым фильтром: если стандартное отклонение дневной доходности превышало определённый порог, стратегия сразу отправлялась на доработку, даже если среднее было привлекательным.
Где она используется
- в оценке волатильности актива;
- в расчёте риска портфеля — современная портфельная теория построена на ковариациях и дисперсиях;
- в сравнении стратегий — Sharpe ratio, например, это отношение средней доходности к стандартному отклонению;
- в оптимизации аллокации капитала;
- в оценке стабильности модели — если ошибки модели имеют высокую дисперсию, модель нестабильна.
Чем отличается волатильность от дисперсии
На практике волатильностью чаще называют стандартное отклонение доходностей. Формально это не одно и то же — волатильность может оцениваться и другими методами, например через GARCH-модели, но по смыслу они связаны:
- дисперсия показывает квадрат разброса — полезна для математических расчётов;
- стандартное отклонение — более удобная для интерпретации величина, её можно напрямую сравнивать со средней доходностью.
Пример из рыночной практики
Если у двух акций одинаковая средняя доходность, но у одной стандартное отклонение в два раза выше, вторая обычно предпочтительнее для консервативного инвестора. Но если вы спекулянт, высокая волатильность может быть полезна для краткосрочных сделок — большие движения дают больше возможностей для входа и выхода. Так что «высокая дисперсия» не плоха и не хороша сама по себе — всё зависит от задачи.
Корреляция: как понять связь между активами
Корреляция показывает, как два ряда движутся относительно друг друга. Это ключевой инструмент для портфельного анализа и проверки диверсификации. Когда я собираю портфель из нескольких стратегий или активов, первый вопрос, который я задаю — не «какая у каждого доходность», а «как они связаны между собой».
Коэффициент корреляции
Наиболее известен коэффициент Пирсона:
\[
\rho = \frac{\mathrm{cov}(X, Y)}{\sigma_X \sigma_Y}
\]
Он принимает значения от -1 до 1. Это нормированная мера, что делает её очень удобной: можно сравнивать корреляции между совершенно разными инструментами.
Как интерпретировать
- \(1\) — идеальная положительная связь: активы движутся синхронно;
- \(0\) — линейной связи почти нет: движения независимы;
- \(-1\) — идеальная отрицательная связь: когда один растёт, другой падает.
Пример для рынка
Если акции двух компаний из одного сектора часто растут и падают вместе, корреляция между их доходностями будет положительной — обычно в диапазоне 0,5–0,8. Если один актив растёт при падении другого, корреляция может быть отрицательной — классический пример это золото и доллар в определённые периоды.
Таблица: как читать базовые статистические меры
| Показатель | Что показывает | Как интерпретировать на рынке | Частая ошибка |
|---|---|---|---|
| Среднее | Типичный уровень доходности | Ожидаемый средний результат за период | Считать его достаточным для оценки стратегии |
| Дисперсия | Разброс значений | Насколько сильно доходности отклоняются от среднего | Игнорировать риск и нестабильность |
| Стандартное отклонение | Удобная форма разброса | Волатильность доходностей | Путать с доходностью |
| Корреляция | Связь между рядами | Движутся ли активы вместе | Считать корреляцию причиной |
| Ковариация | Совместное изменение | Помогает при расчёте портфельного риска | Трудно сравнивать без нормализации |
Эта таблица — мой стандартный чек-лист при первичном анализе любого нового инструмента или стратегии. Я прохожу по всем пяти метрикам, прежде чем делать какие-либо выводы. Одна метрика в отрыве от остальных почти всегда вводит в заблуждение.
Как считать статистику на рыночных данных пошагово
Приведу логику, которую я использую сам при exploratory-анализе нового датасета:
Шаг 1. Возьмите исторические цены
Для начала нужны закрытия по дням, часам или минутам. Чем выше частота, тем больше шума — на минутных данных стандартное отклонение может быть обманчиво высоким из-за микроструктурных эффектов. Я обычно начинаю с дневных данных, они дают хороший баланс между количеством наблюдений и осмысленностью сигнала.
Шаг 2. Переведите цены в доходности
Лучше использовать доходности, а не сами цены. Если сомневаетесь между простыми и логарифмическими — для первичного анализа разница обычно некритична, но для моделирования я рекомендую лог-доходности.
Шаг 3. Посчитайте среднее
Это даст представление о среднем результате. Но сразу держите в уме, что это лишь одна координата, и без меры разброса она малоинформативна.
Шаг 4. Посчитайте дисперсию и стандартное отклонение
Они покажут, насколько ряд нестабилен. Полезно сравнить стандартное отклонение со средним — если оно в разы больше, среднее статистически неустойчиво.
Шаг 5. Посчитайте корреляцию между активами
Это особенно полезно для портфельного анализа и проверки диверсификации. Стройте корреляционную матрицу — она быстро выявляет кластеры активов, которые движутся вместе.
Шаг 6. Интерпретируйте вместе, а не по отдельности
Один показатель ничего не решает. Средняя доходность без риска бесполезна, а низкий риск без доходности тоже малоинтересен. Всегда смотрите на связку «среднее + стандартное отклонение + корреляция с остальным портфелем».
Практический пример: сравним два актива
Представим два инструмента с одинаковой средней доходностью 0,4% в день.
- Актив A: доходности колеблются слабо, большинство дней приносят от 0,2% до 0,6%.
- Актив B: половина дней в плюсе, половина — с сильными просадками, разброс доходностей от -3% до +4%.
У обоих может быть одинаковое среднее, но:
- у A стандартное отклонение низкое — стратегия на нём будет относительно гладкой;
- у B риск высокий — просадки могут быть глубокими;
- B может быть менее пригоден для стратегии с жёсткими ограничениями по просадке, но потенциально интереснее для краткосрочной спекуляции.
Вывод
Среднее отвечает за «сколько зарабатываем», дисперсия — за «насколько тяжело это зарабатывать». Стратегия с высоким средним и высоким стандартным отклонением — это эмоционально изматывающий путь, даже если итоговый результат математически положительный. Я убеждался в этом не раз на собственных алгоритмах.
Корреляция и портфель: зачем она нужна
Корреляция особенно важна, когда вы собираете портфель. Без её анализа диверсификация может оказаться ложной.
Почему это важно
Если активы сильно коррелируют, они могут падать одновременно. Тогда портфель кажется диверсифицированным только на бумаге — у вас пять разных тикеров, но в кризис все они ведут себя как один. Это классическая ошибка, которую я видел даже у опытных инвесторов.
Простой пример
- Акция банка и индекс финансового сектора часто движутся похоже — корреляция высокая.
- Акции разных отраслей могут быть связаны слабее — например, нефтяная компания и IT-сектор.
- Облигации и акции нередко ведут себя по-разному в стрессовые периоды — это делает их классической парой для диверсификации.
Что искать в анализе
- низкую или отрицательную корреляцию между активами в портфеле — это даёт реальное снижение риска;
- устойчивость корреляции во времени — если корреляция меняет знак каждые полгода, диверсификация ненадёжна;
- отсутствие ложной диверсификации — когда активы юридически разные, но экономически связаны через один фактор риска.
Важные ограничения корреляции
Корреляция — полезный, но не универсальный инструмент. Я часто вижу, как её переоценивают, забывая о нескольких критических ограничениях.
1. Корреляция не означает причинность
Если два ряда движутся вместе, это не значит, что один вызывает другой. Может быть общий драйвер — например, оба актива реагируют на ставку ЦБ. Без причинного анализа корреляция лишь фиксирует синхронность, но не объясняет её.
2. Корреляция может меняться во времени
На спокойном рынке связь одна, в кризис — другая. Для рыночных данных это нормальная ситуация. Я проверял это многократно: корреляция между активами, рассчитанная на бычьем рынке, часто ломается в медвежьем. Особенно это характерно для пар «акции — защитные активы».
3. Линейная корреляция не видит сложные связи
Два актива могут быть связаны нелинейно — например, один реагирует на другой только при экстремальных движениях, а в обычные дни связи нет. Коэффициент Пирсона этого не поймает. Для таких случаев нужны ранговые корреляции или mutual information.
4. Выбросы и редкие события искажают оценку
Один резкий день может изменить картину сильнее, чем кажется. Если в выборку попал день обвала рынка на 5%, корреляция может резко вырасти просто из-за одного наблюдения. Всегда проверяйте устойчивость корреляции к выбросам.
Типовые ошибки новичков
- Анализировать цены вместо доходностей — самая частая и самая dangerous ошибка. Цены нестационарны почти всегда, и статистика по ним некорректна.
- Делать выводы по слишком короткой выборке — 20 дней могут показать паттерн, который исчезнет на 200 днях.
- Игнорировать выбросы — один аномальный день может сместить и среднее, и корреляцию.
- Путать среднюю доходность с надёжностью стратегии — среднее 1% в день при просадках 30% это не «надёжная стратегия».
- Считать высокую корреляцию «плохой» без контекста — для хеджирования высокая корреляция может быть необходима.
- Использовать статистику без проверки распределения и стационарности — если ряд нестационарен, среднее и дисперсия могут не иметь смысла.
Мини-чек-лист для анализа рыночного ряда
- ✅ Данные очищены от пропусков и дублей — битые данные дают битые выводы.
- ✅ Цены преобразованы в доходности — обязательно.
- ✅ Посчитано среднее значение — первый ориентир.
- ✅ Оценены дисперсия и стандартное отклонение — мера риска.
- ✅ Проверена корреляция с другими активами — диверсификация.
- ✅ Сделан вывод не по одному числу, а по набору метрик — только комплексная картина.
- ✅ Учитывается период анализа и рыночный режим — бычий рынок и медвежий дают разную статистику.
Как это использовать в Python
Для практики обычно берут pandas, numpy и matplotlib. Это стандартный стек, который я использую для быстрого прототипирования анализа.
Базовая логика
- Загружаете исторические цены — из CSV, API или базы данных.
- Считаете доходности —
pct_change()или лог-формула. - Строите описательную статистику —
describe()дает быстрый обзор. - Сравниваете активы между собой — попарные корреляции через
corr(). - Проверяете визуально, не расходится ли вывод с графиком — график доходностей часто показывает то, что цифры скрывают.
Пример кода
import pandas as pd
import numpy as np
# Загрузка данных
prices = pd.read_csv('prices.csv', index_col='date', parse_dates=True)
# Доходности
returns = prices['close'].pct_change().dropna()
# Среднее
mean_ret = returns.mean()
# Стандартное отклонение
std_ret = returns.std()
# Корреляция между двумя активами
corr = returns['asset1'].corr(returns['asset2'])
print(f"Средняя доходность: {mean_ret:.4%}")
print(f"Стандартное отклонение: {std_ret:.4%}")
print(f"Корреляция: {corr:.2f}")
Что важно помнить
pct_change()даёт простые доходности — для лог-доходностей используйтеnp.log(prices / prices.shift(1));- корреляцию лучше считать по доходностям, а не по ценам — корреляция цен почти всегда завышена;
- при высокой частоте данных стоит отдельно учитывать микроструктурный шум — на минутных данных он может доминировать над реальным сигналом.
Когда среднее, дисперсия и корреляция недостаточны
Этих трёх метрик хватает для старта, но не для глубокого анализа. Они описывают только первые два момента распределения и линейную связь — а рынок часто устроен сложнее.
Дополнительно часто нужны:
- медиана — устойчива к выбросам, в отличие от среднего;
- асимметрия — показывает, чаще ли бывают сильные падения, чем роста;
- эксцесс — мера «тяжёлых хвостов», критична для оценки вероятности экстремальных событий;
- квантили — VaR строится именно на них;
- максимальная просадка — то, что реально чувствует инвестор;
- Value at Risk — формализованная мера риска;
- автокорреляция — показывает, зависит ли сегодняшняя доходность от вчерашней;
- тесты на стационарность — ADF-тест или KPSS, без них многие модели просто неприменимы.
Это следующий уровень анализа, когда базовые метрики уже понятны и вы готовы копать глубже.
Вывод
Среднее, дисперсия и корреляция — это фундамент статистического анализа рыночных данных. Среднее показывает типичный результат, дисперсия измеряет разброс и риск, а корреляция помогает понять связь между активами и оценить диверсификацию. Но их настоящая сила раскрывается только в комбинации: ни одна из этих метрик не работает соло.
Если вы хотите работать с рынком профессионально, начинайте не с поиска «идеального сигнала», а с понимания статистики данных. Именно она показывает, где есть закономерность, а где вы видите случайный шум. За годы практики я выработал простое правило: прежде чем запускать любую модель, потратьте час на базовую статистику — среднее, дисперсию, корреляции. Этот час сэкономит вам недели на отладку стратегии, которая изначально была обречена из-за неправильного понимания данных.
FAQ
Что важнее для рынка: среднее или дисперсия?
Оба показателя важны. Среднее показывает доходность, а дисперсия — риск и нестабильность. Без дисперсии среднее почти ничего не говорит о качестве стратегии. В моей практике я всегда смотрю на них вместе, обычно через Sharpe ratio или его модификации — это сразу даёт соотношение доходности к риску.
Почему корреляцию лучше считать по доходностям, а не по ценам?
Потому что цены зависят от масштаба и уровня актива. Две акции могут иметь корреляцию цен близкую к 1 просто потому, что обе растут на бычьем рынке, но их доходности при этом могут быть слабо связаны. Доходности лучше отражают именно динамику движения и очищены от тренда.
Можно ли использовать корреляцию для прогноза?
Можно как один из признаков, но нельзя полагаться только на неё. Корреляция меняется во времени и не объясняет причинность. Если вы строите прогнозную модель, корреляция может подсказать, какие активы стоит рассматривать как предикторы, но сам прогноз должен опираться на более устойчивые закономерности.
Какой показатель лучше всего подходит для сравнения активов?
Для первичного сравнения обычно смотрят вместе на среднюю доходность, стандартное отклонение и корреляцию с другими инструментами. Я часто добавляю Sharpe ratio — он нормализует доходность на риск и позволяет сравнивать активы с разной волатильностью на единой шкале.
Почему средняя доходность может ввести в заблуждение?
Потому что она не показывает разброс. Два ряда с одинаковым средним могут иметь совершенно разный риск и разное поведение в просадках. Более того, среднее чувствительно к выбросам — один экстремальный день может создать иллюзию высокой доходности там, где её нет в обычные дни.
