Sunday, August 02, 2026

Часть 1 Приложение А. Пространства $L_p$ (Under the Hood): От топологических хаков к квадратичной гладкости

Text rendered via Dual-Core compilation (Human author + LLM co-processor).
Англоязычная версия данной заметки доступна здесь https://alex-ber.medium.com/9c213a0e3dfb.


См. также:
Часть 1: Метод Ньютона в R. От эвристики к формальной верификации (Kernel-Level)
Часть 1 Приложение А. Пространства $L_p$ (Under the Hood): От топологических хаков к квадратичной гладкости
Часть 1 Приложение B. Другой пример Loss function на примере кросс-энтропии
Часть 1 Приложение C. Анатомия квадратичной сходимости: Доказательство теоремы Канторовича в $R$
Часть 2: Метод Ньютона в $R^n$. От Гессиана к Аппаратным Лимитам
Часть 3: Метод Ньютона для Векторных полей. Матрица Якоби, Гато и Архитектура Backpropogation
Бонусная Часть 4: Метод Ньютона в бесконечномерных пространствах (Level 99)


Для начала стоит уточнить терминологию: в машинном обучении часто путают глобальные метрики качества (которые оценивают бизнес-результат работы модели для человека) и Loss-функции (функции потерь, которые алгоритм дифференцирует и оптимизирует «под капотом»). Если алгоритм предсказывает числа — допустим, цены на недвижимость (задача регрессии) — нам нужно измерить общую «величину промаха» между вектором предсказаний $\hat{y}$ и вектором наблюдаемых истинных значений (ground truth) $y$.

Для измерения таких расстояний математики используют понятие нормы. Самый простой и знакомый всем пример нормы — это обычный модуль числа (абсолютная величина). Любая норма автоматически порождает метрику (расстояние между векторами $x$ и $y$ вычисляется как $\|x - y\|$), что позволяет строго измерять расстояния. (Обратное, в общем случае, неверно: не всякая метрика порождается нормой).

В многомерных пространствах эта концепция обобщается до целого семейства $L_p$-норм. Общая формула для вектора $x = (x_1, \dots, x_n)$ выглядит так: $\|x\|_p = \left( \sum_{i=1}^n |x_i|^p \right)^{1/p}$. Компоненты этого вектора могут жить как в привычном вещественном пространстве $\mathbb{R}^n$, так и в комплексном $\mathbb{C}^n$. В обоих случаях формула работает одинаково безупречно, а $|x_i|$ выступает как универсальный модуль (абсолютная величина) числа.

Ниже есть продолжение.

Эта формула строго выполняет все аксиомы математической нормы (включая неравенство треугольника и однородность) только на интервале $p \in [1, +\infty]$. В зависимости от выбора параметра $p$ происходят самые интересные математические мутации:

  • $p=1$: $\|x\|_1 = \sum_{i=1}^n |x_i|$. Это так называемое «Манхэттенское расстояние» (или $L_1$-норма), где путь измеряется строго по сетке координат. Геометрически единичный шар (множество точек, где $\|x\|_1 \le 1$) в 2D выглядит как ромб (или квадрат, повернутый на 45 градусов). В машинном обучении на ней базируется метрика MAE и $L_1$-регуляризация (Lasso), создающая разреженность признаков. А самое изящное происходит, если мы сожмем наше пространство до одного измерения $\mathbb{R}^n=\mathbb{R}^1=\mathbb{R}$ или $\mathbb{C}^n=\mathbb{C}^1=\mathbb{C}$, то есть подставим в общую формулу $\|x\|_p = \left( \sum_{i=1}^n |x_i|^p \right)^{1/p}$, при $p=1$, $n=1$ она превращается в $\|x_1\|_1 = \sum_{i=1}^1 |x_i| = |x_1|$. Т.е. мы получили на вещественных числах $\mathbb{R}$ или комплексных числах $\mathbb{C}$ метрику $\|x\| = |x|$. В зависимости от этого $|x_i|$ — это либо модуль (абсолютная величина) вещественного либо модуль комплексного числа. В частности получаем, что обычный школьный модуль действительного (или комплексного) числа — это просто частный случай многомерной $L_p$-нормы!
  • $p=2$: $\|x\|_2 = \sqrt{\sum_{i=1}^n |x_i|^2}$. Это классическая евклидова норма. Это обычная школьная норма, соответствующая расстоянию по прямой линии (по теореме Пифагора), как если бы мы приложили к пространству физическую линейку. Геометрически её единичный шар в 2D — это идеальный круг (или сфера в 3D). В машинном обучении на её основе строится $L_2$-регуляризация (Ridge), которая штрафует модель за слишком большие веса, заставляя их равномерно уменьшаться.
  • $0 < p < 1$: по мере убывания $p$ на интервале $p \in (0, 1)$ ломается выпуклость единичного шара и перестает работать неравенство треугольника. Докажем это: возьмем базисные векторы $x = (1, 0)$ и $y = (0, 1)$ в $\mathbb{R}^2$. Их $L_p$-нормы равны единице: $\|x\|_p = \|y\|_p = 1$. Однако норма их суммы $\|x+y\|_p = \|(1, 1)\|_p = (1^p + 1^p)^{1/p} = 2^{1/p}$. Поскольку $0 < p < 1$, показатель степени $1/p > 1$, следовательно $2^{1/p} > 2$. Мы получаем $\|x+y\|_p > \|x\|_p + \|y\|_p$, что напрямую нарушает свойство неравенства треугольника.

    Из этого же примера вытекает потеря выпуклости: по определению выпуклого множества середина отрезка между векторами $\frac{x+y}{2} = (0.5, 0.5)$ должна лежать внутри единичного шара. Давайте посчитаем её норму: $\|(0.5, 0.5)\|_p = (0.5^p + 0.5^p)^{1/p} = (2 \cdot 0.5^p)^{1/p} = 2^{1/p} \cdot 0.5 = 2^{1/p} \cdot 2^{-1} = 2^{1/p - 1}$.

    Так как $p < 1$, то дробь $1/p > 1$. Следовательно, показатель степени $1/p - 1 > 0$. Любое число больше единицы (в нашем случае двойка) в положительной степени дает результат строго больше $1$. А значит, норма середины отрезка строго больше $1$. Точка вываливается за границы единичного шара, что геометрически превращает его из выпуклой фигуры во вдавленный четырехконечный «астероид».
  • $p \to \infty$: Формула схлопывается в предел, который дает максимальную норму (норму Чебышева): $\|x\|_\infty = \max_i |x_i|$. Вывод этого предела математически изящен: если мы вынесем максимальный по модулю элемент $M = \max_i |x_i|$ за скобки, общая формула примет вид $M \cdot \left( \sum_{i=1}^n \left( \frac{|x_i|}{M} \right)^p \right)^{1/p}$. При $p \to \infty$ все дроби для элементов, меньших $M$, устремятся к нулю. Слагаемые, равные максимуму, дадут единицы. Сумма внутри скобок превратится в константу $k$ (количество максимальных элементов вектора). Поскольку $\lim_{p \to \infty} k^{1/p}=1$, вся конструкция схлопывается ровно в $M$. Таким образом, эта норма оценивает вектор исключительно по его самому большому элементу, игнорируя остальные. Геометрически единичный шар для этой нормы в 2D превращается в ровный квадрат (или куб в 3D), стороны которого строго параллельны осям координат. Если сжать пространство до одного измерения ($n=1$), то $\|x\|_\infty = \max_1 |x_1| = |x_1|$, что снова безупречно возвращает нас к обычному модулю числа.
  • $p \to 0$: Это самая парадоксальная точка, так как математически задать норму здесь невозможно. Если попытаться взять строгий алгебраический предел самой суммы при $p \to 0$, то для любого ненулевого числа $\lim_{p \to 0} |x_i|^p = 1$, а для нуля $\lim_{p \to 0} 0^p = 0$. Соответственно, $\lim_{p \to 0} \sum |x_i|^p$ работает просто как счетчик ненулевых элементов вектора. Если рассмотреть это в одномерном пространстве ($n=1$), то «норма» $\|x\|_0$ равна $1$ для любого ненулевого $x$ (даже миллионного) и $0$ для нулевого. И хотя строго математически это не является нормой (нарушается аксиома однородности при умножении на скаляр), в машинном обучении именно этот алгебраический предел называют «$L_0$-нормой», так как он исторически крайне полезен при регуляризации, когда алгоритму нужно занулить лишние веса и сжать модель.

    Однако в строгом функциональном анализе под $L_0$ понимают другое пространство. Там невозможность использовать классическую формулу обходят не через алгебраический предел суммы единиц, а задавая искусственную метрику, порождающую топологию сходимости по мере. Вывод этой метрики строится через искусственное ограничение роста слагаемых: $d(x, y) = \sum_{i=1}^n \min(|x_i - y_i|, 1)$. Если мы вернемся к одномерному случаю ($n=1$), расстояние до нуля будет вычисляться как $d(x, 0) = \min(|x|, 1)$ — то есть привычный модуль числа, но жестко «обрезанный» единицей. Это превращает наше пространство в так называемое F-пространство. (Заметим, что до идеального Гильбертова пространства — где есть скалярное произведение, углы между векторами и работает вся классическая квантовая механика — нашему пространству как до луны, ведь Гильбертовым является только $L_2$ в том смысле как мы определили выше. Но к безумным свойствам этих пространств мы детально вернемся в бонусной четвертой части).
  • $-\infty < p < 0$: Этот интервал имеет огромный смысл в статистике и алгебре, где данная конструкция известна как обобщенное среднее (или среднее степенное). Например, если подставить $p = -1$ (и домножить на $n$), мы получим классическое гармоническое среднее, которое незаменимо при расчете сопротивления параллельных цепей в физике или средних центив в финансах.

    Однако в контексте геометрии пространств здесь полностью рушатся базовые свойства метрики из-за деления на ноль. Чтобы сделать это предельно прозрачным, давайте введем замену: пусть $p = -q$, где $q > 0$. Перепишем общую формулу, избавляясь от отрицательной степени по правилу $x^{-a} = 1/x^a$:

    $\|x\|_{-q} = \left( \sum_{i=1}^n |x_i|^{-q} \right)^{-1/q} = \frac{1}{\left( \sum_{i=1}^n \frac{1}{|x_i|^q} \right)^{1/q}}$

    Теперь возьмем вектор, у которого есть хотя бы один нулевой элемент, но сам вектор не является нулевым. Например, $x = (0, 500)$ в двумерном пространстве. Подставляем его в нашу переписанную формулу:
    $\|x\|_{-q} = \frac{1}{\left( \frac{1}{0^q} + \frac{1}{500^q} \right)^{1/q}}$

    Первое слагаемое в знаменателе содержит фатальное деление на ноль. В терминах пределов, дробь $\frac{1}{0}$ устремляется в бесконечность ($+\infty$). Таким образом, сумма внутри скобок в знаменателе становится бесконечно огромной. Извлечение корня из бесконечности оставляет её бесконечностью, и мы приходим к финальному виду:
    $\|x\|_{-q} \to \frac{1}{+\infty} = 0$

    Это катастрофа для концепции расстояния. Норма вектора $(0, 500)$ оказалась равна нулю! Нарушена самая фундаментальная аксиома невырожденности (норма может быть равна нулю только у вектора, сплошь состоящего из нулей). Из-за единственной нулевой координаты вся геометрия пространства аннигилируется.
  • $p \to -\infty$: (Математическая пасхалка). Если $p \to +\infty$ выдает максимальный элемент вектора, то логично проверить систему на прочность и устремить параметр в минус бесконечность. Алгебраический предел $\lim_{p \to -\infty} \|x\|_p$ (при условии, что все $x_i \neq 0$) строго выдаст минимальный по модулю элемент: $\min_i |x_i|$. Вывод этого предела аналогичен случаю с плюсом: только мы выносим за скобки минимальный по модулю элемент $m = \min_i |x_i|$. Формула принимает вид $m \cdot \left( \sum_{i=1}^n \left( \frac{|x_i|}{m} \right)^p \right)^{1/p}$. Так как $p \to -\infty$, для всех элементов, которые строго больше $m$ (то есть значение дроби $q = \frac{|x_i|}{m} > 1$), предел слагаемого равен нулю: $\lim_{p \to -\infty} q^p = 0$. Останутся только слагаемые, соответствующие минимуму (где основание дроби в точности равно $1$, а предел $\lim_{p \to -\infty} 1^p = 1$). Сумма внутри скобок в пределе устремится к константе $k$ (числу минимальных элементов вектора), а поскольку предел внешней степени $\lim_{p \to -\infty} k^{1/p} = 1$, вся конструкция элегантно схлопывается в $m$.

    Однако, как и следовало ожидать из разбора предыдущего пункта, этот «хак» окончательно ломает математическую архитектуру нормы. Нарушается фундаментальная аксиома невырожденности (System Security): норма вектора должна быть равна нулю только если сам вектор состоит из нулей. Но в случае $\min_i |x_i|$ достаточно, чтобы хотя бы один элемент вектора был равен нулю, и вся конструкция схлопнется в ноль, даже если остальные элементы равны миллионам (в терминах предела — произойдет то самое деление на ноль под суммой, которое мы разобрали выше).

    Важное уточнение: если в парадоксальной точке $p \to 0$ математикам удалось спасти топологию пространства, искусственно задав метрику $d(x, y) = \sum_{i=1}^n \min(|x_i - y_i|, 1)$, то при $p \to -\infty$ этот трюк не пройдет. Ни эта метрика, ни какая-либо другая не способны спасти данную конструкцию. Именно поэтому ни в функциональном анализе, ни в ML предел при $p \to -\infty$ не имеет абсолютно никакого практического смысла, однако он безупречно демонстрирует эстетическую симметрию математики на крайних полюсах.

Чтобы оценить итоговое качество предсказаний модели, нам нужно превратить весь вектор ошибок $E = y - \hat{y}$ (разницу между истиной и предсказаниями) в одно итоговое число. Мы могли бы опереться на $L_1$-норму и получить среднее абсолютное отклонение (MAE): $MAE = \frac{1}{n} \|E\|_1 = \frac{1}{n} \sum |y_i - \hat{y}_i|$. Мы также могли бы использовать $L_2$-норму «как есть» (что приводит к метрике RMSE с её громоздким внешним корнем). Однако в большинстве задач регрессии стандартом де-факто выступает Loss-функция MSE (Mean Squared Error, среднеквадратичная ошибка). Она берёт за основу $L_2$-норму вектора ошибок, но возводит её в квадрат (и усредняет по $n$): $MSE = \frac{1}{n} \|E\|_2^2 = \frac{1}{n} \sum_{i=1}^n (y_i - \hat{y}_i)^2$.

Здесь важно сделать математическое уточнение: MSE определена ИСКЛЮЧИТЕЛЬНО для $L_2$-нормы. Вы не можете взять произвольную $L_p$-норму (например, $L_3$), возвести её в квадрат и назвать это «среднеквадратичной ошибкой». Само понятие MSE и её математический смысл намертво привязаны только к квадрату евклидова расстояния.

Почему алгоритмы предпочитают оптимизировать именно квадрат $L_2$-нормы (MSE), а не базовую $L_2$-норму или MAE? У этого есть две железобетонные архитектурные причины. Во-первых, возведение в квадрат элегантно уничтожает огромный внешний корень из формулы $L_2$. Сама по себе чистая $L_2$-норма в точке абсолютного нуля недифференцируема: из-за наличия квадратного корня, производная которого $1/(2\sqrt{x})$ при приближении к нулю улетает в бесконечность, геометрически она образует конус, и в его вершине возникает «излом», не позволяющий посчитать градиент. А вот без корня функция становится идеально гладкой многомерной параболой, максимально удобной для градиентного спуска.

Во-вторых, квадрат радикально меняет бизнес-логику штрафов. В отличие от MAE, которая бьет алгоритм линейно и с одинаковой силой за любые неточности (из-за чего модель может бесконечно «дрожать» вокруг минимума), MSE прощает алгоритму множество мелких отклонений. Так как производная параболы пропорциональна самой ошибке, по мере приближения к идеалу градиент затухает, и модель плавно «паркуется» в точке оптимума. Более того, оптимизация MSE строго математически эквивалентна предположению, что шум в наших данных имеет нормальное (гауссовское) распределение.

В то же время MSE агрессивно, по параболе, штрафует за крупные промахи (outliers). В реальности эта чувствительность является главным недостатком MSE — всего один аномальный выброс в «грязных» данных сгенерирует гигантский градиент и утащит за собой веса всей модели. Чтобы решить эту проблему и взять лучшее от обоих миров (квадратичную мягкую парковку у нуля от MSE и линейную защиту от выбросов от MAE), алгоритмы часто используют компромиссную функцию потерь — Loss Huber (функцию Хьюбера), которая ведёт себя как гладкая парабола при малых ошибках и превращается в прямую линию при больших.


No comments:

Post a Comment