Σ Сигма

Математика современного ИИ — сюжетами

Σ

Сигма

Математика современного ИИ — сюжетами. Одна страница — один сюжет: живой пример, формула и виджет, который можно тянуть руками.

Что здесь есть

17 сюжетов. Каждый — самодостаточная страница: с чего всё началось, какая за этим математика и что из неё следует. Никаких глав: читать можно с любой, не подряд.

19 живых виджетов. Не картинки: тяните ползунок, точку или матрицу — пересчёт мгновенный, прямо в браузере. Резонанс моста, разделение голосов, внимание трансформера, спуск в овраге.

ИИ-ассистент по всему тексту. Кнопка справа на любой странице. Ищет по сайту, цитирует определения и теоремы с точной ссылкой и считает на Python прямо на странице.

Все сюжеты

Деления на главы нет: каждая страница — законченный сюжет, который читается сам по себе. Порядок ниже — рекомендованный, но заходить можно с любого места.

раскрыть всё свернуть всё

Ландшафт функции потерь и парадоксы высокой размерности сюжет
Веса сети — точка в $\mathbb{R}^d$, $d$ до миллиардов. Проецируем потери на случайную плоскость и видим «карту высот»: ResNet без skip-connections хаотичен, с ними — гладкая долина. Почти все критические точки оказываются сёдлами. Виджет: крутите проекцию мышью.
Зигзаг в овраге: откуда взялись momentum и Adam сюжет
Овраг функции потерь вытянут: вдоль дна почти плоско, поперёк круто. Обычный градиентный спуск от этого зигзагит и почти не движется вперёд — momentum и Adam придуманы ровно против этого. Виджет: тяните точку старта и смотрите, как расходятся три траектории.
Численные методы оптимизации
Метод касательных: вместо линейной аппроксимации — квадратичная, минимум параболы и есть следующий шаг. Сходимость квадратичная — число точных знаков удваивается за итерацию. Отсюда — Ньютон–Канторович и квазиньютоновские методы.
Глобальная оптимизация: от муравьёв до температуры в LLM сюжет
Когда градиента нет или ям много: имитация отжига с формулой Метрополиса $\exp(-\Delta E/T)$, роевой интеллект, муравьиные феромоны, генетика против коммивояжёра. Та же «температура» $T$ всплывает в softmax больших моделей. Виджет: ловите глобальный минимум.
Многомерное шкалирование и проклятие размерности для безградиентных методов сюжет
Дана только таблица расстояний между 34 городами Европы — ни одной координаты. Метод раскладывает города на плоскости, и проступает узнаваемая карта. Здесь же видно, почему большие модели учат градиентом: чем больше городов, тем безнадёжнее отстаёт безградиентный метод.
Феномен двойного спуска сюжет
Классика обещает U-образную ошибку. Белкин, 2019: за порогом интерполяции $p=n$ ошибка снова падает — двойной спуск. При $p\gg n$ выбирается решение минимальной нормы, и это даёт гладкость. Виджет: степень полинома от 1 до 80.
Шум превращает оптимизацию в генерацию сюжет
Добавьте к каждому шагу градиентного спуска немного шума — и алгоритм перестаёт искать одно дно, а начинает гулять по всему ландшафту по распределению $\propto e^{-f(x)/T}$. Отсюда прямая дорога к диффузионным моделям. Виджет: крутите температуру.
Оптимальный транспорт и расстояние Вассерштейна сюжет
Сколько песка с какого склада на какую стройку везти, чтобы суммарный путь был минимален. Задача Монжа–Канторовича, расстояние Вассерштейна и почему оно меряет разницу распределений лучше, чем KL. Виджет: тяните кучи и смотрите план перевозки.
Когда арифметика лжёт: числа с плавающей точкой
Числа с плавающей точкой врут предсказуемо: машинное эпсилон, катастрофическое сокращение, потеря значащих цифр. Почему $1-\cos x$ обнуляется и как это чинить.
Сингулярное разложение SVD: главный фокус линейной алгебры
SVD — главный фокус линейной алгебры: любая матрица есть поворот, растяжение и снова поворот. История от Бельтрами и Жордана до современных численных алгоритмов.
Лучшее малоранговое приближение: теорема Эккарта–Янга
Теорема Эккарта–Янга: лучшее приближение матрицы матрицей меньшего ранга — это просто обрезанное SVD. Отсюда сжатие изображений, рекомендательные системы и LoRA.
Eigenfaces: как алгоритм узнаёт лицо
Классика 1991 года: лицо раскладывается по «собственным лицам», и для узнавания достаточно нескольких десятков коэффициентов вместо тысяч пикселей.
PCA и Eigenfaces сюжет
Фотография лица — вектор из 4096 пикселей, но лица живут на тонком многообразии. PCA = собственное разложение ковариации; 95% вариации Olivetti описывают ~123 компоненты. Виджет: двигайте число компонент, смотрите, как лицо собирается.
PageRank: как Google нашёл порядок в Интернете
Как Google упорядочил Интернет: матрица переходов, демпфирующий множитель, степенной метод. Разбор на игрушечном вебе из шести страниц с кодом.
Собственные значения: от PageRank до шатающихся мостов сюжет
Одно уравнение $Av=\lambda v$ объясняет ранжирование Google и крах моста Такома. PageRank — собственный вектор при $\lambda=1$; мост — совпадение частоты ветра с собственной частотой. Виджет: поймайте резонанс сами.
ICA и задача коктейльной вечеринки сюжет
Три микрофона, три голоса, каждый слышит смесь $x=As$. PCA делает компоненты некоррелированными, ICA — независимыми: ищем максимально негауссовы направления. Очистка ЭЭГ, fMRI, рыночные факторы. Виджет: разберите смесь на слух.
Word2Vec: слова как векторы сюжет
Каждое слово — вектор; слова с похожим контекстом оказываются рядом. Семантика становится геометрией: король − мужчина + женщина ≈ королева. Виджет: арифметика смыслов прямо в браузере.
Внимание: как трансформер решает, на что смотреть сюжет
Следующий шаг после Word2Vec: слово не просто лежит в пространстве, а активно смотрит на соседей. Близость $q\cdot k^{\top}/\sqrt{d_k}$, softmax превращает её в веса. Виджет: тяните токены и смотрите, куда потекло внимание.
БПФ как умножение на матрицу: от спектра звука до Shazam сюжет
ДПФ — умножение на унитарную матрицу из корней единицы; БПФ факторизует её в $\log_2 n$ разреженных «бабочек». Shazam хеширует пики спектрограммы в отпечаток и ищет по миллионам треков. Виджет: разложите два тона.
Когда нейросеть устойчива: оценки Липшицевости
Оценка липшицевости сети как произведение норм слоёв: откуда берётся чувствительность к состязательным примерам и почему её так трудно ограничить.
Простейшие примеры задач анализа данных. Принцип максимума правдоподобия
Опрос на втором туре выборов, асимптотика Фишера и Ле Кама, доверительные интервалы через Чебышёва и ЦПТ, оценка площади методом Монте-Карло и теорема Гаусса о нормальности шума.
Линейная регрессия и метод наименьших квадратов
МНК как максимум правдоподобия при гауссовом шуме. Два исторических примера: третий закон Кеплера по данным Тихо Браге и ускорение свободного падения по данным Галилея.
Закон Кеплера из таблиц Тихо Браге сюжет
Браге двадцать один год записывал положения планет, Кеплер два десятилетия вытаскивал из этих таблиц закон руками. Сегодня те же шесть точек дают показатель 1,4999632 при точном 3/2 — десятью строками кода.
Тяжёлые хвосты сюжет
Средняя зарплата в баре — 60 тысяч, заходит Илон Маск, и «средняя» становится миллиард. Одно редкое огромное значение перевешивает тысячу обычных: где среднее теряет смысл и чем его заменять.
Задача классификации и нейронные сети
MNIST и UCI Digits, чем классификация отличается от регрессии, полносвязная сеть и кривые потерь, теоремы об универсальной аппроксимации, свёртки, градиентный спуск и обратное распространение.
Свёртка: скользящее окно, из которого выросли CNN сюжет
Размыть фото, найти края, услышать эхо — за всем этим одна операция. Ядро скользит вдоль сигнала и в каждой точке считает взвешенную сумму. Виджет: нарисуйте сигнал и подберите ядро.
Задачи обучения без учителя
Задача Netflix и восстановление матрицы малого ранга, автокодировщики и их связь с PCA, эмбеддинги, сиамские сети и контрастивное обучение — всё через один язык SVD.
k-средних: как машина находит кластеры сама сюжет
Облако точек без единой подсказки — и алгоритм сам разбивает его на группы. Самый наглядный пример обучения без учителя. Виджет: кликайте точки и тяните центроиды, ячейки Вороного перестраиваются на лету.
Как искусственный интеллект меняет мир
AlphaGo, революция трансформеров и ChatGPT, законы скейлинга в формулах, AlphaFold и Нобель-2024, рассуждения во время инференса, исчерпание данных и меняющийся ландшафт профессий.
Кнопка «Спросить ИИ» есть на любой странице: ассистент знает весь текст сайта. Можно спросить определение, попросить пример, построить график или разобрать формулу. Попробуйте:
Наверх