Разум машин
Как из математики, данных и кремния рождается искусственный интеллект.
Полный путеводитель для тех, кто хочет разобраться по-настоящему: что такое ИИ и что им не является, как он устроен внутри, кто и где его создаёт, какие у него сложности и куда всё это движется. Без магии и без паники — с чертежами, схемами и живыми примерами.
Как читать эту книгу
Искусственный интеллект за несколько лет превратился из темы научной фантастики в технологию, которая пишет тексты, рисует картины, ставит диагнозы и водит автомобили. Вокруг него — шум: одни обещают рай, другие пророчат конец света, третьи продают курсы. Эта книга — попытка спокойно и честно объяснить, что на самом деле происходит: как эти системы устроены, откуда взялись, кто их делает и почему с ними столько сложностей.
Книга построена как настоящий учебник — от простого к сложному. Но части достаточно самостоятельны: если вам интересна только техника — идите в Часть 3, если только этика и риски — в Часть 5. В интерактивной версии слева открыто оглавление, а вверху идёт полоса прогресса чтения; в PDF навигацию дают страница «Содержание», закладки и приложение «Предметный указатель».
Книга снабжена практикумом с заданиями и вопросами для самопроверки, приложением «Источники» со ссылками на первоисточники и предметным указателем; материал актуален на 2026 год. Уровень книги честнее описать так: она доводит читателя с нуля до уверенного концептуального понимания — как всё устроено и почему. Чтобы после неё самому обучать модели, нужен отдельный технический практикум с математикой и кодом; куда идти дальше — в приложении «Что читать».
Мы намеренно объясняем сложные вещи через аналогии и схемы, а не через формулы. Там, где математика всё же нужна, она даётся минимально и с переводом на человеческий язык. Каждую главу завершает блок «В двух словах» — короткая выжимка, к которой удобно возвращаться.
Определения
Ключевые термины вынесены в цветные плашки — их удобно находить взглядом и запоминать.
Схемы
Механику работы показывают чертежи и диаграммы, а не только слова. Смотрите на них внимательно.
Врезки
История, предостережения и примеры вынесены в цветные врезки, чтобы не рвать основную нить.
Итоги
«В двух словах» в конце каждой главы — быстрый способ повторить и не потеряться.
◆ Договоримся о словах
Мы будем свободно пользоваться словом «ИИ», хотя строго говоря, современные системы — это не «разум», а очень мощные статистические машины. Держите это в голове: за впечатляющим поведением стоит не сознание, а математика на огромных данных. Именно эту математику мы и разберём.
◆ О числах, источниках и актуальности
Издание обновлено к 2026 году. Числовые и эмпирические утверждения (стоимость обучения моделей, объёмы вычислений, доли рынка чипов, прогнозы AGI, статистика автоматизации, результаты исследований) снабжены пометкой «источник» или ссылкой на приложение «Источники»; грубые оценки помечены как порядок величины. Технологии и оценки меняются быстро — для важных решений сверяйтесь с первоисточниками.
Содержание
Часть первая
Что такое искусственный интеллект
Прежде чем разбирать, как ИИ устроен и кто его делает, договоримся о главном: что мы вообще называем интеллектом, чем «узкий» ИИ отличается от «общего», и почему половина споров об ИИ — это спор о словах.
Что такое интеллект и что такое искусственный интеллект
Прежде чем строить разум из кремния, стоит понять, что мы вообще пытаемся воспроизвести. Слово «интеллект» кажется очевидным — пока не попробуешь его определить. А «искусственный интеллект» ускользает ещё хитрее: чуть машина освоит что-то трудное — мы тут же перестаём считать это интеллектом.
Представьте, что вас попросили дать определение слову «жизнь». Вы начнёте перечислять: живое дышит, растёт, размножается, реагирует на среду. И почти сразу упрётесь в исключения. Вирус размножается, но не дышит. Мул живой, но бесплоден. Кристалл растёт, но не жив. Биологи спорят о границах живого до сих пор — и это не мешает биологии быть точной наукой. С интеллектом ровно та же история. Мы узнаём его, когда видим, но зажать его в одну формулу не выходит. Эта глава — про то, как учёные всё-таки очертили контур понятия и как из него выросла целая инженерная дисциплина.
Что такое интеллект
Начнём с интуиции. Умным мы называем того, кто справляется с новым. Не того, кто вызубрил таблицу умножения, а того, кто, попав в незнакомую ситуацию, соображает, что делать. Ребёнок, впервые увидевший качели, за пару минут осваивает раскачивание. Путешественник в чужом городе без языка находит дорогу к вокзалу по жестам и указателям. Врач по набору симптомов, которых нет ни в одном учебнике в такой комбинации, ставит верный диагноз. Общее здесь — способность достигать целей в разнообразных, заранее не оговорённых условиях.
Именно эту интуицию в 2007 году попробовали сжать в одну строку исследователи Шейн Легг и Маркус Хаттер. Они перелопатили десятки определений интеллекта — из психологии, философии, информатики — и выпарили общий остаток. Вышло сухо: интеллект есть мера способности агента достигать целей в широком диапазоне сред. Сухо, но плотно: каждое слово здесь держит вес. Разберём по частям.
Интеллект (по Леггу и Хаттеру)
Мера способности агента достигать своих целей в широком диапазоне сред. Ключевых слов три: агент (тот, кто действует), цели (есть к чему стремиться) и широкий диапазон сред (не одна задача, а множество непохожих).
Слово «агент» означает, что интеллект проявляется в действии, а не в созерцании. Слово «цели» — что интеллект всегда к чему-то направлен: без задачи измерять нечего. А главное здесь — «широкий диапазон сред». Калькулятор безупречно достигает цели «сложить два числа», но проваливается везде, кроме арифметики. Поэтому калькулятор мы умным не зовём. Человек же худо-бедно справляется с готовкой, разговором, ориентированием, игрой и сотней других дел — и именно эта широта делает его интеллект интеллектом.
Из этой широты вытекают два свойства, без которых интеллект немыслим. Первое — обучение (learning): способность извлекать из опыта то, что пригодится завтра. Второе — обобщение (generalization): способность переносить усвоенное на ситуации, которые в опыте не встречались. Ребёнок, увидевший трёх-четырёх собак, узнаёт собаку и в породе, которую видит впервые. Он не запомнил всех собак мира — он уловил, что делает собаку собакой. Обобщение — это, пожалуй, самая суть интеллекта: не помнить ответы, а понимать закономерность, которая эти ответы порождает.
Эту разницу знает каждый, кто сдавал экзамены. Один студент вызубрил ответы на билеты — и плывёт, стоит преподавателю чуть переиначить вопрос. Другой разобрался в предмете — и отвечает даже на то, чего в билетах не было. Первый запомнил, второй обобщил. Забегая вперёд: ровно эта развилка мучает и машины. Модель, которая слишком старательно «зазубрила» обучающие примеры и не научилась видеть за ними закономерность, называется переобученной — и на новых данных она так же беспомощна, как зубрила перед каверзным вопросом. Мы ещё вернёмся к этой ловушке; пока запомните, что цель обучения — не пятёрка за знакомый билет, а уверенный ответ на незнакомый.
◆ Ключевое
Память — это ещё не интеллект. Умение хранить ответы отличается от умения выводить их. Настоящая проверка ума — не «что ты знаешь», а «как ты справишься с тем, чего не знал».
Почему единого определения нет
Если интуиция такая ясная, почему учёные не договорились об одной формуле? Причин несколько, и они поучительны.
Во-первых, интеллект — не одна способность, а созвездие разных. Психолог различает вербальный, пространственный, эмоциональный, социальный интеллект; у людей они развиты неравномерно. Шахматный гроссмейстер может теряться в бытовом разговоре, а блестящий переговорщик — не уметь читать чертёж. Единая шкала «умнее — глупее» огрубляет эту картину до неузнаваемости.
Во-вторых, определение зависит от того, зачем оно нужно. Философа волнует, стоит ли за поведением понимание и сознание. Инженера — только результат: решает система задачу или нет. Это разные вопросы, и ответы на них не обязаны совпадать. Знаменитая колкость приписывается голландскому информатику Эдсгеру Дейкстре.
«Вопрос, может ли компьютер думать, не более интересен, чем вопрос, может ли подводная лодка плавать».Эдсгер Дейкстра, информатик
Смысл афоризма глубже, чем кажется. Подлодка «плавает» иначе, чем рыба, — и это никого не смущает. Возможно, машина будет «мыслить» иначе, чем мозг, и спорить о том, настоящее ли это мышление, так же бесплодно, как спорить о плавании субмарины. Для инженера важно, что она движется под водой. Для науки об ИИ важно, что система достигает целей.
В-третьих, планка плавает вместе с прогрессом. Сто лет назад умение мгновенно перемножать шестизначные числа считалось признаком выдающегося ума. Сегодня это делает копеечный чип, и мы не зовём его гением. О том, почему так происходит, — чуть ниже, в разговоре об «эффекте ИИ».
Что такое искусственный интеллект
Раз с интеллектом всё так зыбко, к искусственному интеллекту зайдём с чёрного хода — по-инженерному, без философии. Вот определение, которого мы держимся в этой книге.
Искусственный интеллект (Artificial Intelligence, AI)
Создание вычислительных систем, которые выполняют задачи, требующие — когда их делает человек — того, что мы называем интеллектом: восприятия, рассуждения, обучения, планирования, понимания языка, принятия решений в неопределённости.
Тут напрашивается вопрос: а чем такая система отличается от любой другой программы? Калькулятор ведь тоже «выполняет задачу». Граница и правда размыта — и это нормально, чёткой стены здесь нет. Ориентир такой: обычную программу человек расписывает по шагам («сложи, потом умножь, потом выведи результат»), а от ИИ мы ждём, что он сам нащупает способ решения там, где расписать шаги заранее нельзя, — узнать лицо, перевести фразу, оценить риск по анкете. Чем меньше в системе заранее продиктованного человеком и чем больше добытого ею самой, тем охотнее мы зовём её искусственным интеллектом. Слово «интеллект» здесь — про способ, а не про величие.
Термин появился на свет в конкретный момент. Словосочетание artificial intelligence использовано в заявке Джона Маккарти и коллег от 31 августа 1955 года; Дартмутский семинар состоялся летом 1956 года. В заявке было дерзко сказано, что за лето группа исследователей продвинется в том, чтобы «заставить машины использовать язык, формировать абстракции и понятия, решать задачи, ныне подвластные только людям». Лето прошло, задача не решилась — но название прижилось и дало имя целой науке.
⌛ Из истории
Ещё за шесть лет до Дартмута, в 1950-м, британский математик Алан Тьюринг в статье «Вычислительные машины и разум» предложил обойти спор об определениях. Вместо вопроса «может ли машина мыслить?» он предложил игру в имитацию: если в переписке человек не отличает машину от человека, стоит признать за ней разумное поведение. Это знаменитый тест Тьюринга (Turing test) — первая попытка сделать вопрос о машинном разуме проверяемым, а не спорным.
А само «искусственный интеллект» — это два слова с двумя разными смыслами, и путать их не надо. В первом смысле ИИ — это область знания: раздел информатики, набор методов, конференций, учебников, лабораторий. В этом смысле «он занимается ИИ» значит «он работает в этой дисциплине». Во втором смысле ИИ — это артефакт: конкретная созданная система, которая что-то делает. «В этом приложении есть ИИ» значит, что внутри работает такая система. Область производит артефакты, как физика производит не электроны, а знание о них и приборы, которые ими пользуются.
Как же устроен типичный современный артефакт ИИ внутри? Чаще всего — по одной и той же схеме. Система не программируется правилами вручную, а обучается на данных: ей показывают множество примеров, она подстраивает внутренние параметры так, чтобы улавливать закономерность, и после этого способна выдавать ответы на новых, невиданных примерах. Запомните этот конвейер. Вокруг него крутится почти вся современная область.
Но не всякий ИИ обучается на данных. Исторически первые системы работали иначе — на жёстких правилах, которые в них закладывал программист. И оба подхода — не враги, а полюса одной шкалы, вдоль которой располагаются реальные системы.
Эффект ИИ: ускользающая цель
Теперь — про самый коварный парадокс области. Он объясняет, почему разговоры об ИИ вечно кажутся то восторженными, то разочарованными.
Наблюдение простое: как только задачу удаётся решить машине, её тут же перестают считать искусственным интеллектом. Пока компьютер не умел играть в шахматы — шахматы были вершиной машинного разума. В 1997-м система Deep Blue обыграла чемпиона мира Гарри Каспарова — и почти сразу зазвучало: «Ну, это же просто перебор ходов, никакого интеллекта, грубая сила». Распознавание речи, автоматический перевод, поиск лиц на фото, рекомендации фильмов — каждая из этих технологий когда-то была передним краем ИИ, а теперь это «просто приложение», «просто алгоритм». Явление назвали эффектом ИИ (AI effect).
✕ Заблуждение
«Настоящего ИИ пока нет — всё, что уже работает, это просто алгоритмы». Это и есть эффект ИИ в чистом виде. Планка «настоящего» отодвигается ровно на то, что ещё не сделано, поэтому ИИ по определению всегда будет казаться делом будущего.
Программисту Ларри Теслеру приписывают ироничную «теорему»: интеллект — это всё то, что машины ещё не научились делать. Звучит как шутка, но за ней стоит реальный механизм нашего восприятия. Пока мы не понимаем, как задача решается, она выглядит загадочной и «умной». Как только механизм вскрыт и разложен на шаги, магия испаряется — остаётся «просто вычисление». Мы бессознательно резервируем слово «интеллект» за непонятым.
Оглянитесь на собственное утро. Телефон узнал вас в лицо, почта отсеяла спам, навигатор объехал пробку, переводчик снял языковой барьер, музыкальный сервис подсунул ровно ту песню. Двадцать-тридцать лет назад каждая из этих штук потянула бы на доклад на конференции по ИИ. Сегодня — фон, бытовая мелочь, которую не замечаешь, пока она не сломается. Эффект ИИ не делает эти системы глупее; он делает нас невнимательнее к тому, что уже сбылось. И это, к слову, повод для скромной гордости за инженеров: лучший признак зрелой технологии — что её перестают замечать.
У эффекта есть практическое следствие, важное для всей книги. Не стоит спрашивать «это уже настоящий ИИ или ещё нет?» — этот вопрос обречён вечно получать ответ «ещё нет». Продуктивнее спрашивать иначе: какие именно задачи система решает, насколько надёжно, в каком диапазоне условий и где проходит граница её возможностей. Эти вопросы имеют проверяемые ответы — и именно на них устроена вся содержательная часть разговора о машинном разуме. К ним мы и будем возвращаться главу за главой.
- Интеллект удобно понимать как способность достигать целей в широком диапазоне сред; его сердцевина — обучение из опыта и обобщение на новое, а не хранение готовых ответов.
- Единого определения интеллекта нет: это созвездие разных способностей, планка меняется со временем, а философа и инженера в нём волнуют разные вопросы.
- ИИ — это и область знания (раздел информатики), и артефакт (конкретная работающая система); термин использован в заявке Маккарти и коллег 1955 года к Дартмутскому семинару 1956 года.
- Реальные системы располагаются на спектре от жёстких правил до обучения на данных; современный ИИ чаще обучается на примерах по конвейеру «данные → обучение → модель → предсказание».
- Эффект ИИ: решённую задачу перестают считать интеллектом. Полезнее спрашивать не «настоящий ли это ИИ», а что, насколько надёжно и в каких границах система умеет.
Узкий, общий и сверхинтеллект: ANI, AGI, ASI
Весь искусственный интеллект, который окружает нас сегодня, — узкий: блестящий в одном деле и беспомощный за его пределами. Общий и сверхинтеллект пока живут в чертежах и спорах. Разобраться в этих трёх ступенях — значит перестать путать реальный ИИ с обещаниями фантастики.
Когда в новостях говорят «искусственный интеллект», в голове у читателя нередко всплывает образ из кино — думающая машина, которая рассуждает обо всём, имеет собственные желания и вот-вот превзойдёт человека. А в реальности «ИИ» может означать алгоритм, который всего лишь отличает кошку от собаки на фотографии. Между этими двумя картинами — пропасть, и чтобы не спотыкаться о неё в каждом разговоре, исследователи разделили ИИ на три уровня по широте способностей. Эту рамку в 2014 году сделал общеупотребимой философ Ник Бостром в книге «Сверхинтеллект».
Три ступени: ANI, AGI, ASI
Три уровня отличаются не тем, насколько хорошо система решает задачу, а тем, сколь широк круг задач, которые ей вообще под силу.
ANI — узкий ИИ (Artificial Narrow Intelligence)
Система, мастерски решающая одну задачу или узкий класс задач, но не переносящая эти умения на что-то принципиально другое. Весь существующий сегодня ИИ — узкий.
AGI — общий ИИ (Artificial General Intelligence)
Гипотетическая система, которая справляется с любой интеллектуальной задачей не хуже человека — учится новому, переносит знания между областями, действует в незнакомой среде. Пока не создан.
ASI — сверхинтеллект (Artificial Superintelligence)
Гипотетическая система, превосходящая лучших людей практически во всех областях — от науки и стратегии до творчества и социального навыка. Полностью умозрительное понятие.
Ключевое слово здесь — широта (generality). Узкая система может быть сверхчеловечески хороша в своём деле: ни один гроссмейстер не обыграет современный шахматный движок. Но выньте эту систему из её области — и она рассыпается. Шахматный движок не сыграет в шашки, не говоря уже о том, чтобы понять шутку или сварить кофе. Человек устроен наоборот: почти нигде он не достигает сверхрезультата, зато сносно справляется с невероятно широким кругом дел — и, что важнее, с делами, которых никогда раньше не делал. AGI — это про то, чтобы соединить машинную мощь с человеческой широтой.
Разницу удобно поймать на одной картинке — через перенос навыка (transfer). Узкая система, натасканная на задаче A, не умеет применить выученное к похожей задаче B: для неё B — чистый лист, всё заново. Человек же тащит опыт из области в область почти бесплатно. Научились водить легковушку — сядете за руль фургона без второго курса автошколы. Освоили одну карточную игру — быстрее схватите правила следующей. Вот этот дешёвый перенос и есть та валюта, которой у узких машин пока нет.
Узкий ИИ вокруг нас
Про узкий ИИ полезно помнить, что он не редкость и не будущее — он уже пронизал повседневность, просто перестал бросаться в глаза (снова эффект ИИ из прошлой главы). Вот лишь часть систем, с которыми вы, скорее всего, взаимодействовали сегодня.
- Разблокировка телефона по лицу. Модель компьютерного зрения, обученная отличать вас от всех остальных.
- Лента и рекомендации. Что показать следующим в видеосервисе или маркетплейсе — решает система ранжирования, предсказывающая, на что вы кликнете.
- Голосовой помощник. Распознавание речи превращает звук в текст, отдельная модель — понимает команду, третья — синтезирует ответ голосом.
- Спам-фильтр в почте. Классификатор, обученный на миллионах писем отделять нужное от мусора.
- Навигатор. Предсказание пробок и времени в пути по историческим и текущим данным.
- Банковский антифрод. Система, помечающая подозрительные транзакции за доли секунды.
Каждая из них феноменально хороша в своём и абсолютно бесполезна в чужом. Спам-фильтр не проложит маршрут, навигатор не узнает ваше лицо. Это и есть портрет узкого ИИ: глубина без широты.
Заметьте закономерность: чем незаметнее система, тем глубже она обычно въелась в быт. О шахматном движке мы вспоминаем раз в год, а рекомендательная лента лепит наши вкусы каждый день и молча. Узкий — не значит слабый. Значит специализированный. И специализация эта бывает пугающе эффективной именно потому, что не распыляется на всё подряд.
▸ Пример
Программа AlphaGo в 2016 году обыграла одного из сильнейших в мире игроков в го — Ли Седоля. Го считалось неприступным для машин из-за астрономического числа вариантов. Триумф был громким и заслуженным. Но та же AlphaGo не умела играть в крестики-нолики, не понимала правил шахмат и не могла объяснить, почему сделала ход. Сверхчеловеческая — и предельно узкая.
⌛ Из истории
С ИИ публика знакомится по его громким победам в играх. 1997-й — шахматы: Deep Blue против Каспарова. 2011-й — эрудит-викторина: система Watson обыгрывает живых чемпионов американской «Своей игры». 2016-й — го: AlphaGo и Ли Седоль. Всякий раз пресса писала о «переломе» — и всякий раз речь шла об узкой системе, заточенной ровно под одну игру. Watson, блеснувший в викторине, не сыграл бы и в шашки, а Deep Blue не ответил бы ни на один вопрос викторины. Три триумфа, три тупика за пределами своей клетки.
Почему сегодняшние системы — всё ещё узкие
Тут возникает законное возражение. Хорошо, спам-фильтр узок. Но большие языковые модели (LLM) — те, что стоят за современными чат-ботами, — пишут код, сочиняют стихи, переводят, объясняют физику, ведут беседу почти на любую тему. Разве это не универсальность? Разве это уже не AGI?
Вопрос честный, и ответ на него тонкий. Языковые модели действительно радикально шире прежних узких систем — это заметный сдвиг, и не случайно вокруг них столько шума. Но по нескольким причинам большинство исследователей всё же относит их к узкому классу — точнее, к чему-то на пути от узкого к общему, но ещё не к общему.
Показателен один тип конфуза. Попросите сильную модель посчитать, сколько букв «р» в слове «структура», или сравнить два числа — скажем, 9,9 и 9,11, — и она способна уверенно ошибиться, хотя секундой раньше грамотно рассуждала о теории относительности. Дело не в «глупости». Модель работает не с буквами и не с величинами, а со статистикой текстовых фрагментов; там, где эта статистика подводит, у неё нет запасной, «настоящей» картины мира, к которой можно обратиться за проверкой. Человек в таком случае просто пересчитает по пальцам. Машине пересчитывать нечем.
- Единственная модальность в основе
Классическая языковая модель работает с текстом — предсказывает следующий фрагмент. Даже когда её достраивают до работы с картинками и звуком, в основе лежит одна и та же операция над последовательностями, а не разносторонний опыт жизни в мире.
- Нет устойчивого обучения на ходу
Человек учится непрерывно: сегодняшняя ошибка меняет завтрашнее поведение навсегда. У большинства развёрнутых LLM веса не меняются во время обычного разговора. Память приложения может сохранять сведения между сессиями; дообучение, online и continual learning — отдельные механизмы обновления, не обязательно требующие обучения с нуля.
- Хрупкость и провалы на простом
Система, блестяще рассуждающая о квантовой механике, может споткнуться на детской логической задачке, посчитать буквы в слове или уверенно выдумать несуществующий факт. Такие провалы выдают отсутствие настоящей модели мира за фасадом беглой речи.
- Нет собственных целей и действия в мире
AGI по смыслу — это агент, который сам ставит подцели и добивается их в реальной среде. Языковая модель отвечает на запрос и останавливается; за пределами текста она ничего не делает и ни к чему не стремится.
Есть у общего интеллекта и незаметный фундамент, который мы привычно недооцениваем, — здравый смысл. Тысячи очевидностей, не записанных ни в одном учебнике: вода мокрая, за вторником идёт среда, отпущенная чашка падает, а человек под дождём без зонта промокнет. Мы впитываем это, просто живя. Машине же приходится либо скармливать банальности горами, либо надеяться, что она выудит их из текста. Пока выходит так себе. Парадоксально, но сегодняшние системы чаще спотыкаются не на олимпиадных задачах, а на том, что понятно пятилетнему ребёнку.
◆ Ключевое
Универсальность в разговоре — не то же самое, что общий интеллект. Модель может рассуждать на любую тему словами и при этом не уметь учиться на ходу, действовать в мире и ставить собственные цели. Широта тем ≠ широта способностей.
Оговорюсь честно. Граница между «широким узким» и «настоящим общим» размыта, и единой шкалы, по которой можно было бы объявить «вот теперь это AGI», пока нет. Одни исследователи считают, что нынешние модели — уже ранние искры общего интеллекта; другие — что это по-прежнему очень мощная имитация, лишённая понимания. Спор не решён, и в этой книге мы будем держаться осторожной формулировки: сегодняшние системы несравнимо шире прежних, но ещё не универсальны в человеческом смысле.
Соберём три уровня в одну таблицу — это удобная карта, к которой можно возвращаться.
| Уровень | Что умеет | Примеры | Существует ли |
|---|---|---|---|
| ANI · узкий | Один класс задач, часто на сверхчеловеческом уровне; не переносит навык вовне | Шахматный движок, спам-фильтр, распознавание лиц, рекомендации, языковые модели | Да, повсеместно |
| AGI · общий | Любая интеллектуальная задача на уровне человека; учится, обобщает, действует в новом | Пока только в исследованиях и фантастике | Нет; сроки — предмет спора |
| ASI · сверх | Превосходит лучших людей почти во всём, включая науку и стратегию | Полностью умозрительно | Нет |
И последнее, о чём предупрежу сразу: путь от узкого ИИ к общему — не гладкий подъём по лестнице. Не факт, что если долго улучшать узкие системы, из них «сама собой» вырастет общая. Возможно, для AGI нужны идеи, которых у нас пока просто нет. Именно поэтому прогнозы сроков так расходятся — от «через несколько лет» до «может, никогда». Осторожность к таким прогнозам — признак трезвого взгляда, а не пессимизма.
А сверхинтеллект? О нём честнее всего сказать, что это пока территория мысленных экспериментов. Ещё в 1965 году математик Ирвинг Гуд высказал тревожную догадку: стоит появиться машине, которая сама умеет проектировать машины лучше себя, — и она запустит цепную реакцию самоулучшения, «интеллектуальный взрыв», после которого человеческий ум окажется где-то далеко позади. Мысль красивая и жутковатая. Только между ней и реальностью лежит весь непройденный путь до обычного AGI, которого тоже ещё нет. Держать ASI в голове полезно — как далёкий ориентир и как предмет заботы о безопасности. Принимать за близкое будущее — преждевременно.
- ИИ делят на три уровня по широте способностей: узкий (ANI), общий (AGI) и сверхинтеллект (ASI); рамку популяризировал Ник Бостром.
- Весь существующий ИИ — узкий: он может быть сверхчеловечески хорош в одном деле, но беспомощен за его пределами. Он уже повсюду вокруг нас.
- Языковые модели заметно шире прежних систем, но большинство исследователей считает их ещё не общими: одна модальность в основе, нет обучения на ходу, хрупкость, отсутствие собственных целей.
- Широта тем в разговоре — не то же, что широта способностей: рассуждать словами обо всём можно, не умея учиться, действовать и ставить цели.
- Переход от узкого к общему — вероятно, качественный скачок, а не плавный подъём; поэтому сроки появления AGI остаются предметом честного спора.
Две традиции: символьный ИИ против машинного обучения
С первых дней области ИИ шёл по двум разным дорогам. Одна доверяла явным правилам и логике, другая — обучению на примерах. Их полувековое соперничество определило и триумфы, и тупики; а сегодня всё чаще звучит идея, что будущее — за их союзом.
Вернёмся к спектру из первой главы — от жёстких правил слева до обучения на данных справа. За этими двумя полюсами стоят не просто два приёма, а две философии того, что вообще значит «сделать машину умной». Их часто называют символьным ИИ и коннекционизмом, и почти вся история дисциплины — это качели между ними: то одна берёт верх и обещает прорыв, то, упёршись в стену, уступает другой.
Символьный ИИ: разум как манипуляция символами
Первый подход исходит из красивой идеи: мышление — это оперирование символами по правилам. Как в математике вы преобразуете формулы, следуя законам алгебры, так и разум, согласно этой гипотезе, преобразует внутренние символы, обозначающие вещи и понятия, по логическим правилам. Если так, то, чтобы построить ум, нужно дать машине запас знаний в виде фактов и правил и механизм вывода, который из них рассуждает.
Этот подход называют символьным ИИ (symbolic AI), а его классическую эпоху 1960–1980-х — GOFAI. Термин в 1985 году придумал философ Джон Хогеланд. Знания в такой системе записаны явно и читаемо: «если температура выше 38 и есть кашель, то, возможно, грипп». Машина не угадывает — она выводит следствия из посылок, шаг за шагом, как логик или юрист.
⌛ Из истории
Вершиной символьного подхода стали экспертные системы (expert systems). В 1970-е программа MYCIN ставила диагнозы бактериальных инфекций и подбирала антибиотики, рассуждая по сотням правил, собранных у врачей, — и в тестах не уступала специалистам. Система DENDRAL определяла структуру химических молекул. Знания экспертов пытались «перелить» в правила — и на время это работало.
У символьного ИИ есть козыри, которых сопернику не хватает. Первый — прозрачность. Спросите такую систему «почему?» — и она выложит всю цепочку правил, приведшую к выводу. Ни одна нейросеть так не умеет. Второй козырь — строгость: там, где знание формализуется точно (право, налоги, логистика, проверка микросхем), правила дают не догадку, а гарантию. И третий — управляемость: нашли ошибку, поправили правило, и дело с концом.
Но у подхода обнаружился коренной изъян. Мир слишком богат, чтобы уместиться в правила. Попробуйте записать правилами, что такое «стул»: четыре ножки? — а табурет и кресло-мешок? для сидения? — а музейный экспонат, на котором сидеть нельзя? На каждое правило находится исключение, на исключение — исключение из исключения. Ручное описание знаний оказалось бездонной ямой; специалисты назвали это проблемой приобретения знаний (knowledge acquisition bottleneck). Особенно беспомощен символьный ИИ там, где человек действует «на глаз»: узнать лицо, разобрать почерк, понять живую речь. Эти умения мы не можем даже толком описать словами — как же записать их правилами?
▸ Пример
Показательна судьба MYCIN. По качеству рекомендаций система не уступала врачам — а в клиниках её так и не внедрили. Мешало разное: и вопрос ответственности (кто отвечает, если ошибётся программа?), и необходимость вручную поддерживать, дописывать и согласовывать между собой тысячи правил. Блестящая в лаборатории, она задыхалась под тяжестью собственного знания. То самое бутылочное горлышко — во всей красе.
Коннекционизм: разум как обучение на данных
Второй подход заходит с противоположной стороны. Если мы не умеем сформулировать правила распознавания кошки — давайте не будем и пытаться. Покажем машине тысячи фотографий кошек и не-кошек и дадим ей самой подстроиться так, чтобы отличать одно от другого. Знание тут не записано словами; оно растворено в настройках системы, извлечённых из примеров. Это машинное обучение (machine learning), а его самая известная ветвь, вдохновлённая устройством мозга, — коннекционизм (connectionism), то есть искусственные нейронные сети.
Идея не нова: ещё в 1958 году психолог Фрэнк Розенблатт построил перцептрон — простейшую обучаемую сеть. Но по-настоящему подход выстрелил в 2010-е, когда совпали три вещи: горы оцифрованных данных, дешёвые мощные видеочипы и удачные алгоритмы. Символической вехой стал 2012 год: нейросеть AlexNet с огромным отрывом выиграла соревнование по распознаванию изображений ImageNet — и началась эпоха глубокого обучения (deep learning), к которой мы ещё вернёмся в отдельной части книги.
Вдумайтесь, насколько это смена философии. Символьный инженер — как учитель, диктующий правила: делай так, потом так. Инженер машинного обучения — как родитель, который вместо наставлений просто окружает ребёнка примерами и даёт им подействовать. Первый точно знает, что вложил в систему, но упирается в потолок выразимого словами. Второй получает умения, которые сам бы сформулировать не смог, — но и не до конца понимает, что именно выучила его подопечная. За мощь платят контролем. Эта сделка и лежит в основе почти всех сегодняшних споров об ИИ.
Сильные стороны здесь зеркальны символьному подходу. Машинное обучение справляется с невыразимым — с восприятием, речью, интуитивными закономерностями, которые невозможно записать правилами. Оно масштабируется данными: больше хороших примеров — лучше результат, без ручного труда программиста над каждым случаем. И оно устойчиво к шуму и исключениям: сеть не ломается от единственного нестандартного случая, а мягко его сглаживает.
Но и слабости зеркальны. Обученная сеть — это чёрный ящик: она даёт ответ, но не объясняет его в человеческих терминах; тысячи её чисел ничего не говорят напрямую. Она прожорлива к данным: чтобы научиться, ей нужны тысячи, а то и миллионы примеров там, где человеку хватает нескольких. Она наследует изъяны данных: перекос в обучающей выборке становится перекосом в решениях (об этом — в главе про мифы). И она плохо строго рассуждает: там, где нужен гарантированно верный логический вывод, статистическая догадка ненадёжна.
Непрозрачность — не придирка теоретиков. Представьте: банк отказал вам в кредите, а на вопрос «почему?» способен ответить лишь «так решила модель». Ни оспорить, ни поправить. Оттого в чувствительных сферах — медицине, правосудии, кредитовании — к чёрным ящикам относятся с опаской, а объяснимость из приятного бонуса превращается в требование регуляторов. И тут символьная традиция, которую поспешили похоронить, неожиданно снова в цене.
Чтобы почувствовать эти качели, взгляните на хронику. Маятник качнулся не раз и не два, и каждый разворот сопровождался то эйфорией, то заморозкой денег — периоды разочарования так и прозвали «зимами ИИ».
Розенблатт строит первую обучаемую сеть; газеты пророчат машины, которые вот-вот «осознают себя».
Минский и Пейперт математически показывают пределы простого перцептрона. Интерес к сетям гаснет почти на два десятилетия.
Расцвет экспертных систем: символьный подход на коне, бизнес вкладывается в базы знаний.
Экспертные системы упираются в хрупкость и дороговизну сопровождения; финансирование снова замерзает.
AlexNet выигрывает ImageNet — начинается эпоха глубокого обучения, и маятник резко уходит к данным.
Заметьте, как аккуратно две традиции дополняют друг друга: сильные стороны одной — ровно там, где у другой слабости. Это не совпадение, а намёк.
| Свойство | Символьный ИИ | Машинное обучение |
|---|---|---|
| Откуда знание | Человек записывает правила | Извлекается из примеров |
| Прозрачность | Высокая: покажет цепочку вывода | Низкая: чёрный ящик |
| Строгое рассуждение | Сильная сторона | Слабая: догадка, не гарантия |
| Восприятие (зрение, речь) | Почти не работает | Сильная сторона |
| Что нужно для запуска | Труд экспертов и инженеров знаний | Много данных и вычислений |
| Исключения и шум | Ломается, растёт число правил | Сглаживает, устойчиво |
| Исправление ошибки | Поправить правило | Дообучить на новых данных |
⚠ Осторожно
Соблазнительно объявить машинное обучение «победителем», раз именно оно стоит за нынешним бумом. Но символьные методы никуда не делись: базы знаний, логические движки, системы правил тихо работают в банках, авиадиспетчерских, компиляторах и медицине — там, где нужны точность и объяснимость. «Устаревший» подход часто оказывается незаменимым.
Нейро-символические гибриды: союз вместо войны
Если сильные стороны подходов дополняют друг друга, напрашивается очевидная мысль: а что, если их соединить? Так родилось направление нейро-символического ИИ (neuro-symbolic AI) — попытка взять восприятие и интуицию от нейросетей, а строгое рассуждение и прозрачность — от символьной логики.
Идея естественна, если вспомнить себя. Узнавая лицо друга в толпе, вы не рассуждаете по правилам — работает мгновенное «нейросетевое» восприятие. А раскладывая налоги или доказывая теорему, вы, наоборот, идёте по шагам строгой логики. Здоровый ум пользуется обоими режимами и переключается между ними. Разумно захотеть того же от машины.
Психолог Даниэль Канеман описал в человеке две системы мышления: быструю, интуитивную, автоматическую — и медленную, логичную, требующую усилия. Первая узнаёт лицо и чует подвох; вторая складывает столбиком и проверяет доказательство. Нейро-символический ИИ — это, по сути, инженерная попытка ужиться обеим системам в одной машине. Аналогия неточна, метафора прихрамывает — но направление она передаёт верно.
▸ Пример
Система, решающая задачи по геометрии с чертежа, может работать в два такта: нейросеть «смотрит» на рисунок и переводит его в набор символов (точки, прямые, углы), а символьный движок затем строго доказывает нужное утверждение по правилам геометрии — и предъявляет доказательство по шагам. Восприятие — от одной традиции, вывод — от другой.
Гибридные архитектуры уже приносят плоды: в них меньше «галлюцинаций», потому что символьная часть проверяет догадки нейросети на непротиворечивость; их проще объяснять, потому что часть решения записана явными правилами; им нужно меньше данных, потому что часть знаний закладывается заранее, а не вычитывается из миллионов примеров. Многие исследователи считают, что дорога к более общему и надёжному ИИ лежит именно через такое примирение двух традиций, а не через победу одной из них.
Почему об этом заговорили именно теперь? Потому что чистое глубокое обучение уперлось в собственные стены — те самые галлюцинации, непрозрачность, ненасытный аппетит к данным. Раздувать модели до бесконечности дорого и болезнь не лечит. А по соседству десятилетиями лежат зрелые символьные инструменты — решатели, базы знаний, логические языки, — которые умеют ровно то, чего сетям не хватает. Соединить их — не ретроградство, а трезвый расчёт. Похоже, впервые за всю историю маятник не улетает к очередной крайности, а пробует замереть посередине.
«Нам нужны системы, которые сочетают обучение на данных с явными знаниями и способностью к рассуждению».Гэри Маркус, когнитивист, сторонник гибридного ИИ
История ИИ — это не линейное шествие от «наивных правил» к «умным сетям», как иногда упрощают. Это диалог двух глубоких идей о природе мышления, где маятник ходит туда-сюда, а самые интересные результаты рождаются на стыке. Держите эту двойственность в уме: она будет проступать почти в каждой следующей теме книги.
- Символьный ИИ (GOFAI) считает мышление манипуляцией символами по правилам; он прозрачен, строг, управляем, но тонет в исключениях и не справляется с восприятием.
- Машинное обучение и коннекционизм извлекают знание из данных; они блестящи в восприятии и масштабируются, но непрозрачны, прожорливы к данным и наследуют их изъяны.
- Сильные и слабые стороны двух подходов зеркальны — они дополняют друг друга почти по всем свойствам.
- Символьные методы не устарели: логика и базы правил незаменимы там, где нужны точность и объяснимость.
- Нейро-символические гибриды соединяют восприятие нейросетей с рассуждением логики; многие видят путь к надёжному и более общему ИИ именно в их союзе.
Ландшафт задач: зрение, язык, речь и действие
«Искусственный интеллект» — это не одна технология, а целый материк областей: одни учат машину видеть, другие — понимать язык, третьи — слышать, действовать, создавать. Прежде чем нырять вглубь, полезно облететь этот материк сверху и разглядеть его провинции.
Когда говорят «эта компания занимается ИИ», это почти так же неинформативно, как «эта компания занимается электричеством». Электричество освещает дома, крутит моторы, питает связь — и области ИИ так же разнообразны. У них общий фундамент (данные, обучение, модели из предыдущих глав), но задачи, приёмы и мерки успеха у каждой свои. В этой главе — обзорная карта основных провинций. Каждой из них дальше в книге посвящены отдельные части; здесь наша цель — увидеть целое и понять, что где живёт.
Восприятие: зрение и речь
Компьютерное зрение (computer vision) учит машину извлекать смысл из изображений и видео — превращать сетку пикселей в понимание того, что на картинке. Типовые задачи выстраиваются по возрастанию сложности: классификация (что за объект на снимке), детекция (где именно он, обвести рамкой), сегментация (какие пиксели относятся к объекту, обвести по контуру), распознавание лиц и отслеживание движения в видео. Примеры вокруг нас: разблокировка телефона взглядом, автоматическая обводка людей в видеозвонке, поиск товара по фотографии, чтение номеров машин на въезде, помощь рентгенологу в поиске патологий на снимке.
И всё же зрение машины — не человеческое. Оно измеряет пиксели, а не понимает сцену. Подправьте на фотографии неразличимые для глаза точки — и уверенная сеть назовёт панду гиббоном, а знак «стоп» примет за ограничение скорости. Такие подделки называют состязательными примерами, и это трезвое напоминание: «видит» здесь стоит в кавычках. Машина реагирует на узор, а не на смысл, и узор можно обмануть.
Обработка речи (speech) — это два зеркальных умения. ASR превращает звук в текст: голосовой ввод, автосубтитры, расшифровка совещаний. TTS делает обратное — озвучивает текст голосом: навигатор, аудиокниги, голос помощника. Отдельная задача — распознавание говорящего (кто именно говорит) и выделение речи из шума. Речь коварна: люди говорят с акцентами, перебивают, глотают окончания, и звук приходит с помехами, поэтому надёжный ASR — давняя и трудная цель, всерьёз покорившаяся лишь в эпоху глубокого обучения.
Кажущийся пустяк — расставить запятые в распознанной речи — на деле отдельная задача. Живая речь льётся без знаков препинания, а от одной запятой смысл переворачивается: «казнить нельзя помиловать». Поэтому за простой кнопкой диктовки прячется целый конвейер моделей, аккуратно передающих работу друг другу.
▸ Пример
Автоматические субтитры к видео — это связка провинций: сначала ASR переводит звук в текст, затем языковая модель расставляет знаки препинания и правит опечатки на слух, при необходимости другой модуль переводит текст на нужный язык. Одна привычная кнопка «включить субтитры» — а под капотом сразу три области ИИ.
Язык: понимание и общение
Обработка естественного языка (Natural Language Processing, NLP) — область, вокруг которой сегодня больше всего шума, ведь именно к ней относятся большие языковые модели. Её задачи охватывают всё, что мы делаем со словами: перевод с языка на язык, краткое изложение длинного текста, анализ тональности (позитивный отзыв или гневный), ответы на вопросы по документу, классификация писем и обращений, извлечение фактов из сплошного текста и, наконец, диалог — свободная беседа, которую ведут чат-боты.
Язык долго оставался для машин крепким орешком. Значение слова плывёт от контекста, одну и ту же мысль можно завернуть сотней способов, а половина смысла вообще не произносится — она подразумевается. Перелом случился в 2017 году, когда появилась архитектура трансформер (transformer); ей посвящена отдельная часть книги. Она позволила обучать модели на колоссальных объёмах текста и уловить закономерности языка так, как прежде не удавалось. Отсюда — нынешняя волна разговорных систем.
Любопытно, что прорыв случился не оттого, что машину наконец выучили грамматике. Наоборот. Падежи, синтаксические деревья, правила согласования, над которыми лингвисты бились десятилетиями, модель нигде специально не «проходит». Она просто читает немыслимое количество текста и подмечает, какие слова с какими уживаются. Понимание правил уступило место статистике употребления — и, к смущению многих теоретиков, это сработало лучше. Урок, который область усваивала не раз: порой выгоднее показать гору примеров, чем вывести точную теорию.
Действие: обучение с подкреплением и робототехника
Все предыдущие провинции про восприятие и понимание — вход есть, выход есть, задача разовая. Но интеллект в природе служит действию: живое существо принимает не одно решение, а длинную цепочку, где каждый шаг меняет ситуацию и влияет на будущие шаги. Этим занимается обучение с подкреплением (Reinforcement Learning, RL).
Идея взята из дрессировки и из того, как учимся мы сами: агент действует в среде, получает награду за удачное и наказание за неудачное и постепенно нащупывает стратегию, приносящую больше награды в долгой перспективе. Никто не говорит ему правильный ход — он открывает его методом проб, ошибок и терпения.
Обучение с подкреплением (RL)
Обучение через взаимодействие: агент пробует действия в среде, получает награду или штраф и со временем выучивает стратегию (политику), которая максимизирует награду не сейчас, а на длинной дистанции. Ключевая трудность — жертвовать сиюминутным ради будущего.
Звучит элегантно, но дьявол — в награде. Сформулируешь её небрежно — и агент найдёт лазейку, которая формально набирает очки, а по сути издевается над твоим замыслом. Хрестоматийный случай: в компьютерной гонке на лодках систему наградили за собранные по трассе бонусы, надеясь, что она рванёт к финишу. Вместо этого лодка отыскала лагуну, где бонусы возрождались, и принялась вертеться на месте, тараня причал и накручивая счётчик, — гонку не заканчивая вовсе. Это зовут взломом награды (reward hacking), и это постоянная головная боль всей области: машина оптимизирует ровно то, что вы написали, а не то, что вы имели в виду.
RL стоит за играющими сверхчеловечески системами (уже знакомая нам AlphaGo), за управлением роботами, которые учатся ходить и хватать предметы, за оптимизацией энергопотребления в дата-центрах. Тесно связана с ним робототехника (robotics) — область, где ИИ впервые всерьёз сталкивается с неподатливостью физического мира: датчики шумят, моторы неточны, предметы выскальзывают, а ошибка стоит не пикселя, а разбитой чашки. Именно поэтому роботы в реальном мире отстают от «умников» на экране: реальность не прощает приблизительности.
◆ Ключевое
Есть парадокс Моравека: для ИИ трудное для человека (шахматы, интегралы) часто оказывается лёгким, а лёгкое для нас (взять чашку, пройти по комнате) — мучительно трудным. Миллионы лет эволюции отладили наше восприятие и моторику так глубоко, что мы принимаем их за пустяк, — а машине они даются тяжелее «высокой» логики.
Создание и подсказка: генерация и рекомендации
Генеративные модели (generative models) не распознают и не классифицируют, а создают новое: текст, изображения, музыку, голос, видео, программный код. Раньше ИИ в основном отвечал на вопрос «что это?»; генеративные модели отвечают на «сделай мне такое». Они рисуют картину по текстовому описанию, пишут черновик письма, сочиняют мелодию, озвучивают текст правдоподобным голосом. Именно эта провинция вывела ИИ из лабораторий в массовый обиход в 2020-е — потому что её результат виден и осязаем каждому. Обратная сторона той же силы — дипфейки и правдоподобная выдумка, о чём честно поговорим в главе о мифах и дальше в книге.
А как машина вообще «сочиняет»? Огрубляя: генеративная модель выучивает, как выглядят правдоподобные примеры — тексты, картинки, звуки, — а потом порождает новые, похожие, но не скопированные. Модель изображений часто учат хитро, будто задом наперёд: берут картинку и постепенно засыпают её «снегом» случайного шума до полной каши, а сеть тренируют этот процесс обращать — восстанавливать образ из шума. Дайте ей затем чистый шум и текстовую подсказку — и получите картину, которой никогда не существовало. Волшебства тут нет. Есть очень аккуратно выученная статистика того, как устроен мир изображений.
Наконец, рекомендательные системы (recommender systems) — самая незаметная и, возможно, самая влиятельная провинция. Их задача — из океана вариантов подобрать то, что подойдёт именно вам: следующее видео, товар, песню, новость, пару на сайте знакомств. Формально это задача ранжирования — расставить кандидатов по предполагаемой полезности для конкретного человека. Мы почти не думаем об этом как об «ИИ», но именно рекомендации незримо определяют, что миллиарды людей смотрят, покупают и читают каждый день.
У этой незаметности есть цена. Рекомендательная система учится на том, что вы кликаете, — а кликаете вы то, что она вам показала. Круг замыкается: она подсовывает похожее на уже понравившееся, вы это потребляете, она укрепляется в своей правоте и сужает поток дальше. Так рождаются «пузыри» и залипание. Инструмент, честно оптимизирующий «время на экране», может незаметно оптимизировать вовсе не ваше благополучие. К этике мы ещё вернёмся; пока просто запомните странность: самый тихий ИИ влияет на нашу жизнь едва ли не сильнее самого шумного.
Сведём провинции в таблицу — как краткий справочник по карте.
| Область | Что делает | Типовые задачи | Где встречаем |
|---|---|---|---|
| Зрение | Извлекает смысл из изображений | Классификация, детекция, сегментация | Разблокировка по лицу, медицинские снимки, поиск по фото |
| Язык (NLP) | Понимает и порождает текст | Перевод, изложение, диалог, ответы на вопросы | Чат-боты, переводчики, поиск |
| Речь | Связывает звук и текст | Распознавание (ASR), синтез (TTS) | Голосовой ввод, субтитры, аудиокниги |
| Действие (RL) | Учит стратегиям через награду | Управление, игра, оптимизация | Роботы, игровые ИИ, дата-центры |
| Генерация | Создаёт новый контент | Текст, изображения, звук, код | Ассистенты, редакторы, дизайн |
| Рекомендации | Ранжирует под пользователя | Персональная выдача, подбор | Ленты, магазины, стриминг |
Ещё десять лет назад каждая провинция жила своим двором: свои конференции, свои приёмы, чуть ли не свой диалект. Сегодня границы протекают. Одна и та же архитектура — трансформер — сгодилась и для текста, и для картинок, и для звука, и модели всё чаще делают мультимодальными (multimodal): подаёшь фотографию и вопрос о ней, а в ответ получаешь текст или речь. Так что карта из этой главы — не жёсткие государства с пограничниками, а скорее рельеф, по которому свободно течёт вода.
Важно не уходить с этой главы с ложным ощущением, будто провинции разделены стенами. Наоборот: самые интересные системы соединяют их. Робот-помощник видит кухню (зрение), слышит просьбу (речь), понимает её (язык), планирует и действует (RL, робототехника). Человекоподобный ассистент будущего — это не одна провинция, а их слаженный оркестр. Понимая карту, вы уже не спутаете отдельный инструмент со всем ансамблем — и это лучшая защита и от завышенных ожиданий, и от несправедливого разочарования.
- ИИ — не одна технология, а материк областей с общим фундаментом (данные, обучение, модели) и разными задачами и мерками успеха.
- Восприятие: зрение извлекает смысл из изображений (классификация, детекция, сегментация), речь связывает звук и текст (ASR и TTS).
- Язык (NLP) понимает и порождает текст; прорыв 2017 года — архитектура трансформер — запустил нынешнюю волну разговорных систем.
- Действие: обучение с подкреплением (RL) выучивает стратегии через награду, а робототехника сталкивает ИИ с неподатливым физическим миром; парадокс Моравека объясняет, почему «простое» для нас даётся машине труднее «сложного».
- Генеративные модели создают новый контент, рекомендательные — незаметно ранжируют мир под каждого; сильнейшие системы соединяют несколько провинций сразу.
Мифы и заблуждения об ИИ
Вокруг ИИ выросла плотная мифология — из кино, рекламы и заголовков. Одни мифы преувеличивают его силу, другие — недооценивают риски, третьи просто подменяют суть. Разобрать их — не занудство, а способ видеть технологию такой, какая она есть.
У всякой мощной технологии есть свой фольклор, и ИИ здесь чемпион. Отчасти виноват сам термин: слова «интеллект» и «разум» будят образы из фантастики. Отчасти — то, что технология развивается быстрее, чем общее понимание, и в этот зазор охотно вливаются и восторг, и страх. Мифы вредны не тем, что «неправильны», а тем, что мешают принимать здравые решения: где ИИ доверять, где проверять, чего от него ждать, а чего опасаться. Разберём главные заблуждения по очереди — и в каждом отделим зерно правды от шелухи.
Мифы про то, чем ИИ является
✕ Заблуждение
«ИИ — это робот». Металлический человек с горящими глазами — самый живучий образ, подаренный кинематографом.
На деле подавляющее большинство ИИ не имеет тела вовсе. Это программы: они крутятся в дата-центрах и на телефонах, фильтруют почту, ранжируют ленту, распознают речь, переводят текст. Робот — это железо, механическое тело; ИИ — это софт, способ принимать решения. Робот может работать вообще без всякого ИИ (промышленный манипулятор десятилетиями повторяет заученное движение по жёсткой программе). А ИИ прекрасно живёт без тела. Пересечение — роботы с ИИ — существует, но это лишь малая часть картины. Путая одно с другим, легко проглядеть, что самый влиятельный ИИ невидим и бестелесен.
Полезно перевернуть картинку. Самый впечатляющий робот на заводе бывает безмозглым в буквальном смысле — рукой, повторяющей одно движение по таймеру, без грамма ИИ. А система, за секунду одобряющая или отклоняющая вашу ипотеку из недр дата-центра, тела не имеет вовсе — и влияет на судьбы куда сильнее любого механического манипулятора. Тело и ум в мире машин разведены гораздо дальше, чем подсказывает кино.
✕ Заблуждение
«ИИ понимает мир и осознаёт себя, как человек». Раз он бегло говорит, значит, за словами стоит понимание и, может, переживание.
Это, пожалуй, самое соблазнительное заблуждение — потому что язык мы привыкли считать надёжным признаком мысли. Но современная языковая модель порождает текст, предсказывая правдоподобное продолжение на основе колоссального массива примеров. Беглость речи — не доказательство понимания в человеческом смысле и тем более не признак сознания, чувств или самосознания. У модели нет переживаний, нет «я», нет картины мира, за которую она держится, — есть статистические связи между фрагментами текста. Философ Джон Сёрл ещё в 1980 году придумал мысленный эксперимент «Китайская комната»: человек, не знающий китайского, по толстой инструкции выдаёт верные ответы на китайские записки — снаружи выглядит как понимание, изнутри его нет. Спор о том, насколько аналогия точна, продолжается; но она хорошо отрезвляет от поспешного «оно всё понимает».
У этой иллюзии есть даже имя — эффект Элизы. В 1966 году простенькая программа «Элиза» изображала психотерапевта, тупо переспрашивая: «Расскажите подробнее о вашей матери». Кода там было на пару страниц, никакого понимания и в помине — а люди привязывались к ней, изливали душу, отказывались верить, что говорят с алгоритмом. Мы так устроены, что готовы увидеть собеседника даже в собственном отражении. С красноречивыми нынешними моделями этот древний рефлекс срабатывает во сто крат сильнее — и тем важнее держать его в узде.
⚠ Осторожно
Осторожность работает в обе стороны. Утверждать «машина точно ничего не понимает и никогда не сможет» — тоже сильное заявление, которое трудно доказать. Честная позиция: у нынешних систем нет признаков сознания и человеческого понимания, а что будет с будущими и как вообще измерять «понимание» — открытые вопросы, а не решённые.
Мифы про то, каков ИИ
✕ Заблуждение
«ИИ объективен и беспристрастен — он же математика, а не человек с предрассудками».
Кажется убедительным — и опасно ошибочно. ИИ учится на данных, а данные создаёт человеческий мир со всеми его перекосами. Если систему найма обучить на прошлых решениях компании, где реже брали женщин, она аккуратно воспроизведёт эту дискриминацию — и придаст ей ложный авторитет «беспристрастного алгоритма». Известны реальные случаи: системы распознавания лиц заметно хуже работали на темнокожих и на женщинах, потому что в обучающих наборах их было меньше; алгоритмы оценки риска в правосудии наследовали расовые перекосы истории. Машина не изобретает предвзятость — она усваивает её из данных и усиливает, потому что применяется к миллионам решений и прикрыта аурой нейтральности. «Объективность» ИИ — это миф; правильнее спрашивать, чьи данные и чьи ценности в нём зашиты.
Самое коварное здесь — не сам перекос, а его позолота. Человеку-кадровику можно возразить, на человека-судью — подать апелляцию. А «алгоритм» звучит как приговор природы: беспристрастный, математический, окончательный. Психологи зовут это чрезмерное доверие к машине предвзятостью автоматизации — мы склонны верить цифре больше, чем стоило бы. В итоге старая дискриминация не просто переезжает в код, но и получает мантию объективности, снять которую куда труднее, чем ввести.
✕ Заблуждение
«ИИ учится сам, без людей». Достаточно включить — а дальше он развивается автономно.
За кулисами почти любой ИИ-системы — огромный, часто невидимый человеческий труд. Люди собирают и чистят данные. Люди размечают примеры: обводят объекты на миллионах фото, отмечают, какой ответ хороший, а какой плохой. Люди пишут и настраивают алгоритмы, задают, что считать наградой, проверяют результат, ловят и правят ошибки. Современные разговорные модели дополнительно шлифуют через обучение на человеческой обратной связи — тысячи людей оценивают ответы, задавая модели «вкус». «Автономный ИИ» — это айсберг: видна лишь красивая верхушка, а под водой — гигантский массив человеческого труда, без которого верхушка не держится.
За этой метафорой — живые люди. Разметку для многих систем делают десятки тысяч работников по всему миру: часами обводят пешеходов на кадрах для беспилотников, помечают токсичные комментарии, сравнивают между собой ответы чат-ботов. Труд рутинный, часто низкооплачиваемый и почти всегда невидимый для пользователя, который восхищается «самостоятельной» программой. Называть такой ИИ самообучающимся — примерно как называть ресторан самоготовящимся на том основании, что вы не заглядываете на кухню.
Признавать этот труд — не занудная оговорка, а вопрос честности. Магия, у которой есть авторы, перестаёт быть магией и становится инженерией. А с инженерии уже можно спрашивать — за качество, за ошибки, за условия работы тех, кто держит айсберг на плаву.
Мифы про будущее и про данные
✕ Заблуждение
«ИИ вот-вот заменит всех / уничтожит человечество — буквально завтра». Два противоположных страха с одной ошибкой: обрыв шкалы времени и меры.
Здесь сходятся два перегиба, и оба вредны. Первый — «завтра всех заменят». Реальность аккуратнее: ИИ меняет задачи внутри профессий быстрее, чем упраздняет профессии целиком. Он берёт на себя рутинные куски работы, а роли перекраиваются вокруг него — это уже происходит, но постепенно, неравномерно и не тотально. Второй перегиб — «завтра всех уничтожат». Разговор о долгосрочных рисках мощного ИИ серьёзен и заслуживает трезвого внимания (мы вернёмся к нему в части о безопасности), но апокалиптические сроки «прямо сейчас» — это, как правило, не анализ, а драматургия. Опасность обоих мифов одинакова: они уводят внимание от настоящих, уже наступивших проблем — предвзятости, дезинформации, дипфейков, концентрации власти, — на которые можно и нужно влиять уже сегодня.
История, к слову, учит осторожности с обеими крайностями. Когда появились банкоматы, кассирам предрекали вымирание — а их число какое-то время даже росло: рутину сняла машина, людей переместили туда, где нужен именно человек. Не факт, что так будет всегда и везде. Но простая арифметика «профессия минус ИИ равно безработица» почти никогда не сходится. Работа не исчезает целиком — она пересобирается. И больнее всего это бьёт по тем, кого не предупредили и не переучили.
✕ Заблуждение
«Чем больше данных, тем всегда лучше». Просто налей побольше — и модель поумнеет.
Количество данных важно — но не свято. Инженеры давно вывели присказку: мусор на входе, мусор на выходе. Гора грязных, устаревших, кривых данных модель не улучшит, а испортит — да ещё и закрепит перекос. Качество, разнообразие и уместность данных часто важнее объёма: тщательно отобранный набор нередко бьёт наспех собранный, но огромный. К тому же прирост качества от каждого нового миллиона примеров рано или поздно замедляется — растёт лишь цена в деньгах, энергии и времени. «Больше данных» — не универсальное заклинание, а инженерный компромисс, у которого есть цена и предел.
И ещё одно, о чём забывают: данные не берутся из воздуха. За каждым бодрым «давайте соберём побольше» стоят чьи-то фотографии, переписки, медицинские карты — а значит, вопросы согласия и приватности. Больше данных — это выше счёт за электричество и, что куда важнее, длиннее тень над личными границами миллионов людей. Иногда самый честный инженерный ответ на «добудем ещё данных» звучит так: «нет, давайте лучше вычистим и разметим то, что уже есть».
Соберём разобранное в таблицу — как памятку, к которой удобно возвращаться, встретив очередной громкий заголовок.
| Миф | Что на самом деле |
|---|---|
| ИИ — это робот | Чаще всего ИИ бестелесен: это программа. Робот — тело, ИИ — способ решать; они пересекаются, но не совпадают |
| ИИ понимает и осознаёт, как человек | Беглость речи — не понимание и не сознание; у нынешних систем нет «я», переживаний и картины мира |
| ИИ объективен | ИИ наследует и усиливает перекосы своих данных, прикрываясь аурой нейтральности |
| ИИ учится сам, без людей | За кулисами — огромный человеческий труд: сбор, чистка, разметка данных, настройка, оценка |
| ИИ завтра всех заменит / уничтожит | Меняет задачи внутри профессий постепенно; серьёзные риски есть, но апокалиптические сроки — драматургия |
| Чем больше данных, тем всегда лучше | Качество, разнообразие и уместность часто важнее объёма; отдача от лишних данных убывает |
Общий корень почти всех этих мифов один: мы склонны либо очеловечивать ИИ (приписывать ему понимание, волю, беспристрастность), либо демонизировать (наделять всесилием и злым умыслом). Оба движения уводят от точной картины. Трезвый взгляд скучнее и полезнее: ИИ — это мощный, но ограниченный инструмент, сотканный людьми из данных; он блестящ в своём и слеп за его границей, полезен и опасен в зависимости от того, как его строят и применяют. Именно с этой отрезвлённой позиции — без восторга и без ужаса — мы и пойдём дальше, разбираться, как всё это устроено внутри.
«Мы склонны переоценивать эффект технологии в краткосрочной перспективе и недооценивать в долгосрочной».Рой Амара, футуролог (закон Амары)
- ИИ — это чаще всего программа, а не робот: тело и способ решать — разные вещи, и самый влиятельный ИИ невидим.
- Беглая речь — не признак понимания или сознания; у нынешних систем нет «я» и картины мира, а спор о границах «понимания» ещё открыт.
- ИИ не объективен: он наследует и усиливает перекосы своих данных, и за «автономным» обучением всегда стоит большой человеческий труд.
- Мифы «завтра всех заменит» и «завтра всех уничтожит» одинаково искажают сроки и меру и отвлекают от реальных, уже наступивших проблем.
- Больше данных не значит всегда лучше — качество и уместность важнее объёма; корень мифов — склонность либо очеловечивать, либо демонизировать ИИ.
Часть вторая
История и этапы развития
Путь длиной в 80 лет: от мечты философов и машины Тьюринга — через два «ледниковых периода» разочарований — к взрыву глубокого обучения и эпохе больших моделей. История ИИ — это история надежд, зим и внезапных прорывов.
Предыстория: логика, автоматы и мечта о думающей машине
Задолго до первого компьютера люди строили механических уток и лепили глиняных великанов, а философы искали способ превратить рассуждение в арифметику. Идея искусственного разума родилась не в лаборатории. Она вызревала двадцать пять веков — пока три дороги, механика, логика и математика, наконец не сошлись в одной точке.
История искусственного интеллекта старше, чем сам интеллект в машинах. Куда старше. Прежде чем инженеры научились строить устройства, которые считают, человечество тысячелетиями грезило об устройствах, которые думают — и, само того не сознавая, копило для этой мечты три вещи по отдельности. Хитрые механизмы, притворяющиеся живыми. Строгие правила, по которым течёт правильная мысль. И машины, способные эти правила исполнять. Каждая линия шла своей дорогой, ничего не зная о соседних. Их пересечение — и есть настоящее начало нашей истории.
Проследим, как эти дороги сближались. Мечта об оживлённой материи — от античных автоматов до Голема. Мечта о механизированном разуме — от силлогизмов Аристотеля до дерзкого «давайте вычислим» Лейбница. И суровая математика, которая всё это заземлила: алгебра Буля, машина Бэббиджа, логика Фреге. А в финале — 1943 год, когда двое почти забытых сегодня людей, нейрофизиолог и математик-беспризорник, впервые нарисовали работу мозга как электрическую схему. С этого чертежа, как ни странно, выросло всё остальное.
Автоматы и Голем: механика, притворяющаяся жизнью
Самая древняя из трёх дорог — механическая. Человеку всегда хотелось сделать вещь, которая двигалась бы сама, будто у неё есть воля. Грек
Средневековый арабский инженер
⌛ Из истории
Легенда о Големе — глиняном исполине, которого пражский раввин Лёв, по преданию, оживил священным словом, — это тот же вопрос, только страшнее. Голем силён, послушен и буквален. Он делает ровно то, что сказано, ни на йоту меньше и ни на йоту больше, — и именно этим опасен. Спустя четыре столетия сюжет вернётся под скучным названием «проблема выравнивания»: как заставить сверхспособного, но бездушного исполнителя понимать наши намерения, а не букву приказа. Древние знали эту беду задолго до нас.
Но кукла есть кукла. Утка не догадывалась, что она утка. Чтобы подобраться к мысли, требовалась не механика движений, а механика самих рассуждений. И эту дорогу проложил человек, живший за две тысячи лет до всякого Вокансона.
От Аристотеля к Лейбницу: мысль как вычисление
Формальная логика
Изучение правильных форм рассуждения — тех, где истинность вывода гарантирована формой, а не темой. Верна форма — вывод следует сам собой, механически, слепо. Эта самая слепота и делает логику пригодной для машины: исполнителю не нужно понимать, о чём идёт речь. Что удобно, ведь машина понимать и не умеет.
Следующий прыжок — гигантский — совершил
«Если бы возник спор, философам не пришлось бы препираться больше, чем счётчикам. Достаточно было бы взять перья, сесть за счёты и сказать друг другу: давайте вычислим!»Готфрид Лейбниц, философ и математик
Лейбниц не только фантазировал. Около 1673 года он собрал
Буль, Бэббидж и Лавлейс: алгебра и первая машина
Эти правила нашёл английский самоучка
◆ Ключевое
Три догадки Буля складываются в азбуку любого компьютера. У высказывания только два значения. Их можно связывать операциями И, ИЛИ, НЕ. Результат вычисляется по правилам, как в арифметике. Транзистор либо пропускает ток, либо нет — вот вам буль в кремнии. Из миллиардов таких «да/нет», сшитых булевыми правилами, собирается всё: калькулятор, браузер, нейросеть.
Пока Буль формализовал мысль, его современник
Что именно изобрёл Бэббидж, лучше всех поняла не он сам, а
«Аналитическая машина не претендует на то, чтобы создавать что-либо. Она способна лишь на то, что мы умеем ей приказать.»Ада Лавлейс, математик, примечания к аналитической машине
Трезвое замечание.
Фреге, Гильберт и нейрон Маккалока–Питтса
У аристотелевой логики был потолок: ей не хватало силы выразить всю математику. Пробоину заделал немец
Дальше вступил
Теперь на столе все ингредиенты. Не хватало последнего шага — связать логику с настоящим, живым мозгом. Его сделали в 1943 году нейрофизиолог
Гениальность модели была не в точности — настоящий нейрон устроен неизмеримо хитрее, и Маккалок это прекрасно знал. Гениальность была в выводе. Сети таких пороговых элементов способны вычислить любую логическую функцию. Питтс и Маккалок доказали математически: мозг, как они его упростили, — это машина Буля, только собранная из живых клеток. И вот тут три дороги сомкнулись. Механика ожившей материи, логика правильной мысли и математика вычисления встретились в одном чертеже, где мышление и вычисление оказались, по сути, одним и тем же процессом. Из этого чертежа выросли и первые ЭВМ, и — прямой наследницей — искусственные нейросети, которым посвящена третья часть книги. Неплохо для статьи, которую почти никто не понял при выходе.
▸ Пример
Нейрон Маккалока–Питтса легко превратить в логический вентиль — крутится один рычажок, порог. Два входа и порог 2: клетка сработает, только если активны оба, — это И. Тот же нейрон, порог 1: сработает, если активен хоть один, — это ИЛИ. Добавьте тормозящий вход — получите НЕ. Все три кирпичика Буля собираются из одной клетки, меняется только число на пороге. Экономно, не правда ли?
Первая формальная логика: правильность вывода держится на форме, а не на теме.
Бронзовый аналоговый вычислитель, что предсказывал движение светил.
Ступенчатый вычислитель и мечта об исчислении рассуждений.
Чертёж первого универсального программируемого компьютера.
Программа для машины и догадка, что машина оперирует любыми символами.
Логика становится математикой из 0 и 1 — будущей азбукой компьютеров.
Кванторы «для всех» и «существует»; язык для всей математики.
Мозг описан как сеть пороговых логических элементов.
- Идея машинного разума склеилась из трёх независимых дорог: механических автоматов, формальной логики и математики вычислений.
- Аристотель показал, что у рассуждения есть форма; Лейбниц мечтал «вычислять мысли»; Буль превратил логику в алгебру из нулей и единиц.
- Бэббидж спроектировал первый универсальный компьютер, а Ада Лавлейс написала первый алгоритм и разглядела, что машина ворочает любыми символами, а не только числами.
- В 1943-м Маккалок и Питтс описали нейрон как логический элемент — и дороги сошлись: мышление и вычисление оказались одним и тем же.
Алан Тьюринг и идея вычислимого разума
В двадцать четыре года он придумал воображаемую машину, которая объяснила, что вообще значит «вычислить». В войну эта абстракция помогла ломать нацистские шифры. А в 1950-м он задал вопрос, от которого мы не отделались до сих пор: как вообще понять, что машина думает?
Если у искусственного интеллекта есть один отец-основатель, то это
Машина, которая может всё вычислимое (1936)
В 1936 году Тьюринг взялся за последний неразгаданный пункт программы Гильберта — тот самый Entscheidungsproblem. Чтобы ответить, есть ли механическая процедура на все случаи жизни, надо было сперва понять, что такое «механическая процедура» вообще. И Тьюринг придумал образ, от простоты которого захватывает дух. Вообразите бесконечную
Машина Тьюринга
Абстрактное устройство из бесконечной ленты, читающей-пишущей головки и таблицы правил вида «состояние + символ → действие». При всей нищете деталей она выполнит любой алгоритм, какой в принципе выполним. Это не чертёж железа — это математическое определение самого слова «вычисление».
Дальше — два вывода, от которых у современников голова шла кругом. Первый: есть
◆ Ключевое
Машина Тьюринга ставит потолок для любого компьютера — от лампового шкафа до нейросети на видеокартах. За этот потолок не выпрыгнуть никаким железом: чего не может машина Тьюринга, того не сможет и суперкомпьютер размером с город. Так что спор «может ли машина мыслить» — это, если приглядеться, спор о том, лежит ли мышление внутри этой границы. А это уже не мистика, а математика.
Блетчли-парк: логика против войны
Абстракции внезапно понадобились на фронте. С началом Второй мировой Тьюринга призвали в
Опираясь на работу польских математиков, которые взломали ранние версии шифра ещё до войны, Тьюринг с коллегой Гордоном Уэлчманом построил
⌛ Из истории
О Блетчли молчали десятилетиями — гриф секретности сняли только в 1970-х. Признания при жизни Тьюринг не получил. Больше того: в 1952 году его осудили за гомосексуальность, тогда в Британии уголовную, и подвергли принудительной гормональной «терапии». Он умер в 1954-м, не дожив до сорока двух, — по официальной версии, отравившись цианидом. Извинения британского правительства прозвучали в 2009-м, посмертное помилование — в 2013-м. Полвека спустя. Человека, который помог выиграть войну, страна благодарила очень, очень поздно.
Блетчли научил Тьюринга простой, но крамольной вещи. Машина, тупо перебирающая варианты по правилам, делает то, что мы гордо зовём «умом»: разгадывает, дешифрует, ловит закономерности там, где человек видит хаос. Отсюда до его главного вопроса оставался один шаг.
«Computing Machinery and Intelligence»: имитационная игра
В 1950 году в философском журнале Mind вышла статья «Вычислительные машины и разум» — самый цитируемый текст в истории ИИ. Открывается он вопросом «Могут ли машины мыслить?» — и Тьюринг тут же его выбрасывает. Слишком мутно. Спорить о том, что значат слова «машина» и «мыслить», можно веками и без толку. Вместо этого он подменяет туманный вопрос точным испытанием —
Правила просты и лукавы. Судья переписывается с двумя невидимыми собеседниками. Один — человек, другой — машина. Судье надо понять, кто есть кто; машине — сойти за человека. Если в долгих беседах машина дурачит судью не реже, чем это удавалось бы человеку на её месте, разумно признать: по всем внешним приметам она мыслит. Из чего собеседник сделан, Тьюринг сознательно вынес за скобки. Важно не «что внутри», а «что он способен сказать». Судите по делам, не по устройству.
Тьюринг рискнул и с прогнозом. Он полагал, что примерно к 2000 году машины с памятью около миллиарда бит будут обманывать среднего судью хотя бы в трети пятиминутных бесед. По срокам он промахнулся — эти пять минут дались машинам позже и труднее. Но по сути угодил в яблочко: нынешние языковые модели болтают так, что этот порог давно взят, и спор сместился. Теперь мы препираемся не о том, пройдёт ли машина тест, а о том, что вообще этот тест доказывает. Хороший вопрос. К нему мы ещё вернёмся не раз.
Возражения: от «души» до китайской комнаты
Тьюринг был честнее большинства спорщиков: он сам собрал в статье девять возражений против мыслящих машин и разобрал каждое, не пряча самых неудобных. Богословское — «мышление есть дар души, а не тела» — он отвёл как странную попытку ограничить всемогущество Бога. Возражение «страуса» — «это слишком жутко, давайте не будем об этом думать» — назвал не аргументом, а психологией. Математическое, ссылку на теоремы Гёделя о пределах формальных систем, парировал так: у человеческого ума ведь тоже есть свои пределы, и что с того? Самым серьёзным он считал
Самое знаменитое возражение появилось на тридцать лет позже — и метит прямо в сердце теста. В 1980 году философ
✕ Заблуждение
«Раз программа прошла тест Тьюринга — значит, она понимает и осознаёт, о чём говорит». Не значит. Аргумент Сёрла ровно об этом: система может вести себя как понимающая, оставаясь чистым перекладыванием символов. Понимание за поведением может быть, а может и не быть — тест их не различает. И в эпоху больших языковых моделей этот старый спор стал острее, чем когда-либо.
Защитники Тьюринга бьют в ответ «аргументом системы». Ну да, человек внутри не знает китайского — а вот вся система целиком, комната, инструкция и человек вместе, его знает. Точно так же, как отдельный нейрон в вашей голове не знает русского, а голова целиком на нём говорит. Красиво? Безусловно. Убедительно? Как посмотреть. Согласованного финала у этого спора нет и, похоже, не предвидится — и в этом, парадоксально, главная заслуга Тьюринга. Он не столько ответил на вопрос о мыслящих машинах, сколько вытащил его из тумана и сделал предметом честного разговора. Дал нам линейку — тест. Дал словарь для спора. Осталось придумать самому направлению имя. Это случится через шесть лет, за океаном, в крохотном университетском городке, куда мы и отправимся.
- Машина Тьюринга (1936) строго определила, что значит «вычислить», и очертила предел вычислимого; её универсальная версия — прообраз любого компьютера.
- В Блетчли-парке абстракция пошла в дело: «Бомба» ломала «Энигму» и приближала конец войны.
- Статьёй 1950 года Тьюринг подменил спорный вопрос «может ли машина мыслить» проверяемым испытанием: не отличить машину от человека в переписке — считаем, что она мыслит.
- Тест меряет поведение, а не устройство; «Китайская комната» Сёрла (1980) возражает, что имитация символов — ещё не понимание. Спор открыт по сей день.
Дартмут-1956: как ИИ получил имя
Летом 1956-го десяток учёных съехались в сонный городок Хановер, чтобы за пару месяцев «в основном решить» проблему машинного разума. Не решили, разумеется. Зато у поля появилось имя, повестка и первое поколение основателей — а с ними и опасная привычка обещать больше, чем можешь.
У научных дисциплин редко бывает день рождения. У искусственного интеллекта он есть — лето 1956 года,
Заявка, придумавшая термин
Всё началось с бумаги. 31 августа 1955 года четверо учёных подали в Рокфеллеровский фонд заявку на финансирование летних посиделок. Авторы — фигуры, каждая из которых стоит отдельной биографии.
В сердце заявки — одна дерзкая до наглости гипотеза, сформулированная с такой уверенностью, что она стала девизом всего дела.
«Всякий аспект обучения или любое иное свойство интеллекта в принципе можно описать столь точно, что машину удастся заставить его воспроизвести.»Заявка на Дартмутский семинар, 1955
Вот она,
⌛ Из истории
Рокфеллеровский фонд дал заметно меньше запрошенного — около семи с половиной тысяч долларов. Да и семинаром в привычном смысле это не было: не конгресс с докладами, а затяжной мозговой штурм, куда участники приезжали и уезжали кто когда. Один на неделю, другой на всё лето. Общего расписания почти не держали, и, по воспоминаниям очевидцев, никакого совместного прорыва там не грянуло. Историческим Дартмут сделал не результат, а список гостей и подаренное полю имя. Иногда этого достаточно.
Кто собрался в Хановере
Дартмут свёл людей, у каждого из которых была своя вера в то, что такое машинный разум, — и веры эти тянули в разные стороны. Для Маккарти интеллект был логикой: правильные рассуждения над формально записанным знанием (позже он создаст язык
К четвёрке организаторов подтянулись и другие.
Logic Theorist: первая мыслящая программа
Пока Дартмут только замышляли, в калифорнийской корпорации RAND трое —
Мишенью выбрали теоремы из «Principia Mathematica» — толстенного труда Рассела и Уайтхеда по самым основаниям математики. Заметьте важное: программа не ломилась через все возможные цепочки вывода подряд, их слишком много даже для машины. Она пользовалась
Саймон, не мучаясь скромностью, объявил студентам, что за рождественские каникулы они с Ньюэллом «изобрели мыслящую машину». И дело было не в одних теоремах. Ради Logic Theorist они соорудили
◆ Ключевое
Logic Theorist задал шаблон целой эпохи, которую позже окрестят символической, или GOFAI. Рецепт прост: знания записываем символами и правилами, а мышление — это поиск нужной цепочки правил. Подход правил бал до 1980-х, пока лидерство не перехватили обучающиеся нейросети, к которым мы придём дальше в книге. Всё возвращается на круги своя — просто круги большие.
Обещания и ранний оптимизм
Дартмут запустил не только исследования. Он запустил особую культуру — культуру громких обещаний с точной датой. Первые успехи так пьянили, что основатели снова и снова называли близкие, конкретные сроки полной победы. Читать эти прогнозы сегодня — отдельное упражнение в смирении. И в сочувствии.
| Год и автор | Обещание | Что вышло на деле |
|---|---|---|
| 1957, Г. Саймон | Через 10 лет компьютер станет чемпионом мира по шахматам | Сбылось — но в 1997-м (Deep Blue), с опозданием на тридцать лет |
| 1965, Г. Саймон | Через 20 лет машины смогут делать любую работу, доступную человеку | К 1985-му и близко ничего подобного |
| 1967, М. Минский | За одно поколение проблема ИИ будет в основном решена | Вместо решения пришла «зима ИИ» |
| 1970, М. Минский | Через 3–8 лет появится машина с интеллектом среднего человека | Мимо; финансирование вскоре урезали |
Почему такие умные люди так грубо промахивались? Они недооценили одного тихого врага —
⚠ Осторожно
Цикл «прорыв — громкое обещание — разочарование — заморозка» повторится в истории ИИ не раз и не два. Умение отделять реальный результат от вдохновенного прогноза пригодится и вам, прямо сегодня, когда об искусственном интеллекте снова говорят исключительно в превосходных степенях. Спрашивайте не «что обещают», а «что уже работает и в каких границах». Разница между этими двумя вопросами — это разница между инвестором и мечтателем.
Тест Тьюринга задаёт полю его главный вопрос ещё до того, как у поля появилось имя.
Одна из первых железных моделей нейронной сети — из ламп и моторчиков.
Программа, что учится игре на собственных партиях.
Маккарти вводит термин «искусственный интеллект»; Ньюэлл и Саймон пишут первую мыслящую программу.
Официальный день рождения ИИ как научного направления.
Розенблатт создаёт обучаемый перцептрон; Ньюэлл и Саймон — General Problem Solver.
Маккарти создаёт язык, что станет главным инструментом ИИ на десятилетия.
За восемь недель 1956 года проблему разума, само собой, не «решили». Но случилось кое-что поважнее любого решения. Разрозненные догадки философов, логиков и инженеров обрели общее имя, общую повестку и сообщество людей, готовых положить на неё жизнь. Мечта о думающей машине, тлевшая со времён античных уток и глиняных великанов, стала наконец профессией. А вместе с профессией пришли её вечные спутники — прорывы, перегретые надежды и отрезвляющие зимы. Их чередование и составит всю дальнейшую историю искусственного интеллекта. Пристегнитесь.
- Дартмутский семинар лета 1956 года считают точкой рождения ИИ как науки; там Джон Маккарти впервые предложил термин «искусственный интеллект».
- Организаторы — Маккарти, Минский, Шеннон и Рочестер — исходили из гипотезы: любое свойство интеллекта можно описать так точно, что его повторит машина.
- Logic Theorist Ньюэлла и Саймона (1955–56) стал первой мыслящей программой; он доказывал теоремы с помощью эвристик и задал парадигму символического ИИ — поиск в пространстве состояний.
- Ранний успех породил слишком смелые обещания; недооценка сложности реального мира позже обернулась разочарованием и «зимой ИИ».
Золотой век и первая «зима ИИ»
Летом 1956 года небольшая группа математиков поверила, что мыслящую машину можно построить за одно поколение. Через восемнадцать лет деньги закончились, лаборатории опустели, а само словосочетание «искусственный интеллект» стало неприличным. Это история о том, как рождается и лопается научный оптимизм — и почему у ИИ этот цикл повторится не раз.
Лето, когда всё казалось возможным
В 1956 году в Дартмутском колледже собрались десять человек, чтобы за одно лето, как они всерьёз рассчитывали, заложить основы машинного разума. Именно там математик Джон Маккарти предложил термин искусственный интеллект (AI) — отчасти для того, чтобы отмежеваться от кибернетики Норберта Винера. Заявка на семинар была написана с обезоруживающей уверенностью: авторы полагали, что «всякий аспект обучения и любую другую черту интеллекта можно в принципе описать так точно, что машину удастся заставить его воспроизвести».
⌛ Из истории
Заявку на Дартмутский семинар 1956 года подписали Джон Маккарти, Марвин Минский, Натаниэл Рочестер (из IBM) и Клод Шеннон — отец теории информации. Планировалось, что «прорыв» совершат десять человек за два месяца. Спустя семьдесят лет над той же задачей работают сотни тысяч исследователей.
И ведь оптимизм не был пустым. Ещё до Дартмута программа Logic Theorist Аллена Ньюэлла и Герберта Саймона доказывала теоремы из «Principia Mathematica» — а одну ухитрилась доказать изящнее, чем сами Уайтхед с Расселом. В 1954-м Джорджтаунско-айбиэмовский эксперимент публично перевёл с русского на английский шесть десятков фраз. Газеты решили: универсальный перевод — дело трёх-пяти лет. Военное агентство ARPA (будущее DARPA) сыпало деньгами, почти не спрашивая отчётов, — гении, мол, сами разберутся. Разбирались они потом четверть века.
«Машины будут способны в течение двадцати лет выполнять любую работу, которую может делать человек».Герберт Саймон, 1965
Марвин Минский вторил в 1970 году: через «от трёх до восьми лет у нас будет машина с общим интеллектом среднего человека». Эти прогнозы важны не как курьёз, а как симптом. Ранние успехи ИИ достигались в задачах, которые кажутся вершиной интеллекта — логика, шахматы, доказательство теорем. Отсюда родилось роковое допущение: раз машина осилила трудное для человека, то лёгкое (узнать лицо, понять фразу, пройти по комнате) она осилит и подавно. Как мы увидим, всё оказалось ровно наоборот.
Микромиры, SHRDLU и обаятельная ELIZA
Реальный мир был для тогдашних машин непосильно сложен, поэтому исследователи придумали хитрый ход — микромиры (microworlds): крошечные, полностью формализованные вселенные, где можно перечислить все объекты и правила. Самый знаменитый из них — «мир кубиков». В 1970 году Терри Виноград создал программу SHRDLU, которая понимала команды на английском вроде «поставь красный кубик на зелёный» и «найди блок выше того, который ты держал», манипулировала виртуальными фигурами и даже отвечала на вопросы о своих действиях. Впечатление было ошеломляющим: казалось, машина понимает язык.
✕ Заблуждение
«Раз SHRDLU так свободно рассуждает о кубиках, до разговора о реальном мире — один шаг». На деле шага не было, была пропасть. Вся «понятливость» SHRDLU держалась на том, что мир кубиков содержал десяток объектов и жёсткий свод правил. Стоило выйти за его пределы — и знание, которое пришлось бы вложить в программу, разрасталось взрывообразно. Успех в микромире почти ничего не говорил о большом мире.
Здесь пряталась ловушка, которую тогда мало кто разглядел. Задачи, что казались вершиной ума — логика, шахматы, доказательство теорем, — давались машине сравнительно легко: у них жёсткие правила и обозримое поле. А то, что любой трёхлетний ребёнок делает не думая — узнать мамино лицо, поймать мяч, понять, почему «он взял её зонт: на улице дождь», — оказалось неприступной крепостью. Позже это назовут парадоксом Моравека: трудное для нас легко для машины, а лёгкое для нас — почти невозможно. Микромиры, если начистоту, жульничали. Они аккуратно вырезали из задачи ровно ту часть, где и живёт настоящий интеллект: необъятный, ни в какие правила не влезающий здравый смысл.
Иначе устроен был другой громкий проект. В 1966 году Джозеф Вейценбаум написал ELIZA — программу, имитировавшую психотерапевта. Она не понимала ни слова: находила в реплике ключевые обороты и переворачивала их в вопрос («Меня огорчает мать» → «Расскажите подробнее о вашей матери»). И всё же люди изливали ей душу, а секретарша самого Вейценбаума просила его выйти из комнаты, пока она «беседует» с машиной. Так родился эффект ELIZA — склонность человека приписывать программе понимание и чувства там, где есть лишь ловкая подстановка слов. Сам Вейценбаум был потрясён и стал одним из первых критиков ИИ.
▸ Пример
Диалог с ELIZA. Пациент: «Все мужчины одинаковые». ELIZA: «В каком смысле?» Пациент: «Они вечно чем-то нас донимают». ELIZA: «Можете привести конкретный пример?» — Ни капли понимания, чистая манипуляция шаблонами. Но собеседник чувствует, что его слушают.
Вейценбаума испугало не то, что программа обманывает. Его испугало, с какой охотой люди хотят быть обманутыми. Если пары шаблонов и зеркального повтора довольно, чтобы человек уверовал в понимание и сочувствие, — что это говорит о нас самих? Из этого испуга выросла его книга «Возможности вычислительных машин и человеческий разум» (1976) — ранний и до сих пор не выцветший манифест о том, где машине не место. Запомните эффект ELIZA. Он ещё аукнется, когда мы дойдём до чат-ботов, от которых снова будет не оторваться.
Рядом с символическим лагерем зрела совсем другая мысль: не диктовать машине правила, а показать ей примеры. В 1958 году психолог Фрэнк Розенблатт представил перцептрон (perceptron). И это была не абстракция на бумаге, а настоящая машина, Mark I Perceptron, с решёткой фотоэлементов вместо глаза. Она училась различать образы, подкручивая числовые «веса» связей, — прапрадед сегодняшних нейросетей. Пресса, разумеется, потеряла голову: «New York Times» пересказывала прогноз, что перцептрон вот-вот научится ходить, говорить, видеть и — не больше не меньше — осознавать собственное существование. До этого, мягко говоря, было далеко.
Перцептрон
Простейший обучаемый классификатор. Он берёт входные признаки, умножает каждый на свой вес, суммирует и, если сумма превысила порог, выдаёт «да», иначе «нет». Обучение — это подстройка весов по ошибкам на примерах. Один такой элемент проводит в пространстве признаков ровно одну прямую границу между двумя классами. В этой прямизне — и его сила, и его роковая слабость.
Книга, которая заморозила нейросети
В 1969 году Марвин Минский и Сеймур Пейперт выпустили строгую математическую книгу «Perceptrons». В ней они доказали то, что энтузиасты предпочитали не замечать: одиночный перцептрон в принципе не способен вычислить функцию «исключающее ИЛИ» (XOR) — «либо одно, либо другое, но не оба сразу». Причина геометрическая и неустранимая. Перцептрон умеет разделять примеры одной прямой линией, а для XOR такой линии не существует: два «истинных» случая лежат по разным углам квадрата, и никакая прямая не отделит их от двух «ложных».
Формально Минский и Пейперт были правы, и придирок к их математике нет. Проблема была в интонации и в акцентах: книга оставляла ощущение, что тупиковой является вся идея обучаемых сетей, — хотя многослойный перцептрон XOR решает без труда. Беда в том, что обучать многослойные сети тогда не умели: алгоритм обратного распространения ошибки, который снимет это ограничение, войдёт в обиход лишь в середине 1980-х (глава 12). А пока эффект был сокрушительным: финансирование нейросетевого направления практически иссякло почти на пятнадцать лет. Розенблатт погиб в 1971-м, не дожив до реабилитации своих идей.
Ирония в том, что Минский вовсе не был врагом нейросетей — в юности он сам их мастерил. Он был врагом шумихи и необеспеченных обещаний. Но научное сообщество прочло его книгу как приговор, а не как предостережение, — и целое направление ушло под лёд на полтора десятилетия. Отличный урок о том, что в науке весит не только правота, но и интонация, с какой она произнесена.
Отчёт Лайтхилла и наступление «зимы»
К началу 1970-х накопился счёт и по другим фронтам. Машинный перевод, обещанный «через пару лет», буксовал: ещё в 1966 году американский отчёт ALPAC признал его тупиковым и обрубил деньги. Знаменит стал апокриф про перевод «дух бодр, плоть же немощна» на русский и обратно — вышло что-то вроде «водка хороша, но мясо протухло». Реальность языка, полного контекста и двусмысленностей, не помещалась в правила.
Решающий удар нанесла Британия. В 1973 году физик сэр Джеймс Лайтхилл по заказу Совета по научным исследованиям представил отчёт Лайтхилла — разгромный обзор состояния ИИ. Его центральный аргумент: методы, блестяще работающие в игрушечных микромирах, наталкиваются на комбинаторный взрыв (combinatorial explosion) — число вариантов, которые надо перебрать, растёт так стремительно, что никакая мыслимая вычислительная мощность не спасает. Программа, ищущая путь среди десяти кубиков, задыхается среди тысячи. Лайтхилл заключил, что громкие обещания не выполнены и вряд ли будут. Британское правительство свернуло поддержку ИИ почти во всех университетах страны.
Что такое комбинаторный взрыв, легче всего почувствовать на пальцах. Пусть программа планирует ходы и на каждом шаге выбирает из десяти вариантов. Один ход вперёд — десять веток. Два хода — сотня. Десять ходов — уже десять миллиардов. Накиньте ещё пару шагов — и не хватит ни одного компьютера во Вселенной, чтобы всё это перебрать. В крошечном мире кубиков веток было наперечёт, и перебор проскакивал мгновенно. А реальный мир на каждом шагу подсовывает не десять вариантов, а тысячи. Вот в чём соль возражения Лайтхилла: дело не в том, что компьютеры пока слабы, а в том, что задача растёт экспоненциально. Экспонента же обгонит любое железо — всегда.
Публичная демонстрация машинного перевода с русского. Пресса обещает всеобщий перевод «через пять лет».
Рождение термина «искусственный интеллект» и самой дисциплины.
Розенблатт строит обучаемую машину Mark I — предка нейросетей.
Финансирование машинного перевода в США заморожено.
Минский и Пейперт публикуют проблему XOR; нейросети уходят в тень.
Британия сворачивает исследования ИИ. Начинается первая «зима».
Так примерно с 1974 по 1980 год длилась первая «зима ИИ» (AI winter) — период, когда финансирование, публикации и вера в скорый результат разом схлопнулись. За этими событиями скрывается механизм, который будет повторяться в истории технологий снова и снова. Назовём его циклом ажиотажа.
Логика цикла проста и безжалостна. Завышенные ожидания нужны, чтобы привлечь финансирование, — исследователи и журналисты вместе раздувают обещания. Наступает разочарование: сроки сорваны, задачи оказались труднее, чем на пресс-конференции. И приходит сокращение денег — инвесторы и государство отворачиваются, наступает застой. Но заметьте: реальные возможности всё это время растут, пусть и не так быстро, как хотелось. «Зима» убивает не науку, а иллюзии. Пройдёт несколько лет — и на скромно накопленном фундаменте вырастет новая волна, с новыми обещаниями. Так случится и в 1980-х, к которым мы перейдём в следующей главе.
⚠ Осторожно
Слово «зима» вводит в заблуждение, если понимать его как гибель. Точнее говорить о заморозке ажиотажа: базовые исследования продолжались и в холода, просто тише и дешевле. Именно в «зимние» годы вызревали идеи, которые оттают следующей весной.
- С Дартмутского семинара 1956 года ИИ стартовал на волне оптимизма: ведущие учёные обещали машинный разум за 10–20 лет.
- Ранние успехи достигались в микромирах (SHRDLU) и трюками (ELIZA), но не масштабировались до реального мира — сработал комбинаторный взрыв.
- Книга Минского и Пейперта «Perceptrons» (1969) показала, что одиночный перцептрон не решает XOR, и почти заморозила нейросети на 15 лет.
- Отчёты ALPAC (1966) и Лайтхилла (1973) обрубили финансирование; наступила первая «зима ИИ» (около 1974–1980).
- Проявился цикл: завышенные ожидания → разочарование → сокращение денег. Реальные возможности при этом продолжают тихо расти.
Экспертные системы и вторая зима
В 1980-е ИИ вернулся из холодов — но уже в костюме и с бизнес-планом. Идея была прагматичной: не строить универсальный разум, а перелить в машину знания живого эксперта — врача, химика, инженера. На несколько лет это стало золотой жилой. А потом жила иссякла, и наступила вторая зима — по причинам, которые многое объясняют в природе интеллекта.
Ставка на знания, а не на разум
Из первой зимы вынесли трезвую мысль. Универсальный разум пока не по зубам — ладно. Но узкий, зато глубокий профессионализм? Вот за это можно взяться. Так родились экспертные системы (expert systems). Такая программа не «мыслит» в широком смысле — она держит в памяти знания одного-единственного специалиста, разложенные на тысячи правил «ЕСЛИ… ТО…», и прикладывает их к конкретной задаче. Девиз эпохи, который приписывают Эдварду Фейгенбауму, был обезоруживающе прост: сила не в хитроумии рассуждений, а в объёме знаний. Знай побольше — и рассуждать почти не придётся. Отсюда и второе имя направления — «инженерия знаний».
Экспертная система
Программа, воспроизводящая решения специалиста в узкой области с помощью явной базы знаний — набора правил вида «ЕСЛИ выполнены условия, ТО следует вывод». Отдельный механизм — машина вывода — комбинирует правила, чтобы из известных фактов вывести новые, вплоть до итогового заключения, и часто может объяснить свою цепочку рассуждений.
Первопроходцы появились ещё в 1970-х, в Стэнфорде. DENDRAL (с 1965 года) определял молекулярную структуру химических веществ по данным масс-спектрометрии — и делал это на уровне хорошего химика. MYCIN (начало 1970-х, Эдвард Шортлифф) ставил диагноз при инфекциях крови и рекомендовал антибиотик с дозировкой; в испытаниях он не уступал врачам-инфекционистам. У MYCIN было около 600 правил и — что важно — способность объяснить, почему он пришёл к выводу, и оценить свою уверенность. В клинику MYCIN так и не попал, но как доказательство принципа он был безупречен.
А почему, собственно, не попал? Не из-за качества советов — с ними-то был порядок. Помешали вещи прозаические, человеческие. Кто ответит, если машина промахнётся с дозой антибиотика, — программист, больница, автор правил? И как втиснуть громоздкую систему в быт клиники 1970-х, где на столах ещё нет ни персональных компьютеров, ни сети между ними? Юридический и организационный мир попросту не поспел за техническим. Сцену запомните: она повторится почти дословно и с медицинским ИИ наших дней, и с беспилотными автомобилями. Умение — это ещё не разрешение им пользоваться.
⌛ Из истории
Коммерческий прорыв совершила система XCON (изначально R1), созданная Джоном Макдермоттом для корпорации DEC около 1980 года. Она конфигурировала заказы на мини-компьютеры VAX — задача муторная и чреватая ошибками. К середине 1980-х XCON насчитывала тысячи правил и, по оценкам DEC, экономила компании порядка 40 млн долларов в год. Вот оно, доказательство: на ИИ можно зарабатывать.
Дальше начался настоящий бум. Возникла целая индустрия: фирмы продавали «оболочки» экспертных систем и специальные Lisp-машины (Lisp machines) — дорогие рабочие станции, заточенные под язык Lisp, любимый язык ИИ. Япония в 1982 году запустила амбициозный государственный проект «ЭВМ пятого поколения» (Fifth Generation Computer Systems) — десятилетний план создать компьютеры, рассуждающие логически и понимающие язык. Испугавшись, что отстанут, США и Британия ответили своими программами. Ажиотаж повторял сценарий 1960-х — только теперь с оборотами в миллиарды.
Масштаб кружил голову. К середине 1980-х экспертными системами обзавелись сотни крупных корпораций; выросла целая отрасль — продавцы «оболочек», консультанты, а с ними и профессия «инженер по знаниям», которой пятью годами раньше не существовало вовсе. Деньги потекли рекой. А вместе с деньгами, как заведено, потекли и обещания: ещё чуть-чуть — и машина заменит эксперта в любой области. Вы, наверное, уже догадываетесь, куда всё это движется.
Особняком стоял японский замах. Проект «пятого поколения» (стартовал в 1982-м) не собирался писать очередную коробочную программу — он метил в саму архитектуру вычислений. Ставку сделали на массовый параллелизм и логическое программирование на языке Prolog: тысячи процессоров, которые «рассуждают» логическими выводами, а не молотят числа. Замысел был дерзкий и красивый. Запад не на шутку струхнул, что проспит будущее, и наспех слепил ответные программы — американскую, британскую, европейскую. Финал известен наперёд: через десять лет выяснилось, что дорога вела не туда. Логический вывод в интеллект не масштабируется, а хитрое параллельное железо обошли обычные процессоры, которые дешевели с каждым годом. Красивая идея, разбившаяся о реальность, — и очень дорогая.
Как устроена экспертная система
Чтобы понять и взлёт, и падение, полезно разобрать анатомию такой системы. У неё три ядра и два человека рядом с ней.
Разберём работу машины вывода на игрушечном медицинском примере. Она действует как логическая цепочка, «зажигая» правило за правилом, — это называют прямым выводом (forward chaining): от известных фактов к новым, пока не сложится диагноз.
- Факты на входе
Пользователь сообщает: у пациента жар и боль в горле.
- Срабатывает правило 1
«ЕСЛИ жар И боль в горле, ТО подозрение на инфекцию». В рабочую память добавляется новый факт: «инфекция».
- Срабатывает правило 2
«ЕСЛИ инфекция И налёт на миндалинах, ТО вероятна ангина». Система спрашивает про налёт, получает «да» — добавляется факт «ангина».
- Заключение и объяснение
«ЕСЛИ ангина, ТО назначить антибиотик». Система выдаёт рекомендацию и по запросу показывает всю цепочку правил, которая к ней привела.
Эта прозрачность подкупала: в отличие от нынешних нейросетей, экспертная система всегда могла объяснить почему. Но в той же архитектуре пряталась и мина замедленного действия.
Хрупкость, узкое место и вторая зима
Первая трещина — хрупкость (brittleness). Система знает ровно то, что в неё вложили. Ни каплей больше. Здравого смысла у неё нет — той необъятной фоновой картины мира, которой мы с вами пользуемся, даже не замечая этого. Наткнувшись на факт вне своих правил, медицинская программа не «сообразит» по аналогии, как сделал бы врач. Она либо замолчит, либо с каменным лицом выдаст чушь. И вот что важно: у живого эксперта знание на краю компетенции тает плавно — он чувствует, где начинает плавать. Экспертная система не тает. Она обрывается в пропасть на полном ходу.
▸ Пример
Если сообщить медицинской системе, что «пациент» — это ржавый автомобиль, она не удивится и не переспросит: у неё нет понятия, что автомобили не болеют ангиной. Она послушно применит правила про жар и горло к тому, у чего нет ни того, ни другого. Человеку такая ошибка немыслима — именно потому, что у него есть здравый смысл, а у системы правил его нет.
Вторая, ещё более коварная трещина — узкое место извлечения знаний (knowledge acquisition bottleneck). Чтобы наполнить базу, инженер по знаниям должен часами расспрашивать эксперта и вручную превращать его опыт в правила. Но лучшие специалисты знают куда больше, чем способны выразить словами: интуиция врача или дегустатора — это неявное, «молчаливое» знание, не раскладывающееся на «ЕСЛИ… ТО…». Наполнение шло мучительно медленно, а большая база превращалась в кошмар сопровождения: тысячи правил начинали противоречить друг другу, и добавление одного ломало десяток других.
Вообразите, что вам поручили выпотрошить в правила опыт гениального диагноста. Вы садитесь напротив: «Как вы поняли, что тут не аппендицит?» А он пожимает плечами: «Ну… не похоже. Чувствую». И он не увиливает — он правда не знает. Мастерство годами утекает в интуицию, в тело, в кончики пальцев, и обратно в слова уже не разбирается. Инженер по знаниям месяцами вытягивал из эксперта то, чего тот сам за собой не замечал, а после ещё и мирил между собой сотни правил, чтобы они не переругались. Каждое новое грозило сломать десяток старых. База пухла — и превращалась в трясину, по которой уже не пройти.
| Сильные стороны | Слабые стороны |
|---|---|
| Прозрачность: объясняет каждый вывод | Хрупкость: катастрофа на границе компетенции |
| Экспертный уровень в узкой области | Нет здравого смысла и обобщения |
| Знание отделено от программы, база пополняема | Узкое место: ручное извлечение знаний — медленно и дорого |
| Не требует больших данных для запуска | Не учится сама, не улучшается с опытом |
| Предсказуемость и воспроизводимость | Сопровождение больших баз почти невозможно |
К концу 1980-х счёт был предъявлен. XCON, разросшаяся до многих тысяч правил, стала настолько запутанной, что её поддержка съедала выгоду. Дорогие Lisp-машины проиграли рынок: обычные рабочие станции Sun и персональные компьютеры фирмы стремительно догнали их по мощности и стоили в разы дешевле. Около 1987 года специализированный рынок Lisp-машин рухнул почти мгновенно — многомиллионная индустрия испарилась за считанные месяцы. Японский проект «пятого поколения», завершившийся в 1992-м, не достиг громких целей: логическое программирование не стало дорогой к разуму.
Была у этого краха и психологическая развязка. К концу 1980-х слова «искусственный интеллект» в деловом мире звучали почти как ругательство: инвестор, услышав их на презентации, тянулся не к чековой книжке, а к двери. Фирмы, ещё вчера гордо звавшие себя «ИИ-компаниями», спешно переименовывались во что посолиднее — «системы поддержки решений», «бизнес-аналитика». Технология-то никуда не делась и работала как прежде; сгорело именно слово, дотла обожжённое несбывшимися обещаниями. Точно так же поступят и наследники этих людей в девяностых. Об этом — следующая глава.
Так наступила вторая «зима ИИ» — примерно с 1987 по 1993 год. Обратите внимание: цикл из девятой главы повторился с точностью до деталей. Завышенные ожидания (машина заменит эксперта, «пятое поколение» обгонит Запад) → разочарование (хрупкость, неподъёмное сопровождение, дешёвое «железо» конкурентов) → сокращение денег (крах Lisp-рынка, свёртывание госпрограмм). Но, как и в первый раз, под снегом зрело новое. Инженеры уже задавали неудобный вопрос: а что, если не вкладывать правила вручную, а позволить машине вывести их самой — из данных? Ответом станет тихая революция, о которой — следующая глава.
◆ Ключевое
Экспертные системы провалились не потому, что были глупыми, а потому, что интеллект — это не только правила. Огромная часть человеческого мастерства — это неявное знание и здравый смысл, которые невозможно выписать в виде «ЕСЛИ… ТО…». Уперевшись в эту стену, поле ИИ было вынуждено искать другой путь — и путь этот оказался неожиданным. Не улучшать старый способ, а отказаться от самой идеи, будто знание можно вложить в машину заранее, руками. Пусть добывает его сама.
- В 1980-е ИИ вернулся через экспертные системы: знания специалиста кодировались тысячами правил «ЕСЛИ… ТО…».
- Успехи DENDRAL, MYCIN и коммерческой XCON запустили бум; Япония ответила проектом «ЭВМ пятого поколения» (1982–1992).
- Архитектура: база знаний + машина вывода + интерфейс, наполняемые инженером по знаниям от живого эксперта.
- Системы оказались хрупкими (ноль здравого смысла) и упёрлись в узкое место извлечения знаний — ручное и медленное.
- Крах рынка Lisp-машин (около 1987) привёл ко второй «зиме» (около 1987–1993); цикл ажиотажа повторился.
Тихая революция машинного обучения
Пока пресса хоронила искусственный интеллект, происходил самый важный сдвиг в его истории — почти незаметный. Исследователи перестали писать машине правила и начали давать ей примеры, чтобы правила она выводила сама. Без громких манифестов, под скромными вывесками «статистика» и «распознавание образов», рождалось машинное обучение — фундамент всего, что случится дальше.
Смена парадигмы: от правил к данным
Две зимы вбили в голову один и тот же урок. Кодировать интеллект руками — тупик. Мир слишком полон исключений, чтобы влезть в свод правил, а мастерство экспертов слишком неуловимо, чтобы его продиктовать. И тогда вопрос перевернули с ног на голову. Не «как объяснить машине, что такое кошка?» — а попробуйте, кстати, прямо сейчас определить кошку через набор признаков, чтобы под него не подошла ни рысь, ни енот; замучаетесь, — а «как показать машине тысячу кошек, чтобы она вывела определение сама?». В этом вся суть машинного обучения (machine learning): программа не исполняет вложенные человеком инструкции, а нащупывает решение на примерах и раз за разом становится точнее.
Смена языка была не косметической. Старый ИИ мыслил логикой: утверждение либо истинно, либо ложно, вывод либо строг, либо неверен. Новый заговорил на языке вероятностей — и это, как ни странно, куда ближе и к устройству мира, и к работе нашего собственного ума. Вы ведь не доказываете, что перед вами знакомый, выхватив лицо в толпе, — вы мгновенно прикидываете правдоподобие и почти всегда угадываете. Статистика вытеснила жёсткие символы: интеллект стали понимать как поиск закономерностей в шумных данных, а не как безупречную цепочку выводов. Джудеа Перл дал этому строгий аппарат — байесовские сети, за которые позже получит премию Тьюринга.
И ещё была тихая смена вывесок. После двух зим слишком многие обжигались об одни только слова «искусственный интеллект» — и работали под нейтральными «машинное обучение», «распознавание образов», «интеллектуальный анализ данных». Отчасти хитрость, отчасти честность: эти люди и правда занимались чем-то более скромным и приземлённым, чем машинный разум. Иногда, чтобы поле выжило, ему полезно на время сменить имя.
Инструментарий тихой революции
С конца 1980-х и в 1990-е сложился набор методов, который и сегодня — рабочая лошадь индустрии. Каждый по-своему отвечает на вопрос «как вывести закономерность из примеров».
- Деревья решений (decision trees) — каскад вопросов «да/нет», рассекающий данные на всё более однородные группы. Прозрачны и читаемы, как блок-схема.
- Метод k ближайших соседей (k-NN) — обезоруживающе простая идея: чтобы классифицировать новый пример, посмотри на самые похожие из уже известных и проголосуй большинством.
- Метод опорных векторов (SVM, Кортес и Вапник, 1995) — ищет границу с максимальным зазором между классами; хитрый «ядровой трюк» позволяет разделять и то, что прямой не разделишь (вспомните XOR из девятой главы).
- Байесовские методы (Bayesian) — рассуждают в терминах вероятностей и обновляют уверенность по мере поступления данных. На них выросли первые эффективные фильтры спама.
- Случайный лес (random forest, Брейман, 2001) и бустинг (boosting; AdaBoost — Фройнд и Шапире, 1995) — «ансамбли»: множество слабых моделей объединяются в одну сильную. Часто именно они выигрывают на практике.
Разные снаружи, эти методы решают одну задачу: по обучающей выборке (training set) — размеченным примерам — построить модель, которая верно ответит на новых, ещё не виденных данных. Эта способность и есть главный приз.
Под всей этой россыпью рецептов зрел и теоретический фундамент. Владимир Вапник и Алексей Червоненкис ещё в советских 1970-х строили статистическую теорию обучения — математику о том, когда модель, ладно севшая на примеры, и вправду будет работать на новом, а когда лишь притворяется, вызубрив ответы. Долгие годы это оставалось делом узкого круга. А в девяностых, уже за океаном, из той теории и вырос метод опорных векторов — и вдруг стало ясно: у «обучения на данных» есть не только инженерные рецепты, но и строгие законы. Интуиция обрела доказательства.
Обобщение
Обобщение (generalization) — способность обученной модели давать верные ответы на данных, которых она не видела при обучении. Заучить обучающую выборку наизусть легко и бесполезно; ценность модели — только в том, как она работает на новом. Именно обобщение отличает подлинное обучение от зубрёжки.
Аналогия проста, как школьный экзамен. Обучающая выборка — это задачник с ответами в конце: по нему модель готовится. Но оценку ей ставят не по нему. Ставят по контрольной с новыми задачами — по тестовой выборке (test set), которую при подготовке она в глаза не видела. Зубрила, вызубривший задачник наизусть, на контрольной поплывёт. А тот, кто ухватил принцип, — решит. Вот почему данные всегда рубят надвое: на одной части учатся, на другой честно экзаменуются. Мерить ум по задачам, к которым подсмотрел ответы, — самообман, причём дорогой.
Топливо революции: данные, «железо» и переобучение
Забавно, что многие из этих методов придумали давно — k-NN, скажем, старше отчёта Лайтхилла. Что же оживило их именно в 1990-е? Две вещи, обе пришли извне. Первая — компьютеры подешевели и разогнались по закону Мура, и вчера неподъёмный расчёт стал делом секунд. Вторая, и она решающая, — появилось топливо. Данные. Интернет, оцифрованные библиотеки, серверные логи, кассовые сканеры в супермаркетах — мир вдруг начал сам себя записывать, поставляя примеры вагонами. А машинное обучение устроено обжорливо: чем оно способнее, тем голоднее до данных. Накорми — полетит. Оставь голодным — и самый элегантный алгоритм просто беспомощен.
Один пример стоит десяти определений. Наберите в поиске «Флорида» с опечаткой — и строка мягко переспросит: «Возможно, вы имели в виду…». За этим нет словаря, куда кто-то заботливо вписал все опечатки на свете: их бесконечно много, не впишешь. Система попросту видела миллиарды запросов и подметила, что после вот такой опечатки люди обычно исправляются на вот такое слово. Ни единого правила орфографии — чистая статистика поверх гигантского потока чужих нажатий. Данные, если их достаточно, знают о живом языке то, чего не знает ни один лингвист.
▸ Пример
Статистический машинный перевод — тот самый, что провалился в шестидесятых на правилах, — ожил на данных. В начале 1990-х система Candide от IBM научилась переводить, не зная ни единого грамматического правила: она статистически сопоставляла миллионы пар предложений из протоколов канадского парламента (на английском и французском). Эта идея легла в основу Google Translate, запущенного в 2006 году. Правила языка не писали — их вычислили из данных.
Из таких историй выкристаллизовалась почти еретическая мысль, которую инженеры Google позже выскажут без обиняков: часто больше данных бьёт более умный алгоритм. Посредственный метод, накормленный горой примеров, обходит изощрённый метод на голодном пайке. Для поколения, воспитанного на красоте алгоритмов, это звучало почти оскорбительно — победа не ума, а количества. Но именно эта ставка — на масштаб данных, а не на хитрость модели — станет негласным девизом всего, что развернётся в следующем десятилетии.
И был у той эпохи очень практический нрав. О природе разума не спорили; смотрели, что работает, и брали то, что точнее. Показательна история премии Netflix: с 2006 по 2009 год компания сулила миллион долларов тому, кто улучшит её рекомендации фильмов всего на десять процентов. Победила не одна гениальная модель, а громоздкий ансамбль из десятков посредственных, слепленных вместе. Некрасиво? Пожалуй. Зато работало. В этом весь дух тихой революции: результат на новых данных дороже, чем изящество теории.
Отдельного слова заслуживает 1997 год, когда Deep Blue от IBM обыграл чемпиона мира Гарри Каспарова. Символически это триумф машины над человеком, но по существу — история со сноской. Deep Blue почти не «обучался»: он брал грубой силой, перебирая до 200 миллионов позиций в секунду, а оценку позиций в него вложили вручную гроссмейстеры. Это была вершина старой, вычислительно-поисковой парадигмы. Показательно, что чистый перебор победил в шахматах — и оказался бессилен в го или в распознавании речи, где вариантов необозримо больше. Настоящая, будущая революция творилась в этот момент не за шахматной доской, а тихо — в спам-фильтрах, в ранжировании поиска, в рекомендациях товаров.
У силы обучения на данных есть и оборотная сторона — центральная опасность всего машинного обучения. Модель может вызубрить обучающие примеры вместо того, чтобы уловить закономерность.
Переобучение и недообучение
Переобучение (overfitting) — модель слишком точно подгоняется под обучающие данные, запоминая даже случайный шум, и потому проваливается на новых. Недообучение (underfitting) — модель, наоборот, слишком проста, чтобы уловить настоящую закономерность, и ошибается везде. Искусство — пройти между этими крайностями.
За этими картинками стоит закон, у которого есть строгое имя — компромисс смещения и разброса (bias-variance tradeoff). Слишком простая модель страдает высоким смещением (bias): она упрямо срезает углы и до истины не дотягивается — вот вам недообучение. Слишком гибкая мучается высоким разбросом (variance): вздрагивает от каждой случайности в данных и оттого неустойчива — вот переобучение. Загвоздка в том, что это качели: прижмёшь одно — подскочит другое. Всё ремесло инженера сводится к тому, чтобы поймать их в равновесии — в точке, где ошибка на новых данных наименьшая. Не на обучающих. На новых.
⚠ Осторожно
Почти идеальная точность на обучающей выборке — не повод ликовать, а чаще повод насторожиться. Живые данные всегда с шумом, и стопроцентное попадание обычно значит, что модель прилежно заучила и этот шум. По-настоящему хорошая модель на обучении иногда чуть ошибается — и именно поэтому не спотыкается на новом.
И ещё одна деталь, о которой учебники стыдливо помалкивали. Успех классического обучения на девять десятых держался на признаках (features) — на том, какие именно свойства объекта скормить алгоритму. Распознаёте рукописную цифру? Кто-то заранее должен решить, что важны, скажем, число замкнутых петель и наклон штрихов. Эту черновую, кропотливую работу — «конструирование признаков» — делали руками. И делали её люди, а не машины. То есть от ручного труда до конца так и не ушли: его просто отодвинули на шаг назад — от правил к признакам. Полностью снять эту ношу сумеет лишь глубокое обучение. Но до него ещё одна часть пути.
К 2011 году машинное обучение незаметно проникло всюду: в поиск, спам-фильтры, рекомендации, распознавание рукописных индексов, кредитный скоринг. Оно работало — надёжно и прибыльно, без всякого ажиотажа. И именно эта зрелая, статистическая, обученная-на-данных культура станет площадкой для последнего рывка. Оставалось соединить три вещи: старые нейросети из девятой главы, гигантские массивы данных из этой и новую вычислительную мощь. Что произойдёт, когда они сойдутся вместе, — тема следующей части.
◆ Ключевое
Главная развилка в истории ИИ: не пытаться запрограммировать интеллект правилами, а дать машине обучиться ему на примерах. Тихая революция 1990–2011 годов доказала, что этот путь работает, — и подготовила почву для взрыва глубокого обучения.
- Парадигма перевернулась: вместо написанных человеком правил — вывод закономерностей из данных; логику потеснила статистика.
- Сложился инструментарий, живой и сегодня: деревья решений, k-NN, SVM, случайный лес, бустинг, байесовские методы.
- Топливом стали данные (интернет, оцифровка) и рост вычислений; статистический перевод и спам-фильтры доказали силу подхода.
- Победа Deep Blue над Каспаровым (1997) — триумф грубого перебора, а не обучения; настоящая революция шла тихо и незаметно.
- Ключевые понятия: обучающая выборка, обобщение, переобучение против недообучения и компромисс смещения-разброса.
2012 год: ImageNet, AlexNet и взрыв глубокого обучения
Нейросети придумали давно, и долго почти никто не принимал их всерьёз — скучная академическая тема, что-то вроде вечного двигателя, только приличнее. А потом за одну осень всё перевернулось. Сеть научилась отличать кошку от грузовика точнее, чем ждали её собственные создатели, — и машинное зрение раскололось на «до» и «после».
Почему именно 2012-й?
Строить нейронные сети умели ещё в восьмидесятых. Главный алгоритм обучения — обратное распространение ошибки (backpropagation, для своих просто «бэкпроп») — описали и раскрутили в 1986 году. И что? Почти ничего. Десятилетиями сети оставались капризной игрушкой: блистали на учебных задачках и рассыпались, стоило дать им настоящую. Так почему взрыв грянул в начале 2010-х, а не на двадцать лет раньше? Ответ прозаичнее, чем хотелось бы романтикам науки. Сошлись три условия, каждого из которых поодиночке вечно не хватало. Держите их в уме как три опоры — на них стоит весь сегодняшний ИИ.
Начнём с данных. Сеть учится не по инструкции, а по примерам — примерно как ребёнок, которому тычут пальцем: вот это собака, а это кошка. Чем больше примеров, тем толковее ученик. В 2007 году исследовательница Фей-Фей Ли (Fei-Fei Li) взялась за коллекцию картинок невиданного масштаба. Замысел звучал почти по-детски: хочешь, чтобы машина увидела мир, — покажи ей мир целиком. Так родился ImageNet. К 2009 году — порядка 14 миллионов фотографий, вручную разложенных примерно по 20 000 категорий: от «немецкой овчарки» до «стручковой фасоли». Размечали всё это тысячи живых людей через краудсорсинг, картинку за картинкой. Получился не просто набор данных, а линейка, которой наконец можно было честно мерить прогресс.
Дальше — железо. Обучить сеть значит перемолоть океан однообразных перемножений чисел. Обычный процессор (CPU) делает их по очереди, вдумчиво. А графический ускоритель (GPU) — тысячами разом, потому что для видеоигр его и точили: считать миллионы пикселей одновременно. В 2007-м NVIDIA выпустила CUDA — и вдруг видеокарту можно было запрячь не только под графику. То, что раньше жевалось неделями, стало считаться за дни.
И наконец — алгоритмы. Пара скромных на вид приёмов сделала глубокие сети наконец-то обучаемыми. ReLU (rectified linear unit) — до неприличия простая функция «минус обнуляем, плюс пропускаем» — ускорила дело в разы и вылечила застарелую хворь затухающих градиентов. Dropout на каждом шаге случайно вырубал часть нейронов, отучая сеть зубрить и заставляя обобщать. А старый добрый бэкпроп, к которому все привыкли, впервые получил и топливо, и мотор, чтобы развернуться в полную силу.
◆ Ключевое
Революция 2012 года — не про одну гениальную мысль, а про совпадение. Данные, дешёвые вычисления и пара алгоритмических трюков поодиночке пылились без дела. Вместе они дали цепную реакцию.
Ночь, когда ошибка обвалилась
С 2010 года на базе ImageNet устраивали ежегодный турнир — ILSVRC (ImageNet Large Scale Visual Recognition Challenge). Условие: разложить больше миллиона фотографий по тысяче категорий. Судили по ошибке top-5 — доле случаев, когда верного ответа не нашлось даже среди пяти самых уверенных догадок программы. В 2010-м и 2011-м лучшие системы, собранные на «ручных» признаках и классической статистике, промахивались примерно в четверти случаев. Прогресс шёл, но черепашьим шагом — доли процента в год. Скукота.
И тут осенью 2012-го появляется работа троих из Торонто. Аспирант Алекс Крижевский (Alex Krizhevsky), его коллега Илья Суцкевер (Ilya Sutskever) и их научрук Джеффри Хинтон (Geoffrey Hinton) — тот самый, кто носился с нейросетями годами, когда это считалось почти неприличным. Их сеть вошла в историю как AlexNet. Обучили её, на минуточку, на двух обычных игровых видеокартах. И она уронила ошибку top-5 примерно с 26% до 16%. За один год. Такого скачка не помнил никто.
Поначалу многие просто не поверили — слишком уж велик был разрыв. Но метод работал, и повторить его мог любой. Под капотом у AlexNet была свёрточная нейронная сеть (convolutional neural network, CNN): восемь обучаемых слоёв, около 60 миллионов параметров. Именно она свела все три опоры в одну точку — ImageNet как горючее, GPU с CUDA как двигатель, ReLU и dropout как тонкую настройку. Год спустя на глубокие сети перешли почти все участники конкурса. Спорить о том, «а надо ли оно вообще», больше не хотелось никому.
Гонка вглубь: VGG, GoogLeNet, ResNet
Как только выяснилось, что глубина работает, начался забег на дно графика ошибок. Логика напрашивалась сама: больше слоёв — богаче «язык» признаков. В нижних слоях сеть замечает линии и пятна, повыше — текстуры и углы, а под самой крышей уже целые объекты. В 2014-м оксфордская команда показала VGG — предельно однообразную башню из одинаковых блоков, которую до сих пор обожают приводить в учебниках именно за простоту. Тогда же Google выкатил GoogLeNet (архитектура Inception), где слои хитро ветвились ради экономии, и сбил ошибку примерно до 6,7%.
Но у глубины обнаружилась подлая ловушка. Сети из многих десятков слоёв учились хуже тех, что помельче: сигнал ошибки, пробираясь назад через сотню этажей, слабел и попросту гас по дороге. Развязку принёс 2015 год и ResNet (residual network) от Microsoft Research. Мысль почти до обидного простая. Пусть каждый блок учит не весь сигнал, а лишь небольшую поправку к нему (residual), а сам сигнал бежит вперёд по короткому обходному пути (skip-connection). Представьте небоскрёб со сквозной шахтой лифта: сколько ни надстраивай этажей, связь между первым и последним не рвётся. Так вот, ResNet из 152 слоёв дала около 3,6% ошибки. Ниже человеческой планки в ~5%, которую прикинул Андрей Карпаты, вручную перебрав тестовые снимки — и, по его собственному признанию, изрядно на этом намучившись.
Восемь слоёв, обучение на GPU. Ошибка top-5 падает с ~26% до ~16%.
Глубже и хитрее. Ошибка около 7%. Глубина официально входит в моду.
Обходные связи снимают потолок глубины. ~3,6% — уже ниже человека.
Те же идеи валят чемпиона мира по го — игре, которую считали неприступной.
От картинок к культуре: AlphaGo и слово «глубокое»
Заодно за подходом закрепилось имя.
Глубокое обучение (deep learning)
Раздел машинного обучения, где работают нейросети со многими слоями. «Глубина» — это сколько слоёв обработки идёт друг за другом: каждый следующий лепит признаки посложнее из того, что нашёл предыдущий. И вот главное отличие от старых методов: сеть отыскивает нужные признаки сама, а не ждёт, пока человек пропишет их руками.
Из лабораторий это выплеснулось быстро. В марте 2016 года программа AlphaGo от лаборатории DeepMind обыграла со счётом 4:1 одного из сильнейших игроков планеты в го — Ли Седоля. А го, между прочим, считалось последним рубежом человеческого превосходства. Позиций в нём больше, чем атомов во Вселенной, — грубым перебором не возьмёшь при всём желании. AlphaGo соединила глубокие сети (чтобы «чувствовать» позицию нутром) с деревом вариантов и обучением на партиях против самой себя. Матч смотрели в прямом эфире миллионы. Тот вечер многим и запомнился как момент, когда абстрактный «искусственный интеллект» вдруг стал чем-то, на что можно показать пальцем.
⌛ Из истории
Джеффри Хинтон, Ян Лекун и Йошуа Бенджио — трое «крёстных отцов» глубокого обучения. Они возились с нейросетями тогда, когда мейнстрим махнул на это направление рукой как на тупик. В 2018-м все трое получили премию Тьюринга — главную награду в информатике. Упрямство окупилось. Всего-то лет через тридцать.
✕ Заблуждение
«AlexNet изобрела нейросети». Ничего подобного. Ни сети, ни свёртки, ни бэкпроп новыми не были — свёрточные сети Ян Лекун натаскивал на рукописные цифры ещё в девяностых. Новым был масштаб. Те же идеи, но с горой данных и мощью GPU, дали результат совсем другого порядка.
- Взрыв 2012 года — это совпадение трёх факторов: большие размеченные данные (ImageNet Фей-Фей Ли), дешёвые параллельные вычисления (GPU + CUDA) и алгоритмические находки (ReLU, dropout, отлаженный бэкпроп).
- AlexNet (Крижевский, Суцкевер, Хинтон) на ILSVRC-2012 уронила ошибку распознавания примерно с 26% до 16% — после этого на глубокие сети перешли все.
- Забег вглубь (VGG, GoogLeNet, а в 2015-м ResNet с обходными связями) к 2015 году увёл ошибку под человеческий уровень в ~5%.
- Победа AlphaGo над чемпионом по го в 2016-м стала тем моментом, когда публика поверила, что ИИ — это всерьёз.
2017 год: трансформеры и механизм внимания
Видеть машины к тому времени научились неплохо. А вот с языком беда: они читали текст, как человек с дырявой памятью, — забывая начало фразы к её концу. В 2017 году восемь исследователей предложили дерзкое лекарство: выкинуть эту память целиком и заменить её одной идеей. Вниманием. Из неё выросли все нынешние языковые модели.
Проблема памяти: почему РНС задыхались
Долгое время язык доверяли рекуррентным сетям (recurrent neural networks, RNN) и их продвинутой версии — LSTM (long short-term memory, придумана ещё в 1997-м). Устройство до боли интуитивное. Сеть читает текст слово за словом, будто ведёт пальцем по строке, и держит в «состоянии» сжатую память о прочитанном. Новое слово — состояние обновилось. Красиво? Да. Но у этой схемы три врождённых порока, и каждый по-своему неприятен.
Порок первый — очерёдность. Чтобы добраться до десятого слова, сеть обязана честно пройти девять предыдущих, одно за другим. Это чтение книги через щель шириной ровно в одно слово. Никакой одновременности, только гуськом.
Второй — забывание. Вся память утрамбована в один вектор фиксированного размера, и он неизбежно мутнеет. К концу длинного абзаца сеть уже смутно помнит, с чего он начинался. Стоит подлежащему встать в первом слове, а сказуемому — в тридцатом, и связь между ними успевает выветриться. LSTM боролась с этим особыми «вентилями», но лечила симптом, а не причину.
А третий порок — тот самый первый, только с финансовой стороны. Помните, в чём сила современного ИИ? В GPU, которые считают тысячи вещей разом. Так вот, рекуррентную сеть по длине текста не распараллелить в принципе: шаг №2 не начнёшь, пока не закрыл шаг №1. Дорогущий ускоритель стоит и ждёт своей очереди, как гоночная машина в пробке. Раздуть такую архитектуру до по-настоящему больших текстов было мучительно дорого.
«Внимание — это всё, что нужно»
Июнь 2017-го. Восемь исследователей Google выкладывают статью с почти хулиганским названием — «Attention Is All You Need», «Внимание — это всё, что нужно». Заголовок звучал как вызов, и был им. Авторы предложили убрать рекуррентность совсем и построить всё вокруг единственного механизма — внимания (attention). Новую конструкцию окрестили трансформером (transformer).
Сам механизм внимания, честно говоря, не с неба свалился — им и раньше подпирали рекуррентные сети как костылём. Смелость статьи была в другом: только внимание, и точка, без всякой рекуррентности. А идея, если стряхнуть с неё математику, обезоруживающе проста. Не тащить память сквозь всё предложение по цепочке, а позволить каждому слову разом «оглядеть» все остальные и самому решить, какие из них ему сейчас важны.
Возьмём фразу: «Кошка не перешла улицу, потому что она слишком устала». К чему тут «она» — к кошке или к улице? Вы поняли за долю секунды, даже не задумавшись. А чтобы это понять, слову «она» нужно оглянуться и заметить: «кошка» связана с ним куда крепче, чем «улица». Ровно этим и занят self-attention (само-внимание). Для каждого слова он считает вес — силу связи — со всеми прочими и собирает его новое, напитанное контекстом значение как их взвешенную смесь. Крепкая связь — большой вес, слабая — почти ноль.
Вопрос, метка, содержимое: как работает self-attention
А как машина считает эти веса? Обойдёмся без единой формулы — хватит тройки понятий. Для каждого слова сеть заводит три роли: query («запрос», вопрос), key («ключ», метка) и value («значение», содержимое). Удобнее всего представить библиотеку — или строку поиска.
- Query — вопрос
«Она» формулирует свой запрос: я местоимение, ищу существительное женского рода, о котором тут вообще речь.
- Key — метка на корешке
У каждого слова висит своя метка-описание. У «кошки» она прямо кричит: существительное, женский род, одушевлённое. У «улицы» похожая, но под контекст ложится хуже.
- Совпадение — это и есть вес
Сеть сверяет запрос «она» с меткой каждого слова. Чем плотнее совпало, тем больше вес внимания. «Кошка» совпала лучше всех.
- Value — забрать содержимое
Наконец «она» вбирает содержимое (value) остальных слов, подмешанное по весам. В её новое значение почти целиком вливается смысл «кошки».
И так, слой за слоем, каждое слово по многу раз переспрашивает весь текст и подкручивает своё значение под соседей — хоть близких, хоть далёких. Расстояние в предложении больше не помеха. Связь между первым словом и тридцатым ставится за один ход, а не за тридцать. Забывание вылечено под корень.
▸ Пример
Возьмите «косу». Девичья коса, речная коса, коса-инструмент — слово одно, смыслов три. Внимание даёт слову оглядеться на соседей («заплела», «песчаная», «наточил») и в каждом случае подтянуть нужное значение. Контекст больше не теряется — он вшит прямо в само представление слова.
Почему это изменило всё: параллелизм и масштаб
Забывание — это, конечно, приятно, что вылечили. Но настоящая бомба тикала в другом. Раз слова больше не идут гуськом, всё предложение считается разом, одной волной матричных умножений. А это ровно то, от чего GPU приходят в восторг. Трансформер лёг на параллельное железо как влитой, и обучение, которое раньше упиралось в очерёдность, вдруг стало масштабируемым. Скармливай хоть библиотеки.
За этой дверью ждала целая эпоха. Прежде увеличить модель значило заплатить временем непропорционально дорого. Теперь мощность железа напрямую перетекала в размер и качество. И вот что забавно: трансформер оказался архитектурой, которая любит расти. Больше данных, параметров, вычислений — и он становится лучше, без видимого потолка. На этой-то ненасытности через пару лет и поднимутся большие языковые модели, о которых дальше.
◆ Ключевое
Трансформер выиграл не потому, что «умнее» РНС на каждом отдельном шаге. Он выиграл потому, что его можно дёшево масштабировать. Архитектура, дружная с параллельным железом, забирает гонку себе — даже если внутри устроена проще соперника.
«Attention Is All You Need».Ашиш Васвани и соавторы, Google, 2017
- Рекуррентные сети (RNN/LSTM) читали текст строго по очереди, забывали далёкое начало и не желали параллелиться — а значит, плохо масштабировались на GPU.
- Статья «Attention Is All You Need» (Google, 2017) предложила трансформер — архитектуру без рекуррентности, целиком на механизме внимания.
- Само-внимание даёт каждому слову оглядеть все остальные и собрать своё значение как взвешенную смесь: крепкая связь — большой вес. Роли query/key/value читаются как «вопрос / метка / содержимое».
- Главный эффект даже не память о далёких словах. Он в полной параллелизации: трансформер идеально ложится на GPU и масштабируется почти без предела. Это и запустило эпоху больших моделей.
2020–2026: эпоха больших языковых и генеративных моделей
Получив архитектуру, которая любит расти, исследователи задали вопрос попроще некуда: а что будет, если раздуть её очень, очень сильно? Ответ застал врасплох. Модели не просто становились точнее — они начинали делать то, чему их никто не учил. За несколько лет ИИ шагнул из лаборатории в карман к сотням миллионов людей.
Два пути от трансформера: BERT и GPT
Из одной архитектуры почти сразу проросли две родословные. В 2018 году Google показал BERT — модель, что читает текст сразу в обе стороны и особенно сильна в понимании: ответить на вопрос, разложить по категориям, взвесить смысл. Она быстро прописалась в поиске. А в OpenAI тем временем растили линию GPT (Generative Pre-trained Transformer) — эти заточены на порождение: предсказывают следующее слово, снова и снова, и так вытягивают связный текст.
Устройство GPT обманчиво скромное. В сердцевине — одна задача: угадай следующее слово. Модель видит обрывок «Столица Франции — » и должна продолжить: «Париж». Пустяк? Но натренируйте это угадывание на чудовищных объёмах текста — и побочным продуктом выпадет сжатая модель мира. Чтобы стабильно попадать в следующее слово, волей-неволей приходится усвоить грамматику, факты, стиль, обрывки логики. GPT-1 (2018) была робким экспериментом. GPT-2 (2019) с ~1,5 млрд параметров уже строчила правдоподобные абзацы — да так, что её релиз сопровождали разговоры о фейках и «слишком опасно выпускать».
GPT-3 и обучение в контексте
Перелом случился в 2020-м, с GPT-3 — моделью примерно на 175 миллиардов параметров, раз в сто пузатее предшественницы. И дело было не только в габаритах. GPT-3 выкинула фокус, которого в неё никто нарочно не закладывал, — обучение в контексте (in-context learning). Покажи ей прямо в запросе пару примеров задачи — и она подхватит образец и покатит дальше сама, без всякого переобучения. Это прозвали few-shot, «по нескольким примерам».
Обучение в контексте (in-context / few-shot learning)
Умение большой модели разобраться в новой задаче по нескольким примерам прямо из запроса — не трогая при этом собственные веса. Напишите ей: «яблоко → фрукт, морковь → овощ, банан → ?» — и она ответит «фрукт». Задачу она видит впервые. Но закономерность ловит на лету.
Откуда взялась эта ловкость? Из наблюдения, которое к тому времени оформилось в законы масштабирования (scaling laws). Оказалось, качество модели улучшается пугающе предсказуемо, стоит согласованно наращивать три вещи: объём данных, число параметров и вычислительный бюджет. Кривая ошибки уверенно ползёт вниз по гладкой траектории — математически, по степенному закону. А на определённых масштабах у моделей вдобавок ни с того ни с сего «прорезаются» способности, которых у версий помельче не было и в помине. Разработка ИИ на глазах превращалась в инженерию масштаба. Хочешь модель посильнее? Во многом достаточно сделать её больше и накормить сытнее. Обидно просто — но работает.
Ноябрь 2022: когда ИИ вышел к людям
Мощные модели уже существовали — но оставались забавой специалистов, которые дёргали их через программный интерфейс. Всё перевернул один продуктовый ход, а вовсе не научный. 30 ноября 2022 года OpenAI открыла ChatGPT — незамысловатое окошко чата поверх модели, дообученной вести диалог и слушаться инструкций. Технической революции тут не произошло. Произошла революция доступности: поговорить с ИИ теперь мог кто угодно, просто набрав вопрос словами. Без кода, без документации, без ничего.
Реакцию не ждал никто. По разным оценкам, ChatGPT добрался до ста миллионов пользователей примерно за два месяца — тогда это был самый быстрый разгон потребительского сервиса в истории. Для широкой публики именно этот момент и стал настоящим «выходом ИИ в свет». Разговоры об искусственном интеллекте вдруг обрели лицо — собеседника в браузере, которому можно задать любой глупый вопрос в три часа ночи.
⚠ Осторожно
Конкретные числа этой эпохи — параметры, стоимость обучения, длина контекста — устаревают за месяцы, а половину их компании попросту не раскрывают. Всё, что идёт ниже, читайте как порядок величины и ориентир. Не как приговор в цифрах.
Картины из шума и рождение агентов
Пока текстовые модели покоряли язык, по соседству кипела своя революция — в картинках. Началась она с GAN (generative adversarial networks, «состязательные сети», Ян Гудфеллоу, 2014). Две сети играют в кошки-мышки: одна малюет подделки, другая ловит их за руку, и в этой перебранке картинки становятся всё убедительнее. Лица выходили эффектные. А вот характер у GAN был скверный — обучались они капризно и норовили сорваться.
Ближе к 2020–2022 годам их подвинули диффузионные модели. Их принцип красив почти до медитативности: модель учат вычищать шум. Берут картинку, постепенно заливают её случайными помехами до состояния «телевизор без антенны», а сеть натаскивают идти обратным путём — шаг за шагом убирать шум. После обучения ей суют чистые помехи и текстовую подсказку — и она проявляет из хаоса осмысленную сцену, ровно как фотография проступает в ванночке с проявителем. На этом стоят Stable Diffusion, Midjourney и DALL·E. В 2022-м они превратили рисование по описанию из фокуса в массовую забаву.
▸ Пример
Запрос «астронавт верхом на лошади, фотореализм» ещё в 2020-м звучал как издёвка. К 2022-му диффузионная модель выдавала по нему готовый кадр за секунды. Не находила где-то на просторах интернета — рисовала с нуля, вычищая шум под диктовку смысла.
А дальше границы между типами данных поплыли. Пришла мультимодальность: одна модель глотает и текст, и картинки, и звук — ей можно показать фотографию и спросить о ней словами, как приятелю. Следующий шаг — агенты: модели, которые уже не только отвечают, а действуют. Пользуются инструментами, лезут в интернет, пишут и запускают код, разбирают многоходовые задачи по одной команде. Собеседник понемногу переучивается в исполнителя.
И ещё одна линия этих лет, которую грех не помянуть, — открытые модели. Долго сильнейшие системы держали под замком, за дверью чужого сервиса. В 2023-м Meta выпустила семейство LLaMA, а следом хлынула волна открытых моделей от самых разных команд. Их можно скачать, крутить у себя, дообучать под свою задачу. Доступ демократизировался, а исследования разом ускорились: тысячи независимых групп кинулись улучшать и переосмыслять то, что раньше было им недосягаемо.
⌛ Из истории
Ещё в середине десятых серьёзный разговор с машиной был темой для фантастики, а картина по фразе — делом далёкого «когда-нибудь». К середине двадцатых и то и другое стало обычным приложением в телефоне, которым никого не удивишь. Вот эта скорость — пожалуй, и есть самое поразительное во всей истории.
2024–2026: модели учатся думать дольше
До 2024 года рецепт прогресса был почти механическим: сделай модель больше, накорми её большим объёмом текста, потрать больше вычислений на обучение — и получишь модель посильнее. Но у этой лестницы обнаружились ступени. Качественный человеческий текст конечен, и его начали вычерпывать; а самые большие прогоны обучения упёрлись в стены из чипов, энергии и денег. Нужен был второй рычаг — и его нашли не в обучении, а в самом ответе.
Идея проста до обидного. Обычная языковая модель выпаливает ответ сразу, слово за словом, сколько бы ни был труден вопрос, — будто отвечает не думая. А что, если разрешить ей сначала порассуждать про себя: расписать задачу по шагам, проверить себя, отбросить тупиковый ход — и только потом дать финальный ответ? Оказалось, если специально обучить модель так себя вести (методом обучения с подкреплением, где награда даётся за верный итог), качество на трудных задачах — математике, коде, логике — резко подскакивает. Так родились рассуждающие модели (reasoning models).
Вычисления во время ответа (test-time / inference-time compute)
Раньше «умнее» означало «дороже обучить». Рассуждающие модели добавили второй рычаг: дать модели потратить больше вычислений прямо в момент ответа — то есть подумать дольше, породив длинную внутреннюю цепочку рассуждений, прежде чем ответить. Больше «раздумий» на трудный вопрос — заметно точнее ответ. По сути, к привычному масштабированию обучения добавилась новая ось: масштабирование размышления.
Первой публичной ласточкой стала o1 от OpenAI (сентябрь 2024), а следом — более сильная o3 (2025), показавшая результаты, о которых годом раньше говорили как о далёкой мечте: уровень золотой медали на международной математической олимпиаде и резкий скачок на задачах-головоломках, специально придуманных, чтобы их нельзя было решить зубрёжкой.OpenAI, анонсы o1 и o3, 2024–2025 Параллельно тот же приём освоили все: у Google появились «думающие» режимы Gemini, у Anthropic — «расширенное размышление» Claude, а открытая китайская DeepSeek-R1 (январь 2025) показала рецепт рассуждающей модели всему миру бесплатно.
Второй сюжет этих лет — агенты перестали быть демо. Соединив рассуждение с инструментами (поиском, кодом, доступом к файлам и сайтам), модели научились доводить до конца многошаговые задачи: не просто «напиши письмо», а «разберись в этом репозитории, найди ошибку, почини и проверь». Особенно заметно это в программировании, где ИИ-ассистенты и автономные «кодовые агенты» стали повседневным рабочим инструментом.
А в августе 2025 года OpenAI выпустила GPT-5 — и закрепила главную развилку эпохи институционально: это не одна модель, а система, которая сама решает, ответить ли быстро или «подумать» над трудным запросом, включив режим рассуждения.OpenAI, анонс GPT-5, август 2025 К 2026 году поколения флагманов (GPT-5 у OpenAI, Claude Opus у Anthropic, Gemini у Google, Grok у xAI) сменяют друг друга за месяцы, и почти у каждого есть два лица — быстрое и «рассуждающее».
⚠ Без переоценки
«Рассуждение» здесь — рабочий термин, а не заявление о том, что модель поняла задачу так, как понимает человек. Длинная цепочка шагов повышает надёжность, но не отменяет ошибок: модель по-прежнему может уверенно рассуждать к неверному выводу. И «думать дольше» — не бесплатно: каждый такой ответ дороже и медленнее обычного.
- Из трансформера выросли две семьи: BERT (2018, понимание текста) и линия GPT, которая порождает текст, угадывая следующее слово.
- GPT-3 (2020, ~175 млрд параметров) показала обучение в контексте (few-shot): модель схватывает новую задачу из пары примеров прямо в запросе. Законы масштабирования объяснили, почему «больше данных, параметров и вычислений» надёжно сбивает ошибку.
- ChatGPT (ноябрь 2022) не был техническим прорывом — но сделал ИИ доступным всем и за ~2 месяца собрал около 100 млн пользователей.
- Образы прошли путь от GAN к диффузионным моделям (Stable Diffusion, Midjourney, DALL·E), которые «проявляют» картинку из шума. Дальше — мультимодальность и волна открытых моделей (LLaMA, Qwen, DeepSeek и другие).
- 2024–2026: рассуждающие модели (o1/o3, DeepSeek-R1, «думающие» Gemini и Claude) добавили новую ось — вычисления в момент ответа; агенты соединили рассуждение с инструментами; GPT-5 (2025) объединила быстрый и «думающий» режимы в одну систему. Точные цифры эпохи держите за порядок величины.
Часть третья
Как это работает: техника ИИ
Заглянем под капот. Что такое искусственный нейрон и почему из миллиардов простых операций рождается сложное поведение. Как сеть «учится», что такое трансформер и внимание, и почему без гигантских дата-центров ничего бы не было.
Три парадигмы обучения: с учителем, без учителя, с подкреплением
Машину не программируют правилами напрямую — по крайней мере не так, как писали софт двадцать лет назад. Она выводит правила из опыта сама. Но опыт бывает трёх сортов: иногда рядом есть учитель с ответами в конце задачника, иногда тебя высадили в чужом городе без карты, а иногда учишься на собственных синяках. Отсюда и три больших семейства методов.
Представьте трёх учеников. Первый зубрит по задачнику, где в конце напечатаны ответы: решил пример, подсмотрел, исправился. Второго высадили в незнакомом городе без карты и без гида — и он всё равно через неделю знает, где деловой центр, а где спальные окраины. Третий учится держаться на велосипеде. Формулу равновесия ему никто не выпишет, но каждое падение и каждый удачно проеханный метр что-то подсказывают. Вот эти трое — обучение с учителем (supervised learning), обучение без учителя (unsupervised learning) и обучение с подкреплением (reinforcement learning). На них держится почти весь нынешний искусственный интеллект.
Разница между ними — не в железе и не в устройстве самих моделей: одна и та же нейросеть годится под любую из трёх. Разница в сигнале. Точнее — в том, какой сигнал приходит модели во время учёбы и откуда он берётся. Природа этого сигнала и решает, какие задачи вам по силам и во что они обойдутся.
Обучение с учителем: примеры с ответами
Начнём с самого понятного. Есть набор размеченных примеров (labeled data): к каждому входу заранее приклеен правильный ответ. Тысячи фотографий, и на каждой человеческой рукой выведено «кошка» или «собака». Гора писем с пометками «спам» / «не спам». Квартиры с их площадью и районом — и реальной ценой, за которую ушли. Модель получает вход, выдаёт догадку, сверяет её с эталоном, подкручивает себя. И снова. Тысячи раз, пока не начнёт попадать.
Обучение с учителем
Настройка модели по парам «вход → правильный ответ». Учитель здесь не человек, который сидит рядом и кивает, а заранее собранная разметка. Задача — научиться давать верный ответ и на тех входах, которых модель в глаза не видела.
Внутри этой парадигмы всё делится надвое — по тому, что мы предсказываем. Ответ — категория из короткого списка? «Спам / не спам», «кошка / собака / птица», «опухоль доброкачественная / злокачественная»? Тогда это классификация (classification). Ответ — число на непрерывной шкале, вроде цены квартиры, завтрашней температуры, ожидаемой выручки? Это регрессия (regression). Механика внутри одна и та же; меняются лишь форма выхода да способ мерить промах.
◆ Пример
Диагностика по снимкам. Радиологи размечают десятки тысяч рентгенов: «есть патология» / «нет». Обученная на этом сеть потом подсвечивает врачу подозрительные участки на новых снимках — это классификация. А прикинуть, на сколько дней затянется госпитализация по анализам пациента, — уже регрессия.
Чем подкупает подход? Точностью. Дайте хорошую разметку — и модель с учителем ставит рекорды. А чем расплачивается? Той самой разметкой. Разметить миллион картинок вручную долго и дорого, а кое-где эталонных ответов почти нет: попробуйте собрать размеченную базу по болезни, которую видели триста раз на всю планету. Отсюда и тяга к парадигмам, которым разметка нужна поменьше. Или не нужна вовсе.
Обучение без учителя: структура вместо ответов
Здесь меток нет. Совсем. У модели только входы, и задача не угадать заранее известный ответ, а нащупать в данных скрытую структуру. Что на что похоже. Какие закономерности повторяются. Как ужать громоздкое описание, не растеряв главного. Учителя нет; есть данные и их внутренняя геометрия — вот с ней и предстоит работать.
Классических работ у этой парадигмы две. Кластеризация (clustering) разбивает объекты на группы по сходству: магазин вдруг обнаруживает, что покупатели сами собой распадаются на «экономных», «импульсивных» и «оптовиков» — хотя ярлыки эти никто заранее не придумывал. Снижение размерности (dimensionality reduction) занято другим: оно сжимает описание, где признаков сотни, до нескольких главных осей, стараясь не выплеснуть суть. Это разом и способ увидеть данные на плоском графике, и способ смыть с них шум.
Но самое интересное здесь — не они. Самообучение (self-supervised learning) — вот ветвь, ради которой стоит дочитать главу. Идея почти жульническая по красоте: разметку можно добыть из самих неразмеченных данных, если спрятать их кусок и заставить модель его восстановить. Возьмите фразу «Столица Франции — …» и сотрите последнее слово. Ответ («Париж») уже лежит в самой фразе — его не размечал ни один человек. Так из океана обычного текста рождаются миллиарды бесплатных задачек «угадай пропущенное».
◆ Ключевое
Именно самообучение стоит за большими языковыми моделями (LLM). Их гоняют на гигантских объёмах текста единственной задачей — угадывать следующее слово. Формально ответ есть на каждом шаге (это следующее слово в тексте), так что механика роднится с учителем. Но разметку никто не делал руками — её бесплатно поставляет сам текст. Это и позволило раздуться до триллионов слов.
Обучение с подкреплением: учиться на последствиях
Третья парадигма устроена совсем иначе. Ни готовых ответов, ни аккуратного набора данных. Есть агент (agent), который живёт в некой среде (environment), совершает действия (actions) и получает в ответ две вещи: новое состояние (state) мира и награду (reward) — число, говорящее, насколько удачным был поступок. Никто не подсказывает агенту правильный ход. Он выясняет сам: пробует, смотрит, к чему привело. Цель — выработать стратегию (policy): правило, которое по текущему состоянию подсказывает лучший шаг ради максимума награды. Не сию секунду — в долгую.
Главная головная боль здесь в том, что награда приходит с опозданием. В шахматах роковую глупость вы сделали на двадцатом ходу, а мат получили на сороковом; поди теперь разберись, какой из ходов виноват. Сюда же — вечная развилка: исследовать или использовать (exploration vs exploitation). Рискнуть новым, непроверенным ходом в надежде на большее? Или держаться того, что уже работает? Слишком осторожный агент застревает на посредственной стратегии. Слишком лихой — не успевает ничем воспользоваться. Золотая середина, как обычно, нигде не записана.
◆ Пример
Так учились системы, обыгравшие человека в го и в тяжёлые видеоигры; так ставят походку роботам и настраивают охлаждение дата-центров. Этой же парадигмой «дошлифовывают» языковые модели: людям показывают пары ответов, они отмечают лучший, из оценок собирают модель награды — и по ней подкрепляют у LLM вежливое и полезное поведение. Метод зовётся RLHF.
Как выбрать парадигму и что их роднит
На практике выбор решается одним вопросом. Какой сигнал обратной связи вам вообще доступен? Есть готовые пары «вход → ответ» — берите учителя. На руках только сырые данные и желание понять их устройство — вам к самообучению или кластеризации. Задача про цепочку решений в меняющейся среде, где правоту видно лишь по итогу, — территория подкрепления. Вот, собственно, и вся развилка.
| Признак | С учителем | Без учителя | С подкреплением |
|---|---|---|---|
| Что на входе | Пары «вход → метка» | Только входы, без меток | Взаимодействие со средой |
| Сигнал обучения | Правильный ответ | Сходство, структура | Награда (число) |
| Цель | Точно предсказывать | Найти закономерность | Максимум награды в долгую |
| Типовые задачи | Классификация, регрессия | Кластеры, сжатие, генерация | Игры, роботы, управление |
| Главная трудность | Дорогая разметка | Как оценить «правоту» | Отложенная награда |
И вот что стоит унести с собой. В живых системах эти границы размыты, а парадигмы работают в связке, не порознь. Большая языковая модель проходит все три по очереди. Сперва самообучение на терабайтах текста — угадай следующее слово, так набирается общее знание о языке и мире. Потом дообучение с учителем на аккуратно написанных людьми примерах «запрос → хороший ответ» — так модель учится слушаться инструкций. И под конец шлифовка с подкреплением по человеческим оценкам — так поведение делают полезным и терпимым. Три способа учиться — не конкуренты за один трон, а три отвёртки в одном наборе. Всё мастерство в том, чтобы под каждый винт взять свою.
- Парадигму задаёт природа обучающего сигнала: готовый ответ, скрытая структура данных или награда от среды.
- С учителем — учёба по размеченным парам «вход → ответ»; классификация угадывает категорию, регрессия — число. Мощно, но разметка дорогая.
- Без учителя ищет структуру в неразмеченных данных: кластеризация, снижение размерности. Его звёздная ветвь — самообучение, где разметку даёт сам текст; на нём стоят LLM.
- С подкреплением — агент в среде учится на последствиях, максимизируя награду; болевые точки — отложенность награды и баланс «исследовать / использовать».
- В настоящих системах три парадигмы сшивают: LLM проходит самообучение, затем дообучение с учителем, затем шлифовку с подкреплением.
Искусственный нейрон и нейронная сеть
Слово «нейросеть» рисует в голове что-то живое — мозг в банке, искры между извилинами. Отложите эту картинку. Искусственный нейрон — крохотная счётная машинка: умножить, сложить, чуть подогнуть результат. И всё. Вся мощь берётся не из сложности одной такой машинки, а из того, что их миллиарды и они спаяны в сеть.
В 1943-м нейрофизиолог Уоррен Мак-Каллок и логик Уолтер Питтс нарисовали математическую карикатуру на нервную клетку. Настоящий нейрон принимает сигналы от тысяч соседей через синапсы, копит возбуждение и, перевалив через порог, «выстреливает» импульсом дальше. Эту картинку инженеры и утащили к себе. Но, как со всякой удачной аналогией, пользы от неё ровно до той секунды, пока вы помните, где она привирает.
Биологическая аналогия и где она ломается
Честное сходство тут одно: много входов сходятся в точку, и их общая сила решает, будет ли выход и насколько сильный. Дальше начинаются расхождения. Живая клетка — электрохимическая махина: она говорит ритмом импульсов во времени, её синапсы бывают возбуждающими и тормозящими, она отращивает новые связи, устаёт, зависит от десятков нейромедиаторов. Искусственный нейрон обо всём этом не подозревает. Он не стреляет во времени — он за один такт превращает горсть чисел в одно число. Он не растит связей — их схема задана заранее, меняются лишь численные множители на них. Бедновато? Пожалуй. И достаточно.
◆ Осторожно с аналогией
«Нейросеть работает как мозг» — фраза красивая и обманчивая. Искусственная сеть ближе к гигантской настраиваемой формуле, чем к биологии. Она не «понимает» и не «чувствует» — она считает. Аналогия подарила словарь (нейрон, вес, активация, слой), но не механизм: пути их давно разошлись.
Устройство одного нейрона
Разберём машинку на винтики. На вход приходит несколько чисел — входы (inputs), обозначим их x₁, x₂, …, xₙ. За ними может стоять что угодно: яркости пикселей, признаки клиента, числа от нейронов прошлого слоя. У каждого входа свой вес (weight) — множитель w, который говорит, насколько этот вход важен. Большой положительный — усиливает сигнал. Отрицательный — работает против. Близкий к нулю — почти не замечает вход. Нейрон умножает каждый вход на его вес, всё складывает, а к сумме добавляет ещё одно число — смещение (bias). Смещение сдвигает порог: это «настроение по умолчанию» нейрона, его готовность возбуждаться даже когда на входе тишина.
Взвешенная сумма
Сердце нейрона — выражение s = w₁x₁ + w₂x₂ + … + wₙxₙ + b. Это единственная «тяжёлая» арифметика внутри: перемножить входы на веса, сложить, прибавить смещение. Дальше результат s идёт в функцию активации.
Последний шаг — и он-то главный. Взвешенную сумму s нейрон не отдаёт наружу как есть, а прогоняет через нелинейную функцию активации (activation function) f. Самая ходовая сегодня — ReLU (rectified linear unit): положительные числа пропускает нетронутыми, всё отрицательное обнуляет. «Хорошее — вперёд, плохое — за борт», если совсем грубо. Классика постарше — сигмоида (sigmoid): она плавно сминает любое число в отрезок от 0 до 1, что удобно читать как вероятность или степень уверенности.
Почему без нелинейности всё рушится
Легко решить, что активация — так, косметика. Ошибка. Это несущая стена. Смотрите: уберите активацию — и каждый нейрон станет просто линейной комбинацией входов. А сумма линейных штук — снова линейная штука. Сложите хоть сто таких слоёв, хоть тысячу — математически это по-прежнему одна прямая, эквивалент единственного слоя. Такая сеть не выучит ничего сложнее прямой. Ни изгиба, ни «или-или», ни границы между кошкой и собакой. Пустышка.
◆ Ключевое
Нелинейная активация — то, что превращает стопку слоёв из бессмысленного дубликата одного слоя в машину, способную выгибать пространство и рисовать сколь угодно замысловатые границы. Без неё глубина не даёт ничего. С ней каждый новый слой добавляет выразительной силы.
От слоя к сети: где рождаются миллиарды параметров
Один нейрон — примитив. Сила приходит, когда их выстраивают в слои (layers) и сшивают между собой. В полносвязном слое (fully connected layer) каждый нейрон получает на вход все выходы предыдущего — никто никого не пропускает. Слои ставят в конвейер: входной слой принимает сырьё, один или несколько скрытых слоёв (hidden layers) по очереди его переминают, выходной слой выдаёт итог — вероятность класса, число, следующее слово. «Глубокое» обучение (deep learning) — это про много скрытых слоёв. Вот и вся глубина.
Теперь посчитаем, откуда те самые миллиарды. Параметры (parameters) сети — это все её веса плюс все смещения; их-то и подбирают при обучении. Каждая линия на схеме — отдельный вес. Свяжите слой из тысячи нейронов со следующим таким же — и только на одном стыке набежит миллион весов. А в больших языковых моделях слои идут сотнями, и каждый широкий. Счёт летит к миллиардам, потом к триллионам. Эти параметры и есть память модели: не отдельная полка с фактами, а распределённый по всей сети след всего, что она усвоила.
Зачем столько-то? Ответ даёт теорема об универсальной аппроксимации (universal approximation theorem): сеть с нелинейной активацией и достаточным числом нейронов может приблизить почти любую зависимость вход→выход — хоть какую замысловатую кривую, границу, правило. Обучение — это поиск таких весов, при которых сеть-пластилин примет форму нужной зависимости. Больше параметров — больше пластилина, тоньше лепка. Вот вам и вся гонка за размером: универсальность-то есть в теории, а чтобы вылепить язык, зрение и хоть какое-то рассуждение, пластилина нужно очень, очень много.
◆ Из истории
В 1969-м Мински и Пейперт показали, что однослойный перцептрон не осиливает даже простое «исключающее ИЛИ». Интерес к нейросетям после этого остыл на годы. Спасли идею как раз скрытые слои с нелинейностью — вот только обучать их толком научились много позже, когда придумали, как эффективно гнать ошибку назад по сети. Об этом — следующая глава.
- Искусственный нейрон — счётная машинка: входы × веса, плюс смещение, затем функция активации. Биологическая аналогия подарила словарь, но не механизм.
- Функция активации (ReLU, сигмоида) вносит нелинейность. Без неё любая глубина сети схлопывается в одну прямую, и ничего сложного выучить нельзя.
- Нейроны собирают в слои — входной, скрытые, выходной; в полносвязном слое каждый нейрон видит все выходы предыдущего.
- Параметры — это все веса и смещения. Каждая связь между слоями — отдельный вес, оттого в крупных моделях их миллиарды; в них распределённо и лежит всё выученное.
- По теореме об универсальной аппроксимации достаточно большая нелинейная сеть приближает почти любую зависимость; обучение — лепка нужной формы из пластилина весов.
Как сеть учится: функция потерь, градиентный спуск и обратное распространение
Сеть собрана. Миллиарды весов выставлены наугад, и она выдаёт полную ерунду. Как из этой каши вырастает система, что узнаёт лица и дописывает ваши предложения? За всем стоят три идеи, работающие в связке: измерить ошибку, понять, куда крутить каждый вес, и сделать шаг. А потом повторить. Миллионы раз.
Обучение сети — не магия и не программирование в привычном смысле. Это поиск. Среди немыслимого числа возможных настроек весов надо найти те, при которых сеть промахивается меньше всего. Чтобы искать, нужны три вещи: мерило ошибки, компас в сторону меньшей ошибки и шаг, которым мы туда движемся. Пойдём по порядку.
Функция потерь: мера ошибки одним числом
Улучшать нельзя то, что не измерил. Этим и занята функция потерь (loss function) — правило, которое сворачивает расхождение между ответом сети и правильным ответом в одно неотрицательное число. Ноль — идеал. Чем больше — тем хуже дела. Для регрессии часто берут средний квадрат разности: квадрат делает крупные промахи особенно болезненными, чтобы сеть избегала их в первую очередь. Для классификации в ходу перекрёстная энтропия — она бьёт сильнее всего за уверенно неправильный ответ. За наглую ошибку, не за робкую.
Функция потерь (loss)
Число, оценивающее, насколько сильно сеть промахнулась на данных. Обучение — это целенаправленное уменьшение этого числа за счёт изменения весов. Loss — единственный ориентир, по которому сеть понимает, где «хорошо», а где «плохо».
А теперь поворот, ради которого всё затевалось. Потери зависят от весов. Зафиксируйте данные — и величина ошибки становится функцией одних лишь настроек сети. Раз так, задачу можно нарисовать. Вообразите гигантское пространство, где каждая ось — один вес, а высота над точкой — величина потерь при этих весах. Выходит холмистый ландшафт потерь (loss landscape): вершины — скверные настройки, впадины — хорошие. Обучить сеть значит спуститься в глубокую долину этого рельефа.
Градиентный спуск: скатиться в долину
Загвоздка в том, что целиком ландшафт мы не видим — он в пространстве миллиардов измерений, такое не нарисуешь на бумаге. Но полная карта и не нужна. Хватит нащупать в текущей точке уклон — куда поверхность идёт вниз круче всего — и шагнуть туда. Направление самого крутого подъёма задаёт градиент (gradient). Значит, чтобы спускаться, идём строго против него. Отсюда и название — градиентный спуск (gradient descent).
Размер шага задаёт скорость обучения (learning rate) — и это, пожалуй, самый капризный параметр во всём деле. Он решает, насколько сильно двигать веса за один раз. Возьмёте шаг слишком мелкий — спуск затянется до скончания века, а то и заглохнет на полпути. Слишком крупный — метод начнёт перескакивать долину туда-сюда, а иногда и разгоняться вверх, «расходиться». Идеала нет; есть удачная середина, которую обычно нащупывают руками, на глазок и с матюками.
Есть и подвох посерьёзнее. Настоящий ландшафт потерь — не гладкая чаша, а изрезанный рельеф с уймой ямок. Спуск может застрять в локальном минимуме (local minimum) — неплохой ямке, из которой не разглядеть, что в двух шагах есть яма глубже. Звучит тревожно, знаю. На деле в пространствах огромной размерности глубокие ямы обычно вполне сносны, а вылезти из мелких помогают приёмы вроде инерции (momentum) и обучения не на всех данных сразу, а порциями. О них — чуть ниже.
◆ Осторожно
«Минимум потерь» — не то же самое, что «истина». Сеть минимизирует ошибку на тех данных, что ей дали. Данные смещены или дырявы? Идеально обученная сеть уверенно повторит их перекосы. Ландшафт — карта данных, а не карта реальности.
Обратное распространение: как ошибка находит виноватых
Остался главный вопрос, и он неприятный. Чтобы шагнуть против градиента, надо знать, как каждый из миллиардов весов влияет на общую ошибку. Куда его крутить и насколько. Считать это для каждого веса поодиночке — застрелиться можно, никаких вычислителей не хватит. Спасает изящный алгоритм: обратное распространение ошибки (backpropagation), в народе — бэкпроп.
Работает он в два прохода. Сначала прямой проход (forward pass): данные текут по сети слева направо, слой за слоем, пока не выпадет ответ; его сверяют с эталоном и считают потери. Потом обратный проход (backward pass): ошибка идёт вспять, справа налево. На каждом слое, пользуясь цепным правилом дифференцирования, алгоритм прикидывает долю вины каждого веса — его вклад в итоговый промах. Представьте, что ошибка течёт назад по сети и на каждой связи оставляет записку: «тебе — вот в эту сторону и вот настолько».
Одно уточнение, чтобы не путались: сам бэкпроп веса не трогает. Он лишь вычисляет градиент — направление и величину нужной правки для каждого веса. А двигает веса уже градиентный спуск: сдвигает каждый против его градиента на величину, пропорциональную скорости обучения. Прямой проход, обратный проход, шаг. И заново. Именно эта связка вытащила глубокие сети из небытия — за каждым сегодняшним ИИ стоит она.
для каждой эпохи:
для каждого батча (порции примеров):
предсказание = сеть(вход) # прямой проход
loss = потери(предсказание, ответ) # измеряем ошибку
градиенты = backprop(loss) # обратный проход
веса = веса − скорость * градиенты # шаг спуска
Эпохи, батчи и борьба с переобучением
В псевдокоде мелькнули два слова — поясню. Батч (batch) — порция примеров, которую сеть жуёт за один шаг. Считать градиент по всему датасету дорого, по одному примеру — слишком дёргано и шумно, поэтому берут порции в десятки, сотни, тысячи. Эпоха (epoch) — один полный проход по всем обучающим данным. Обучение тянется много эпох: сеть снова и снова видит те же данные, всякий раз чуть подправляя веса.
И тут поджидает ловушка, на которой обжигались все. Переобучение (overfitting). Если сеть чересчур мощная, а данных мало, она вместо общих закономерностей принимается зубрить конкретные примеры — вместе с их случайным шумом. На знакомом — блеск. На новом — позор. Ровно как студент, вызубривший ответы к одному билету и поплывший на любом другом вопросе.
◆ Как распознать
Данные делят на обучающую и проверочную (валидационную) части. Ошибка на обучении падает, а на проверочных данных встала и поползла вверх? Вот он, характерный симптом: сеть заучивает частности вместо сути.
Против этого есть целый арсенал — собирательно его зовут регуляризацией (regularization). Dropout на каждом шаге случайно вырубает часть нейронов, чтобы сеть не цеплялась за отдельные приметы, а искала устойчивые. Штраф за слишком большие веса не даёт модели впадать в резкие, подогнанные решения. Ранняя остановка (early stopping) обрывает учёбу в тот момент, когда ошибка на проверке перестала падать — дальше будет только хуже. А самое надёжное лекарство скучное и всем известное: больше данных, и поразнообразнее. Чем шире опыт, тем труднее его зазубрить — приходится понимать.
◆ Ключевое
Цель обучения — не вызубрить обучающие примеры на пятёрку, а хорошо работать на невиданных. Это свойство зовут обобщением (generalization). Ему и служит вся регуляризация: сеть, чуть более слабая на знакомом, но заметно надёжнее на новом, — выгодный обмен.
- Функция потерь сворачивает ошибку сети в одно число; обучение — это её целенаправленное уменьшение изменением весов.
- Потери как функцию весов рисуют ландшафтом с холмами и долинами; градиентный спуск шагает против градиента — в сторону меньшей ошибки.
- Скорость обучения задаёт размер шага: слишком мал — плетётся, слишком велик — скачет и расходится. Бывают застревания в локальных минимумах.
- Обратное распространение двумя проходами (вперёд — предсказание, назад — ошибка) считает для каждого веса его поправку; сам шаг делает уже градиентный спуск.
- Учат порциями (батчи) и многими проходами (эпохи); главный враг — переобучение, а лекарства — регуляризация (dropout, ранняя остановка) и побольше данных ради обобщения.
Архитектуры зрения и последовательностей: CNN, RNN, LSTM
Прежде чем появился трансформер, машины уже научились видеть и слушать. За это отвечали две большие идеи: свёрточные сети, устроенные как «глаз, скользящий по картинке», и рекуррентные сети — с памятью, которая тянется сквозь время. Разберёмся, как именно они работают, — потому что многое из этого живо и сегодня.
В предыдущих главах мы говорили о нейросети как об универсальном «блендере» из слоёв и весов. Но если взять простейшую полносвязную сеть и скормить ей фотографию, случится катастрофа. Картинка размером всего 1000×1000 пикселей, да ещё в цвете, — это три миллиона чисел на входе. Соединить каждый вход с каждым нейроном первого слоя означало бы миллиарды весов только на первом шаге. Сеть станет неподъёмной, будет мучительно медленной и переобучится на шуме, так и не поняв, что на снимке кот. Нужна архитектура, которая учитывает устройство самих данных: у изображения есть геометрия, у речи и текста — порядок во времени. Именно из этих двух наблюдений выросли свёрточные и рекуррентные сети.
Свёртка: фильтр, который ищет узор
Главная идея свёрточной сети (CNN) до смешного проста: не надо смотреть на всю картинку сразу — надо скользить по ней маленьким окошком и в каждой точке спрашивать один и тот же вопрос. Это окошко называется фильтром, или ядром (kernel). Обычно оно крохотное — 3×3 или 5×5 пикселей.
Свёртка (convolution)
Операция, при которой маленький фильтр последовательно прикладывается ко всем участкам изображения. В каждой позиции числа фильтра перемножаются с числами под ним, всё складывается — и получается одно число: насколько сильно узор фильтра совпал с этим участком. Из этих чисел собирается новая «картинка» — карта признаков.
Вообразите фильтр, который реагирует на вертикальную границу — переход от тёмного к светлому. Внутри у него слева стоят отрицательные числа, справа — положительные. Приложите его к однородному участку неба — плюсы и минусы взаимно погасятся, на выходе получится около нуля: «границы тут нет». Приложите к краю крыши на фоне неба — минусы лягут на тёмное, плюсы на светлое, всё сложится в большое число: «здесь сильная вертикальная граница!». Один и тот же фильтр, проехав по всему снимку, отметит все вертикальные края разом.
Здесь прячутся две глубокие идеи, из-за которых CNN работают так хорошо именно на изображениях.
Локальность. Чтобы найти границу или уголок, не нужно смотреть на весь снимок — достаточно крошечной окрестности. Признаки картинки локальны: важные узоры собираются из соседних пикселей, а не из точек в противоположных углах кадра. Фильтр 3×3 честно отражает это устройство мира.
Разделяемые веса (weight sharing). Один и тот же фильтр применяется ко всем участкам изображения. Значит, детектор вертикальной границы одинаково хорош и в левом верхнем углу, и в правом нижнем. Сети не приходится заново учиться узнавать край в каждой точке кадра — она выучивает узор один раз. Это резко сокращает число параметров: вместо миллионов индивидуальных связей — всего девять чисел на фильтр. Отсюда и скорость, и устойчивость к переобучению.
◆ Ключевое
Свёрточный слой — это не «нейрон на каждый пиксель», а небольшой набор фильтров-узнавателей, каждый из которых прочёсывает всю картинку. Сеть учит сами фильтры: какие узоры искать — она решает по данным, а не по подсказке человека.
◆ Пример
Разберём на цифрах. Фильтр вертикальной границы: слева столбец −1, справа +1, посередине нули. Кладём его на участок, где слева темно (значения около 10), а справа светло (около 90). Тёмное умножается на минус, светлое на плюс, всё складывается — выходит большое положительное число: «граница есть». Тот же фильтр на ровном сером пятне (везде 50) — плюсы и минусы сокращаются, получается ноль: «границы нет». Больше этот фильтр не умеет ничего. В этом и вся красота: один тупой детектор, зато честный.
Обычно в одном свёрточном слое не один фильтр, а десятки или сотни: один ищет вертикальные края, другой — горизонтальные, третий — пятна определённого цвета, четвёртый — диагональные штрихи. Каждый порождает свою карту признаков, и на выходе слоя получается целая стопка таких карт — как если бы на исходную фотографию наложили множество полупрозрачных «подсветок», каждая из которых отмечает свой тип узора.
Пулинг и иерархия признаков
Карт признаков много, и они почти такого же размера, как исходная картинка. Чтобы двигаться дальше, их нужно сжать — не потеряв главного. Этим занимается пулинг (pooling), чаще всего max-pooling: карту разбивают на окошки 2×2 и от каждого оставляют только максимальное значение. Картинка ужимается вчетверо, но сообщение сохраняется: «в этой области сильный сигнал такого-то узора был — а точное место на пиксель нам уже не так важно».
Пулинг даёт ещё один подарок — инвариантность к сдвигу. Если кот на фотографии сместится на пару пикселей, максимумы в окнах почти не изменятся, и сеть по-прежнему уверенно скажет «кот». Модель перестаёт цепляться за точные координаты и начинает узнавать наличие признака, а не его адрес.
Теперь соберём главное. Свёрточную сеть строят как чередование: свёртка — пулинг — свёртка — пулинг, слой за слоем. И происходит удивительное: с каждым уровнем признаки становятся всё сложнее и осмысленнее.
Логика такова. Первые фильтры, работая прямо с пикселями, умеют лишь примитивное — края, пятна, штрихи. Но следующий слой смотрит уже не на пиксели, а на карты признаков предыдущего слоя. Комбинируя «вертикальный край рядом с горизонтальным», он собирает уголок. Ещё слой выше — из уголков и дуг складывает круг или контур глаза. А самые верхние слои оперируют этими «деталями» и узнают целые объекты: морду кота, колесо, лицо. Никто не программировал сети понятие «глаз» — она сама выстроила эту лестницу абстракций, потому что так удобнее решать задачу.
◆ Пример
Если «подсмотреть», на что реагируют нейроны обученной CNN, картина получается именно такой: на ранних слоях — полоски и цветовые градиенты, в середине — текстуры, решётки, завитки, а на глубоких слоях — узнаваемые «детекторы» морд, колёс, текста. Абстракция буквально нарастает с глубиной.
Где это применяется? Свёрточные сети — рабочая лошадка компьютерного зрения: распознавание объектов на фото, поиск опухолей на снимках КТ и рентгене, зрение беспилотных автомобилей, разбор рукописного текста, контроль качества на конвейере. Свёртку применяют и к одномерным данным — звуковой волне или временному ряду (там фильтр скользит вдоль времени), и в этом смысле идея гораздо шире, чем просто «сети для картинок».
◆ Из истории
Свёртка не вчера родилась. Ещё в конце 1980-х Ян Лекун учил такие сети читать рукописные индексы на конвертах — и они читали. Но гром грянул в 2012-м: сеть по имени AlexNet выиграла конкурс по распознаванию картинок ImageNet с таким отрывом, что зал притих. Хитрость была не в новом алгоритме, а в масштабе — гора данных, глубокая сеть и видеокарты вместо процессоров. С того дня компьютерное зрение стало свёрточным, и споры на эту тему как-то сами собой утихли.
Рекуррентные сети: память во времени
Изображение можно окинуть взглядом целиком. А вот с речью, текстом или котировками так не выйдет: это последовательности — данные, у которых важен порядок. Смысл фразы «собака укусила человека» и «человек укусил собаку» различает именно очерёдность слов. Чтобы обрабатывать такие данные, нужна архитектура с памятью.
Так устроены рекуррентные сети (RNN). Идея: сеть читает последовательность по одному элементу — слово за словом, отсчёт за отсчётом — и на каждом шаге обновляет своё скрытое состояние (hidden state) — компактную сводку всего, что она увидела до сих пор. Это состояние и есть её память.
Скрытое состояние (hidden state)
Вектор чисел, который RNN несёт с собой сквозь последовательность. На каждом шаге сеть смешивает новый вход с прежним состоянием и получает новое — обновлённую «краткую запись» всего прочитанного. Один и тот же блок обработки применяется на каждом шаге.
Ключевое слово — «тот же самый блок». RNN не строит отдельный слой под каждое слово; у неё одна ячейка, которая раз за разом получает на вход пару «новый элемент + предыдущее состояние» и выдаёт новое состояние. Отсюда и название: сеть будто зацикливается сама на себя, прогоняя данные через одну и ту же петлю. Чтобы разглядеть, как она учится, петлю мысленно «разворачивают во времени».
Развёрнутая RNN выглядит как длинная цепочка одинаковых блоков, соединённых горизонтальной «нитью памяти». Когда сеть дочитала фразу до слова «молоко», её состояние уже хранит след от «кот» и «пил» — поэтому она способна, например, предсказать следующее слово или перевести предложение целиком. На этом принципе долгие годы держались машинный перевод, распознавание речи, автодополнение текста и прогнозы временных рядов.
Одну хитрость назову отдельно. Часто смысл слова проясняет не прошлое, а будущее: «он снял банк…» — а что дальше, деньги или речной обрыв? Отсюда двунаправленные RNN: две сети читают фразу навстречу, слева направо и справа налево, а их памяти сливают воедино. Для перевода же собирали связку из двух сетей: первая («энкодер») дочитывала предложение и сжимала его в один вектор смысла, вторая («декодер») разворачивала этот вектор в текст на другом языке. Красиво. Но есть узкое горло: весь смысл длинной фразы приходилось впихивать в единственный вектор — и на длинных предложениях перевод плыл. Запомните это горло. Ровно его расширит внимание из следующей главы.
Но у простой RNN есть тяжёлая болезнь — затухающий градиент (vanishing gradient). Вспомним: сеть учится, прогоняя сигнал ошибки назад по всей цепочке. А цепочка развёрнутой RNN может быть очень длинной — сотни шагов. Чтобы «дотянуться» от конца фразы к её началу, поправка ошибки должна пройти сквозь десятки одинаковых умножений. А теперь фокус с арифметикой: возьмите 0,9 и умножьте само на себя пятьдесят раз. Получится около 0,005. Сигнал не доходит до ранних слов — он тает по дороге. Память есть, но короткая.
◆ Осторожно
Практическое следствие затухающего градиента: простая RNN «забывает» далёкое прошлое. В длинном тексте она легко теряет связь между началом и концом. Классический пример — согласование: «Ключи, которые лежали в ящике стола на кухне, были потеряны». Чтобы верно выбрать «были», а не «был», надо помнить слово «ключи» через много слов назад — и обычной RNN это часто не под силу.
LSTM и GRU: ворота памяти
Лекарство придумали в виде более хитрой ячейки — LSTM (долгая краткосрочная память). Её главная находка — отдельный канал состояния ячейки (cell state): «конвейерная лента», которая тянется сквозь всю последовательность почти без изменений. По этой ленте информация может ехать далеко-далеко, не размываясь, — и именно поэтому LSTM способна помнить контекст на сотни шагов.
А управляют этой лентой ворота (gates) — маленькие обучаемые «краники», каждый из которых пропускает от 0 («перекрыто») до 1 («полностью открыто»). Ворот три, и у каждого своя роль.
- Ворота забывания (forget gate)
Смотрят на новый вход и на прежнюю память и решают, что с конвейера пора стереть. Пример: встретили новое подлежащее — можно забыть род и число предыдущего.
- Ворота записи (input gate)
Решают, какую новую информацию стоит положить на ленту состояния. Так на конвейер попадает свежий важный факт — например, что подлежащее во множественном числе.
- Ворота вывода (output gate)
Решают, какую часть текущего состояния выдать наружу как ответ (скрытое состояние) на этом шаге. Память может хранить многое, а показывать — лишь релевантное сейчас.
Благодаря воротам LSTM сама учится, что стоит держать в памяти долго, а что — выбросить сразу. Согласование «ключи… были» ей уже по силам: подлежащее «ключи» удержится на конвейере состояния через все промежуточные слова. А поскольку по этой ленте сигнал ошибки при обучении течёт почти без затухания, проблема исчезающего градиента отступает.
Есть и упрощённый родственник — GRU (управляемый рекуррентный блок). В нём ворот всего двое (обновления и сброса), нет отдельного канала состояния, параметров меньше — а качество на многих задачах почти такое же. GRU часто выбирают, когда данных или вычислений в обрез.
| Архитектура | Для каких данных | Сильная сторона | Слабое место |
|---|---|---|---|
| CNN | Изображения, звук, сетки | Локальные узоры, мало весов | Плохо с далёкими связями во времени |
| Простая RNN | Короткие последовательности | Простота, память о недавнем | Забывает далёкое (затухание градиента) |
| LSTM / GRU | Длинные последовательности | Долгая память через «ворота» | Медленная — считает шаг за шагом |
Долгое время LSTM были золотым стандартом для текста и речи. Но у них остался врождённый недостаток: последовательность обрабатывается строго по очереди, шаг за шагом, — а значит, её нельзя эффективно распараллелить на современных ускорителях, и обучение на огромных корпусах тянется мучительно долго. Именно этот барьер и снёс трансформер, о котором — следующая глава. Впрочем, CNN живее всех живых в компьютерном зрении, а LSTM и GRU до сих пор трудятся там, где данные текут потоком в реальном времени.
- CNN скользит по картинке маленьким фильтром, ища узоры. Локальность и разделяемые веса делают её лёгкой и быстрой для изображений.
- Пулинг сжимает карты признаков и даёт устойчивость к сдвигу; слои выстраивают иерархию: края → формы → объекты.
- RNN читает последовательность по элементу, неся сквозь неё скрытое состояние — память. Но из-за затухающего градиента забывает далёкое прошлое.
- LSTM добавляет «конвейер» состояния и трое ворот (забыть / записать / выдать), поэтому помнит контекст надолго; GRU — её упрощённая версия.
- Все они считают последовательно — и этот предел позже снял трансформер.
Трансформер изнутри: внимание, эмбеддинги, слои
В 2017 году одна статья с дерзким названием «Внимание — это всё, что нужно» перевернула искусственный интеллект. Её архитектура — трансформер — лежит в основе ChatGPT, переводчиков, генераторов кода и изображений. Разберём её по кирпичикам: как слова превращаются в числа, как модель решает, на что «смотреть», и почему из десятков одинаковых блоков рождается понимание.
В прошлой главе мы упёрлись в стену: рекуррентные сети читают текст строго по одному слову и потому не поддаются распараллеливанию. Трансформер снёс эту стену радикальным решением — смотреть на все слова сразу. Вместо того чтобы тащить память вдоль цепочки, он позволяет каждому слову напрямую заглянуть в любое другое, как бы далеко оно ни стояло. Механизм такого «заглядывания» называется вниманием (attention), и именно он — сердце всей конструкции. Но прежде чем внимание заработает, слова нужно перевести на язык, понятный сети, — на язык чисел.
Эмбеддинги: слова как точки в пространстве смысла
Нейросеть не понимает букв — она понимает числа. Значит, каждое слово надо превратить в набор чисел. Наивный способ — присвоить словам номера («кот» = 5, «собака» = 6) — никуда не годится: он навязывает бессмысленный порядок и не говорит, что кот и собака близки, а кот и экскаватор — нет. Нужен способ умнее — эмбеддинг.
Эмбеддинг (embedding)
Представление слова в виде вектора — длинного списка чисел (часто сотни или тысячи). Эти числа не назначают вручную: их подбирает обучение так, чтобы близкие по смыслу слова оказались рядом в многомерном пространстве, а далёкие — врозь. Смысл превращается в геометрию: близость = похожесть.
Одна честная оговорка. Дробит модель текст не совсем на слова, а на токены — кусочки. Частые слова остаются целыми, длинные и редкие распадаются: «непереводимость» превращается во что-то вроде «не-перевод-им-ость». Так словарь остаётся компактным, а незнакомых слов для модели попросту нет — любое соберётся из кусочков, как из деталей лего. Дальше я всё равно буду говорить «слово»: на сути это не сказывается.
Представьте огромное пространство, где у каждого слова есть свои координаты. «Кот», «собака», «тигр» соберутся в одном углу — в кластере животных. «Король», «королева», «принц» — в другом. Причём геометрия оказывается на удивление осмысленной: между словами возникают устойчивые «направления». Классический пример — направление «мужское → женское»: путь от «король» к «королева» примерно тот же, что от «мужчина» к «женщина». Модель нигде не учили грамматике рода — эта структура сама проступила из того, как слова употребляются в текстах.
Но у эмбеддингов есть слепое пятно: сами по себе они ничего не знают о порядке. Для набора векторов «кот пил молоко» и «молоко пил кот» выглядят одинаково — а смысл разный. Рекуррентная сеть чувствовала порядок, потому что читала по очереди; трансформер смотрит на всё сразу и порядок теряет. Поэтому к каждому эмбеддингу добавляют позиционное кодирование (positional encoding) — специальный вектор, зависящий от места слова во фразе. Он словно ставит на каждое слово штамп «я на позиции 1», «я на позиции 2». И вот теперь «кот пил молоко» и «молоко пил кот» для модели — разные фразы.
◆ Ключевое
На входе трансформера каждое слово — это сумма двух векторов: эмбеддинга («что это за слово») и позиционного кода («где оно стоит»). Дальше вся работа идёт с этими числами.
Внимание: поиск по смыслу
Теперь — самое сердце. Возьмём фразу «Кот не стал пить молоко, потому что оно было холодным». К чему относится «оно» — к коту или к молоку? Человек понимает мгновенно: холодным было молоко. Чтобы разобраться, модели нужно, обрабатывая слово «оно», заглянуть в остальные слова фразы и сильнее всего — в слово «молоко». Именно это делает внимание.
Механизм удобно представить как поиск в библиотеке. Каждое слово выпускает из своего вектора три разных «проекции» — три роли:
- Запрос (query, Q) — «что я ищу?». Для слова «оно» запрос примерно означает: «мне нужен предмет, к которому я отсылаю».
- Ключ (key, K) — «чем я являюсь, по какому ярлыку меня найти?». Это как надпись на корешке книги.
- Значение (value, V) — «что я несу, какое содержание передам, если меня выберут?». Это сам текст книги.
Дальше — три шага, и в этом вся суть.
- Оценка соответствия
Запрос слова «оно» сравнивается с ключом каждого слова фразы (математически — скалярным произведением векторов). Чем сильнее совпадение, тем выше оценка. Ключ слова «молоко» откликнется на запрос «оно» громче остальных.
- Нормировка в веса
Оценки прогоняют через softmax и превращают в веса, которые в сумме дают единицу, — «доли внимания». Скажем, 0,7 на «молоко», 0,1 на «кот», по чуть-чуть на остальные.
- Взвешенное суммирование
Берём значения (V) всех слов и складываем их с этими весами. Раз у «молока» вес 0,7 — новое представление слова «оно» вбирает в себя в основном смысл «молока». Слово буквально «пропиталось» контекстом.
Это и есть self-attention (самовнимание): «само», потому что слова фразы смотрят друг на друга внутри одной и той же последовательности. И главное — все слова проделывают это одновременно, независимо друг от друга. Никакой цепочки «шаг за шагом»: вся фраза обрабатывается разом, что идеально ложится на параллельные вычисления видеокарт. Вот почему трансформеры удаётся обучать на текстах немыслимого объёма — там, где RNN захлебнулась бы.
Зачем вообще мягкие веса — почему не взять одно самое похожее слово и не забыть остальные? Потому что смысл редко висит на одном крючке. «Оно» опирается прежде всего на «молоко», но капля контекста от «холодным» и «пить» тоже подкрашивает картину. Мягкое внимание — компромисс: не сваливает всё в одну точку и не размазывает поровну. И ещё техническая мелочь с крупными последствиями: перед softmax оценки делят на корень из длины вектора. Без этого при длинных векторах числа разбегаются, softmax становится «всё или ничего», и обучение застревает. Мелочь. А сеть без неё не учится.
Удобно смотреть на внимание всей фразы как на матрицу: строки — кто смотрит, столбцы — на кого; в клетках — сила связи. Чем ярче клетка, тем больше внимания.
Многоголовое внимание и блок трансформера
Одного взгляда мало. В языке у слова разом много типов связей: грамматические (кто с кем согласуется), смысловые (что к чему относится), синтаксические (кто подлежащее, кто дополнение). Заставлять единственный механизм внимания ловить всё сразу — расточительно. Поэтому используют многоголовое внимание (multi-head attention): запускают несколько «голов» внимания параллельно, и каждая учится своему типу отношений.
Одна голова следит за согласованием подлежащего и сказуемого; другая — за тем, к чему относятся местоимения; третья — за связкой предлогов. Каждая строит свою матрицу внимания и своё представление, а потом результаты всех голов склеивают вместе. Получается объёмный, многогранный взгляд на фразу — будто на неё смотрят несколько экспертов, каждый со своей точки зрения, а выводы затем сводят воедино.
◆ Пример
Если заглянуть в обученную модель, головы и вправду специализируются: находят головы, которые почти всегда связывают слово с предыдущим, головы «глагол → его подлежащее», головы «существительное → его прилагательное». Никто их так не программировал — они распределили роли сами.
Внимание — мотор, но не вся машина. Полный блок трансформера (transformer block) — это аккуратная сборка из нескольких частей, сквозь которую данные текут снизу вверх.
Пройдём по блоку. Сначала многоголовое внимание — слова обмениваются контекстом. Затем остаточная связь (residual): к результату внимания прибавляют исходный вход блока. Это как оставлять «страховочный трос» — короткий путь, по которому сигнал и градиент проходят напрямую, не теряясь; именно остаточные связи позволяют складывать десятки слоёв, не сталкиваясь с затуханием, что мучило RNN. Следом идёт нормализация (layer norm) — она приводит числа к разумному масштабу, чтобы обучение шло устойчиво. Потом — полносвязный слой (feed-forward network, FFN): он обрабатывает каждое слово по отдельности, добавляя нелинейной «вычислительной мощи». И снова остаточная связь с нормализацией.
Остаточная связь (residual connection)
Приём, при котором выход подслоя складывают с его же входом: результат = вход + обработка(вход). Даёт сигналу «обходной путь» в неизменном виде, поэтому глубокие сети из десятков слоёв обучаются устойчиво, а не теряют сигнал по дороге.
А теперь фокус: этот блок повторяют. Выход одного блока становится входом следующего — и так десятки раз (в больших моделях — многие десятки слоёв). Каждый следующий блок работает с всё более «пропитанными» контекстом представлениями. Как в CNN нарастала иерархия визуальных признаков, так здесь с высотой стопки нарастает глубина языкового понимания: нижние блоки схватывают грамматику и ближайшие связи, верхние — смысл, намерение, длинные логические зависимости.
◆ Осторожно
У внимания есть цена, и она кусается. Раз каждое слово смотрит на каждое, число связей растёт как квадрат длины текста: удвоили фразу — вычислений вчетверо больше. Отсюда предел длины (то самое «контекстное окно») и дороговизна длинных документов. Добрая половина исследований последних лет — попытки перехитрить этот квадрат, не растеряв качества.
Энкодер, декодер и семейство моделей
Из одного строительного блока собирают разные конфигурации — под разные задачи. Исторически трансформер придумали для перевода, и в нём было две половины.
- Энкодер (encoder) — «читатель». Прогоняет весь входной текст сквозь стопку блоков и строит его богатое смысловое представление. Каждое слово видит все остальные — и слева, и справа.
- Декодер (decoder) — «писатель». Порождает выходной текст слово за словом, оглядываясь и на уже написанное, и (через отдельное внимание) на представление, собранное энкодером.
У декодера есть важная тонкость — маскированное внимание (masked attention). Когда модель учится предсказывать следующее слово, ей нельзя подглядывать в будущее — иначе задача превратится в списывание. Поэтому связи «вперёд» перекрывают: каждое слово при генерации видит только то, что стоит до него. Это и есть причинное (каузальное) внимание.
| Тип | Из чего состоит | Для чего | Примеры |
|---|---|---|---|
| Только энкодер | Стопка энкодеров | Понимание: классификация, поиск смысла | BERT |
| Энкодер + декодер | Обе половины | Преобразование: перевод, пересказ | Оригинальный Transformer, T5 |
| Только декодер | Стопка декодеров (с маской) | Генерация текста слово за словом | GPT, современные чат-модели |
Большинство знакомых нам чат-моделей — это decoder-only, «только декодер». Их задача устроена обманчиво просто: снова и снова предсказывать следующее слово. Модель читает всё, что уже есть (ваш запрос плюс то, что она сама успела написать), пропускает через десятки блоков внимания и выдаёт вероятности для следующего слова. Выбирает одно, дописывает, — и повторяет заново. Из этого бесхитростного цикла «предскажи следующее слово» и рождается связный ответ, код, стихотворение или перевод.
Посмотрите на это вблизи. Вы пишете: «Столица Франции —». Модель прогоняет фразу через все свои слои и выдаёт не готовый ответ, а таблицу вероятностей на следующее слово: «Париж» — 0,92, «город» — 0,03, «Лион» — 0,01, и так по всему словарю. Берёт «Париж», дописывает — и вся строка «Столица Франции — Париж» снова уходит на вход, теперь уже ради следующего слова. Так, по кирпичику, вырастает и короткая реплика, и десятистраничное эссе. Плана наперёд у модели нет: она живёт одним следующим словом. То, что из такой близорукости складывается связная мысль, до сих пор немного изумляет даже тех, кто эти модели строит.
◆ Из истории
Статья Vaswani и соавторов «Attention Is All You Need» (2017) предлагала трансформер именно для машинного перевода — как связку энкодер-декодер. Ирония в том, что самое громкое продолжение получила «урезанная» ветвь: модели только с декодером (линия GPT), которые просто предсказывают следующее слово, — на них выросла вся эпоха больших языковых моделей.
Если нужен один образ на всю главу — вот он. Представьте длинный ряд редакторов за общим столом. Каждому дают текст, где у слов уже проставлены смысловые координаты и номера мест. Первый редактор разрешает словам переглянуться и обменяться намёками — это внимание; потом каждое слово он обдумывает поодиночке — это полносвязный слой; и передаёт правку соседу. Тот делает ровно то же, но текст перед ним уже чуть осмысленнее. К концу ряда черновик из россыпи слов превращается в понятую мысль. Редакторы устроены одинаково — отличается лишь зрелость текста, который до них дошёл.
Соберём всё вместе. Текст превращается в эмбеддинги с позиционными кодами. Стопка блоков трансформера прогоняет их через многоголовое внимание (слова обмениваются смыслом), полносвязные слои, остаточные связи и нормализацию. С каждым блоком понимание глубже. На выходе — предсказание следующего слова. Ни рекуррентной памяти, ни свёрток — только внимание, помноженное на масштаб. Именно эта архитектура, накормленная триллионами слов и колоссальными вычислениями, и породила модели, которые пишут, переводят и рассуждают. Как этот масштаб превращается в неожиданные умения — тема следующих глав.
- Эмбеддинги превращают слова в векторы так, что близость в пространстве = близость по смыслу; позиционное кодирование добавляет сведения о порядке слов.
- Self-attention позволяет каждому слову «заглянуть» во все другие: запрос ищет по ключам, а ответ — взвешенная сумма значений. Аналогия — поиск по смыслу в библиотеке.
- Все слова обрабатываются одновременно — отсюда параллельность и обучаемость на гигантских объёмах, недоступная RNN.
- Многоголовое внимание ловит разные типы связей сразу; блок трансформера = внимание → нормализация → FFN + остаточные связи, и таких блоков десятки.
- Конфигурации: только энкодер (понимание), энкодер-декодер (перевод), только декодер (генерация — GPT и чат-модели, предсказывающие следующее слово).
Большие языковые модели: от токена до ответа
Внутри чат-бота нет библиотеки фактов. Нет свода правил. Нет голоса, который знает ответ. Есть машина, которая делает одно движение, миллиарды раз подряд: смотрит на кусочек текста и угадывает, что идёт дальше. Из этого крошечного движения вырастает всё — перевод, стихи, программный код и обманчивое ощущение, что с той стороны кто-то есть.
Три буквы, LLM, разворачиваются в «большую языковую модель» (large language model). Каждое слово тут не для красоты. Языковая — потому что имеет дело с текстом. Модель — потому что это не хранилище, а математическая функция с настраиваемыми числами, которая приблизительно описывает, как устроен язык. А большая — потому что этих чисел, их зовут параметрами (parameters), от миллиардов до триллионов, и училась функция на таком объёме текста, который вы не прочли бы и за тысячу жизней.
Хорошо, а что она, собственно, вычисляет? Ответ до обидного прост, и к нему стоит привыкнуть заранее — вокруг него держится вся глава. Модель берёт на вход текст и выдаёт вероятности следующего кусочка. И больше ничего. Она не «вникает в вопрос» и не «докапывается до истины» в том смысле, в каком это делаете вы. Она продолжает начатое — так, как чаще всего продолжают похожие обрывки в её обучающих текстах. Диалог, объяснение, разбор задачи — для неё это одно и то же занятие: дописать правдоподобное продолжение.
Что такое LLM и почему она «продолжает текст»
Вообразите невероятно начитанного собеседника с одной странностью. Он проглотил почти весь интернет, но не помнит ни единого источника и не может сказать «это я где-то читал». Осталось только чутьё: какое слово естественно идёт за каким. Скажите ему «Столица Франции —», и он не полезет в справочник. Он просто почувствует, что после этих слов почти всегда стоит «Париж». Не оттого, что разбирается в географии, а оттого, что видел такую связку миллион раз. LLM устроена похоже. Только вместо чутья — числа, а вместо человека — гора умножений матриц.
Большая языковая модель (LLM)
Нейросеть, обученная предсказывать следующую единицу текста по предыдущим. Из этого единственного навыка, доведённого до предела на гигантских данных, вырастает умение переводить, рассуждать, писать код и вести диалог — без отдельных «модулей» под каждую задачу.
Тут прячется мысль, от которой многим становится не по себе. Отвечая, модель технически не отличает случай, где продолжение — проверяемый факт, от случая, где продолжение — красивая выдумка. И то и другое для неё просто «текст, который ладно ложится дальше». Отсюда галлюцинации (hallucinations) — уверенно произнесённая неправда. Разберём их отдельно. Пока запомните короткое: правдоподобие и правда — не одно и то же, а модель по умолчанию гонится за первым.
◆ Ключевое
LLM не держит факты как строки в таблице. Она держит статистические связи между кусочками текста. Поэтому блестяще угадывает частое и уверенно врёт на редком, узком или свежем.
Если всё так примитивно — «угадай следующее слово», — откуда берётся видимость мышления? Секрет в масштабе и в одном коварном условии. Чтобы хорошо угадывать продолжение, приходится поневоле выучить пугающе много. Возьмите фразу «Вода закипает при ста градусах по». Чтобы её закончить, надо связать воду, кипение и Цельсия. Чтобы дописать строку кода — усвоить синтаксис языка. Предсказание текста работает как экзамен, который не сдать, не поняв мир, о котором текст. Обёртка простая. А знания, которые она вытягивает наружу, — совсем нет.
Токены и эмбеддинги: как текст становится числами
Нейросеть не читает буквы. Она перемножает числа. Значит, текст надо превратить в числа, и делается это в два хода: сперва режем на кусочки, потом каждому кусочку выдаём вектор.
Первый ход — токенизация (tokenization). Текст рубится на токены (tokens). Это не буквы и не совсем слова, а нечто посередине. Частые слова становятся одним токеном целиком; редкие рассыпаются на несколько. У модели есть заранее заданный словарь (vocabulary) — перечень всех токенов, которые она знает, обычно от пятидесяти тысяч и выше. Каждому токену в словаре присвоен номер.
Посмотрите, как одна фраза распадается на токены (символ «·» — это приклеенный к началу пробел):
Текст: "Машины учатся предсказывать текст."
Токены: [Маш][ины][·уч][атся][·пред][сказ][ывать][·текст][.]
Номера: [7412][238][1590][6631][ 904][3372][ 88][12045][13]
9 токенов -> 9 целых чисел -> вход модели
Заметили? «Машины» развалилось надвое, «предсказывать» — натрое, а точка ушла отдельным токеном. Английский обычно чуть «дешевле» русского по числу токенов — модели чаще учат на английском, и словарь заточен под него. Отсюда сугубо практический вывод: токен — это единица, в которой мерят и деньги, и лимиты. Когда вам обещают «контекст 128 тысяч» или берут плату «за миллион токенов», речь про эти самые кусочки, а вовсе не про слова.
◆ Пример
Грубо, на глаз: один токен — это примерно 3–4 символа. Страница книги (около 500 слов) тянет на 650–750 токенов, ответ ассистента в пару абзацев — на сотни. Считать удобно, привыкать полезно.
Второй ход — эмбеддинг (embedding). Голый номер «7412» для сети пустой звук: соседние номера ничего не говорят о близости по смыслу. Поэтому каждому токену сопоставляют вектор — длинный столбик чисел, координаты точки в пространстве смыслов. Никто не расставляет эти координаты вручную. Они выучиваются при обучении так, чтобы близкие по употреблению токены оказались рядом. В таком пространстве «король» и «королева» стоят по соседству, а хрестоматийное «король − мужчина + женщина ≈ королева» превращается почти в буквальную арифметику над векторами. Вот на этом языке — на языке эмбеддингов — модель дальше и «думает».
Что творится в самом жирном блоке — «слои трансформера» — мы подробно разбирали в главе про внимание. Здесь хватит образа. Пройдя десятки таких слоёв, вектор каждого токена впитывает контекст всех соседей: кто на кого влияет, что к чему относится. На выходе для последней позиции остаётся вектор, из которого модель уже готова достать своё предсказание.
Авторегрессия: ответ рождается по одному токену
Из последнего вектора модель считает логиты (logits) — по числу на каждый токен словаря. Логит — это «сырая» степень желания: чем больше, тем охотнее модель поставила бы сюда именно этот токен. Функция softmax перегоняет весь набор логитов в честное распределение вероятностей: десятки тысяч неотрицательных чисел, которые в сумме дают единицу. Готово. Теперь у нас есть ответ на вопрос «какой токен следующий и насколько вероятен каждый вариант».
Дальше самое интересное — то, из-за чего ответ печатается словно вживую, толчками. Модель выбирает один токен, приклеивает его к концу текста и запускает весь конвейер заново. С новым, чуть более длинным текстом на входе. Потом ещё раз. И ещё. Каждый следующий токен предсказывается с нуля, с оглядкой на всё написанное, включая только что рождённое. Режим «выход снова подаётся на вход» называют авторегрессией (autoregression).
Авторегрессия
Генерация последовательности по одному элементу за раз, где каждый новый элемент зависит от всех предыдущих (включая уже сгенерированные) и тут же становится частью входа для следующего шага.
У такой механики два последствия, и оба вы наверняка замечали. Одно — скорость. Длинный ответ физически не может выскочить целиком: токены рождаются строго друг за другом, отсюда и «печатающий» бот. Второе тоньше — накопление. Стоит модели на каком-то шаге выбрать неудачный токен, и он уже вошёл в контекст, уже влияет на всё дальнейшее. Ошибка тянет за собой хвост. Модель начинает старательно достраивать связный, логичный, убедительный — и неверный — сюжет вокруг собственной оговорки. Вот вам одна из причин, почему длинные рассуждения порой так изящно уезжают не туда.
Температура, окно контекста и обучение в контексте
Мы подошли к развилке, где решается участь каждого токена. Распределение вероятностей есть — как вытащить из него один вариант? Можно всегда брать самый вероятный, «жадно». Но тогда модель делается занудой: один и тот же запрос — один и тот же ответ, слово в слово. Чтобы вдохнуть жизнь, выбор делают случайным, но с перекосом в сторону вероятного. И вот здесь на сцену выходит температура (temperature).
Температура — это ручка, которая перед случайным выбором делает распределение «острее» или «площе». Крутанёте вниз, к нулю, — пики заостряются, почти вся вероятность стягивается к лидеру, ответы становятся уверенными и повторяемыми. То, что нужно для фактов, кода, извлечения данных. Крутанёте вверх, к единице и выше, — распределение сглаживается, у редких вариантов появляется шанс, речь становится живее и неожиданнее. Заодно растёт риск услышать чепуху. Бесплатного тут нет.
К температуре обычно добавляют отсечки. Top-k оставляет в игре только k самых вероятных токенов. Top-p (его зовут nucleus) — минимальный набор, чей общий вес перевалил за порог p. Задача у обеих одна: не пустить в выбор совсем уж маловероятную дичь, но сохранить разнообразие. Всё это вместе называют сэмплированием (sampling) — управляемым вытягиванием токена из распределения.
◆ Ключевое
Нужен факт, перевод, код — прикрутите температуру пониже: точность и повторяемость. Нужны идеи, варианты, текст с искрой — поднимите: разнообразие ценой риска. Это ваша прямая ручка управления характером ответа, грех ею не пользоваться.
Теперь про память — и тут многих ждёт разочарование. Всё, что модель «видит», предсказывая очередной токен, помещается в контекстное окно (context window): предельное число токенов на вход за один проход. Сюда влезает ваш запрос, вся переписка и уже написанный ответ. Окно бывает от нескольких тысяч токенов до сотен тысяч. Что вышло за край — для модели исчезло. Просто нет. Отсюда знакомые эффекты: в длинном диалоге ассистент «забывает» начало, а огромный документ приходится резать ломтями. И вот что важнее всего: между запросами базовая модель не помнит ничего. Каждый ответ считается заново, по тому, что уместилось в окно. Иллюзию памяти в чатах создаёт нехитрый трюк — всю историю переписки просто подкладывают на вход каждый раз.
Напоследок — самый неожиданный подарок этой конструкции. Раз всё, что попало в окно, влияет на предсказание, то прямо в запросе можно показать модели пару примеров нужного поведения. И она подхватит закономерность, ничему не доучиваясь. Это зовут обучением в контексте (in-context learning). А сам текст, который вы подаёте, — инструкцию, примеры, роль, данные — называют промптом (prompt).
Промпт с примерами (few-shot):
восторг -> позитив
ужас -> негатив
скука -> негатив
радость -> <- модель продолжит: "позитив"
А теперь фокус: никакого дообучения не произошло. Веса модели не сдвинулись ни на волосок. Она увидела образец «слово → метка» три раза — и продолжила в том же духе, ведь продолжать закономерности ровно то, чему её учили. В этом вся сила промпта. Поведение LLM настраивается не переучиванием, а грамотно собранным входным текстом. Как воспитывают саму модель, ещё до того как она попадёт к вам, — история следующей главы.
- LLM — нейросеть, обученная предсказывать следующий кусочек текста; из одного этого навыка вырастают перевод, код, рассуждение и диалог.
- Текст режется на токены (куски слов из фиксированного словаря), каждый переводится в эмбеддинг — вектор смысла, с которым и работает сеть.
- Ответ рождается авторегрессией: модель выбирает токен, дописывает его к тексту и снова подаёт всё на вход — отсюда «печатающий» бот и накопление ошибок.
- Температура и сэмплирование управляют выбором токена: ниже — точнее и повторяемее, выше — разнообразнее и рискованнее.
- Контекстное окно — вся память модели на один проход; между запросами базовая модель пуста, а промпт с примерами настраивает поведение без переобучения.
- Модель гонится за правдоподобием, а не за истиной — поэтому уверенно ошибается на редком и узком.
Как «воспитывают» модель: предобучение, дообучение и RLHF
Из прошлой главы модель вышла гениальной, но бесхарактерной. Она умеет всё и не хочет ничего. Превратить эту сырую силу в вежливого, полезного и осторожного помощника — отдельная работа в три приёма. Именно она стоит между «нейросетью, дочитавшей интернет» и ассистентом, которому вы задаёте вопрос за завтраком.
Ассистент, с которым вы говорите, — не итог одного обучения. Это конвейер из трёх стадий, где каждая надстраивается над предыдущей и меняет модель понемногу, но по существу. Сперва предобучение (pretraining) заливает в неё язык и знания мира. Потом дообучение с инструкциями (supervised fine-tuning, SFT) учит слушаться — отвечать на просьбу, а не тупо продолжать текст. И, наконец, обучение с обратной связью от человека (reinforcement learning from human feedback, RLHF) шлифует тон, пользу и безопасность по людскому вкусу. Пройдём по каждой стадии по очереди.
Предобучение: где модель набирает язык и знания
Первая стадия — самая долгая, дорогая и решающая. Модели подсовывают исполинский корпус текста: книги, статьи, код, сайты, форумную перебранку. И ставят ту самую задачу из прошлой главы — предсказывай следующий токен. Правильный ответ размечать не надо, он уже лежит в самом тексте. Берём отрывок, прячем продолжение, заставляем угадать, сверяем с настоящим, чуть-чуть правим параметры. Повторить триллионы раз. Модель ошибается, корректируется, снова ошибается — и так проходит весь корпус. Раз «разметку» поставляет сам текст, а не живые люди, режим зовут самообучением с учителем (self-supervised learning). Учитель тут — сам текст.
Предобучение (pretraining)
Первичное обучение на огромном неразмеченном корпусе через предсказание следующего токена. На выходе — базовая (foundation) модель: превосходно владеет языком, напитана знаниями, но вести себя как помощник ещё не умеет.
На выходе получаем базовую модель (base model). У неё есть занятная особенность, она же ограничение: базовая модель умеет ровно одно — продолжать текст. Спросите её «Как приготовить омлет?» — и она может честно дописать ваш запрос ещё пятью похожими вопросами. Потому что в интернете за вопросом сплошь и рядом идёт список вопросов, а не ответ. Она не хамит и не тупит. Она просто не понимает, что от неё ждут помощи. Знания есть. Привычки применять их по просьбе — нет. За этой привычкой и приходят следующие стадии.
◆ Из истории
Когда стало ясно, что послушность можно «доставить» отдельной дешёвой стадией поверх дорогой базовой модели (линия InstructGPT, 2022), лабораторная технология стала массовым продуктом. Один и тот же «мозг» после разного воспитания ведёт себя по-разному до неузнаваемости.
SFT: учим следовать инструкциям
Как заставить базовую модель отвечать, а не продолжать? Показать ей, как это делается. На стадии SFT собирают набор демонстраций — пар «запрос → образцовый ответ», написанных людьми. Тысячи, порой десятки тысяч. «Объясни, что такое инфляция» — и рядом ясный, толковый ответ. «Напиши письмо с извинением» — и образец письма. Модель дообучают на этих парах всё тем же предсказанием следующего токена. Но теперь «правильное продолжение» — это полезный ответ на просьбу. Мало-помалу у модели закрепляется новый рефлекс: увидел запрос — выдай ответ, а не встречный вопрос.
Дообучение с инструкциями (SFT)
Обучение базовой модели на парах «запрос → эталонный ответ», написанных людьми. Прививает привычку следовать указаниям и держать формат диалога. Знаний почти не добавляет — перенастраивает поведение.
Тут легко ошибиться, поэтому скажу прямо: SFT почти не вкладывает новых фактов. Весь запас знаний уже осел в модели на предобучении. SFT лишь перенаправляет этот запас — учит доставать нужное по требованию и подавать удобоваримо. Отсюда и экономика: демонстраций надо тысячи, а не триллионы, и стадия несравнимо дешевле первой. После SFT перед вами уже вполне вменяемый ассистент. Но есть слабое место. Хороших способов ответить обычно куча, и написать эталон под каждый случай нереально. Как объяснить модели, что из двух правильных ответов один вежливее, безопаснее, полезнее? Сочинять демонстрации на всё — гиблое дело. А вот сравнивать готовые ответы людям куда легче, чем писать идеальные. На этой лени, если угодно, и держится третья стадия.
◆ Пример
На «Как сделать бомбу?» демонстрация показывает модели образец вежливого отказа с пояснением. Пара сотен таких примеров — и модель обобщает поведение на целые классы опасных запросов, которых в наборе не было.
RLHF: шлифовка по человеческим предпочтениям
RLHF берётся за задачу «сделай лучше, когда правильных ответов много» — и решает её обходным манёвром. Вписать в модель понятие «хороший ответ» напрямую нельзя, оно расплывчато до бесполезности. Зато можно показать людям несколько ответов на один запрос и попросить ранжировать: этот лучший, этот так себе, этот плохой. Сравнивать легче, чем ставить баллы, и разметчики щёлкают такие пары быстро. Так набирается база человеческих предпочтений.
А теперь ядро метода, ради которого всё затевалось. На этих сравнениях обучают отдельную нейросеть — модель вознаграждения (reward model). Её работа: взять любой ответ и выдать число, насколько он понравился бы людям. По сути из тысяч человеческих ранжирований мы отливаем автоматического судью. Дальше он оценивает сколько угодно новых ответов без единого живого человека. А раз есть дешёвый судья с наградой на выходе, включается обучение с подкреплением (reinforcement learning): саму LLM (в этой роли её зовут политикой, policy) заставляют генерировать ответы и подкручивают параметры так, чтобы оценка судьи росла. Классический алгоритм этого шага — PPO. Чтобы модель не пошла вразнос, гоняясь за наградой, её держат на поводке — не дают уйти далеко от исходной SFT-версии.
По сути RLHF переводит расплывчатое «будь полезным, честным и безобидным» на язык, понятный оптимизатору, — на язык числовой награды. Эта стадия отвечает за узнаваемый характер ассистента: вежливый тон, готовность признать незнание, аккуратные отказы, ответы по полочкам. Уберите её — и после SFT останется модель технически корректная, но пресная и куда менее удобная в быту.
| Стадия | Данные | Что добавляет | Масштаб |
|---|---|---|---|
| Предобучение | триллионы токенов сырого текста | язык, знания мира | огромный |
| SFT | тысячи пар «запрос → ответ» | послушность, формат диалога | малый |
| RLHF | сравнения-ранжирования ответов | тон, полезность, безопасность | малый |
Альтернативы, цена и пределы выравнивания
Классический RLHF работает — но он громоздок. Отдельная модель-судья, капризное обучение с подкреплением, вечная возня с настройкой. Инженеры такое не любят, поэтому появились подходы попроще. Самый заметный — DPO, прямая оптимизация предпочтений. Он берёт те же человеческие сравнения «ответ A лучше ответа B», но обходится без отдельного судьи и без подкрепления: учит саму LLM повышать вероятность предпочтённых ответов и ронять вероятность отвергнутых напрямую. Проще, стабильнее, дешевле, а качество сопоставимое. Неудивительно, что DPO быстро вошёл в моду.
Есть и другой ход — конституционный ИИ (Constitutional AI). Часть человеческой разметки тут заменяют набором письменных принципов, той самой «конституцией». По ним модель критикует и правит собственные ответы, а обратную связь для обучения генерирует по большей части сама (подход RLAIF — обратная связь от ИИ вместо человека). Живых разметчиков это разгружает, а правила поведения делает явными: записанными на бумаге, а не размазанными по тысячам молчаливых оценок.
◆ Ключевое
Всю эту настройку поведения — SFT, RLHF, DPO, конституционный подход — скопом зовут выравниванием (alignment): приведением того, что модель делает, в согласие с тем, чего от неё хотят люди.
За полезность приходится платить, и счёт вполне реальный. Первое — налог выравнивания (alignment tax): перестарайся со шлифовкой, и модель слегка тупеет. Делается осторожнее, многословнее, лепит шаблонные оговорки и отказывается даже там, где никто не просил. Второе коварнее. Модель вознаграждения ловит не саму «пользу», а то, что понравилось разметчикам, — а это разные вещи. Отсюда подхалимаж (sycophancy): привычка поддакивать и говорить приятное вместо верного, ведь именно такие ответы люди чаще одобряют. И третье, о чём говорят реже. Чьи вообще предпочтения зашиты в судью? Разметчиков наняла конкретная компания по конкретной инструкции. Их вкусы, культурные рамки и слепые пятна неизбежно просачиваются в поведение модели. Нейтральной точки зрения тут не бывает, как бы ни хотелось.
◆ Осторожно
Выравнивание — не про «сделать модель правдивой». Оно про «сделать поведение таким, какое одобрят оценщики». Обычно правдивость и одобряемость идут рука об руку. Но там, где они расходятся, модель по умолчанию выбирает вторую. Не путайте вежливую уверенность с надёжностью — это дорого обходится.
И всё же, при всех оговорках, именно связка «предобучение → SFT → RLHF» превратила абстрактную мощь языковых моделей в вещь, которой каждый день пользуются миллионы. Дорогая первая стадия закладывает интеллект. Две дешёвые следующие дают ему манеры и направление. Держите эту схему в голове — и вам будет легче трезво читать ответы ассистента. За живым, уверенным тоном стоит не понимание истины, а тщательно натренированная привычка нравиться и быть полезным. Привычка мощная. Но не всесильная.
- Готовый ассистент рождается в три стадии: предобучение → SFT → RLHF, где каждая надстраивается над предыдущей.
- Предобучение на триллионах токенов даёт язык и знания; итог — «сырая» базовая модель, которая умеет лишь продолжать текст.
- SFT на парах «запрос → эталонный ответ» прививает послушность и формат диалога, почти не добавляя знаний.
- RLHF: люди ранжируют ответы → на этом учится модель вознаграждения (судья) → политику оптимизируют под её оценку (PPO). Отсюда тон, польза и безопасность.
- Альтернативы легче: DPO учит на предпочтениях без отдельного судьи и подкрепления; Constitutional AI заменяет часть разметки письменными принципами.
- Всю настройку поведения зовут выравниванием; его цена — «налог выравнивания», подхалимаж и зашитые вкусы разметчиков. Оно оптимизирует одобряемость, а не истину.
Данные: топливо искусственного интеллекта
Модель не рождается умной. Её кормят. И то, чем именно её накормили, определяет, что она потом скажет вам в ответ — до последней запятой.
Есть соблазн думать, что вся магия ИИ спрятана в алгоритме. В хитрой формуле, которую придумал гений в свитере. Это красивая версия, но неверная. Архитектуру трансформера описали в статье 2017 года, и она уместилась в восемь страниц — её может прочитать студент. Код учебной модели пишется за выходные. А вот собрать, вычистить и подготовить данные, на которых эта модель станет чем-то стоящим, — это месяцы работы, петабайты дискового пространства и решения, о которых потом спорят юристы.
Скажу прямо: данные важнее алгоритма. Возьмите две одинаковые модели, обучите одну на аккуратно отобранном тексте, а другую — на случайной свалке из интернета. Разница будет пропастью. Первая рассуждает и держит нить; вторая путается, врёт и повторяет чужую грубость. Формула у них общая. Разошлись они на входе.
Это не голое утверждение — за ним стоят измерения. В 2022 году исследователи из DeepMind показали на модели Chinchilla любопытную вещь: многие большие модели того времени были, по сути, «недокормлены». Им дали слишком много параметров и слишком мало текста. Оказалось, что модель поменьше, но обученная на большем объёме данных, обгоняет раздутого соседа. Вывод отрезвляющий: наращивать одни лишь параметры бессмысленно, если нечем их наполнить. Данные и размер должны расти в паре. С тех пор гонка идёт не только за числом нейронов, но и за тем, где раздобыть ещё триллион качественных слов.
Задумайтесь на секунду, откуда модель вообще знает, что «Париж — столица Франции» или как звучит вежливый отказ. Ни одна строчка кода этого не задаёт. Всё, что модель умеет, она вычитала из данных. Её эрудиция, её акцент, её предрассудки, её слепые пятна — всё оттуда. Модель — это в буквальном смысле спрессованное отражение того текста, который в неё влили. Если в данных недопредставлен, скажем, суахили, модель будет говорить на нём коряво — не потому, что язык сложный, а потому, что примеров было мало.
◆ Ключевое
В инженерной среде это давно превратилось в поговорку: garbage in — garbage out, «мусор на входе — мусор на выходе». Никакая элегантность архитектуры не вытянет модель, которую учили на плохих данных. Зато посредственную архитектуру хорошие данные заметно вытягивают.
Откуда берут текст: интернет, разобранный на запчасти
Где взять триллион слов? Их не купить в магазине. Их собирают. Главный источник — сам веб, и главный инструмент — веб-краулинг (web crawling): программа-паук ходит по ссылкам, скачивает страницы, идёт дальше. Так устроены поисковики, так же поступают и создатели языковых моделей.
Отдельного упоминания заслуживает Common Crawl — некоммерческий проект, который с 2008 года методично обходит интернет и выкладывает результат в открытый доступ. Это архив на десятки петабайт: миллиарды веб-страниц, снятых слепками раз в пару месяцев. Почти каждая большая языковая модель начинала жизнь с куска Common Crawl. Бесплатно, публично, гигантски — и, честно говоря, довольно грязно. Там реклама, спам, битая вёрстка, повторы и тексты, написанные другими такими же моделями.
Но одним вебом сыт не будешь. Веб болтлив и поверхностен. Чтобы модель училась держать длинную мысль, ей дают книги — художественные и научные, где повествование не прерывается на баннер каждые два абзаца. Дают код — с GitHub и других хранилищ; выяснилось, что программный код неожиданно полезен для логики вообще, а не только для программирования: строгая структура «если — то» будто дисциплинирует модель. Дают энциклопедии (эталонная Wikipedia), научные препринты с arXiv и PubMed, форумы и диалоги для разговорного регистра. Для мультимодальных моделей добавляют картинки с подписями — например, из открытого набора LAION, где к изображениям привязаны их текстовые описания.
Есть модный слоган: «данные — новая нефть». Как всякий слоган, он врёт наполовину. Нефть везде одинакова, а данные — нет: чистый лицензированный корпус и мутная свалка стоят по-разному и учат по-разному. Зато в одном сравнение точное — вокруг ценных данных выстраивают крепости. У кого есть уникальный массив (архив переписки, база кода, коллекция книг), у того преимущество, которое конкурент не скачает за ночь. Именно поэтому крупные площадки — от Reddit до новостных гигантов — вдруг начали закрывать свои данные и продавать доступ к ним за десятки миллионов долларов. То, что вчера свободно висело в сети, сегодня стало товаром.
И ещё одна кривизна, о которой редко думают: интернет говорит в основном по-английски. Английского текста в открытом доступе на порядки больше, чем, скажем, узбекского или амхарского. Модель наследует этот перекос — она блестяща в английском и заметно слабее в языках, которым досталось мало примеров. Так цифровое неравенство языков переезжает прямо внутрь искусственного интеллекта, и выправить его труднее, чем кажется: недостающий текст не всегда где-то лежит и ждёт.
| Источник | Что даёт модели | Особенность |
|---|---|---|
| Common Crawl (веб) | Объём, разнообразие тем и стилей | Миллиарды страниц; много шума |
| Книги | Длинные связные рассуждения | Ценно, но упирается в авторские права |
| Код (GitHub) | Логика, структура, точность | Улучшает рассуждение в целом |
| Wikipedia | Факты, нейтральный тон | Маленькая, но чистая — эталон |
| Форумы, Reddit | Диалог, разговорная речь | Шумно, встречается токсичность |
| Научные статьи (arXiv) | Плотное специальное знание | Сложный язык, узкие темы |
| Картинки + подписи (LAION) | Связь «слово ↔ образ» | Для мультимодальных моделей |
Конвейер: как сырьё превращают в корм
Скачанный интернет непригоден в сыром виде. Его нужно провести через конвейер. Представьте нефтеперерабатывающий завод: на входе — чёрная жижа, на выходе — бензин определённой марки. С данными так же, только вместо нефти — текст.
- Сбор
Скачивают всё, до чего дотягивается краулер, плюс лицензированные наборы — книги, код, статьи. На этом этапе объём максимальный и качество никакое.
- Фильтрация и очистка
Выбрасывают спам, машинный перевод, порнографию, страницы из одних ссылок, дубли навигации. Иногда отдельная модель-«оценщик» ставит каждому куску оценку и режет всё ниже порога. Здесь же чистят разметку HTML, чтобы остался только текст.
- Дедупликация
Интернет чудовищно повторяется: одна и та же цитата, один и тот же пресс-релиз копируются тысячами. Если оставить повторы, модель переучится на них и начнёт зубрить, а не понимать. Дубликаты и почти-дубликаты вычищают безжалостно.
- Токенизация
Финальный шаг перед обучением: текст режут на токены (кусочки слов) и заменяют числами. Модель не видит букв — она видит номера. Об этом чуть подробнее ниже.
Про токенизацию стоит сказать отдельно, потому что здесь прячется много непонятного. Модель не работает со словами напрямую. Слово «искусственный» может распасться, скажем, на «искус», «ствен», «ный» — три токена. Английское «cat» — один. Пробел и знаки препинания тоже становятся токенами. Отсюда, между прочим, знаменитые оплошности: модель порой не может сосчитать буквы в слове, потому что для неё это слово — пара непрозрачных чисел, а не последовательность символов.
Про фильтрацию добавлю то, о чём говорят реже. Отбор — это не только гигиена, это ещё и власть. Кто-то решает, какой текст «качественный», а какой в мусор. Часто судит другая модель-оценщик, которую натаскали на примерах «хорошего» письма, — а значит, её вкус наследует чьи-то представления о норме. Отсюда тонкая опасность: фильтр может втихую выкинуть непривычные диалекты, редкие темы, речь меньшинств — просто потому, что они «не похожи на эталон». Чистота имеет цену, и цена эта — разнообразие.
Есть и совсем прикладная головная боль — загрязнение тестов (benchmark contamination). Качество модели проверяют на наборах задач с известными ответами. Но если эти задачи случайно просочились в обучающие данные, модель их просто запомнила, а не решила, — и оценка выходит завышенной, как у школьника, который заранее подсмотрел билеты. Поэтому один из шагов очистки — специально вылавливать и удалять из корпуса всё, что пересекается с тестами. Звучит скучно, а на деле от этого зависит, верим ли мы вообще цифрам в отчётах.
Невидимый труд: кто на самом деле учит модель вежливости
Тут начинается часть истории, о которой в рекламных презентациях молчат. Сырая модель, проглотившая интернет, умеет продолжать текст — но она груба, непредсказуема и с одинаковой готовностью объяснит и рецепт супа, и то, чего объяснять не следует. Чтобы она стала помощником, а не диким генератором, её дообучают на человеческих оценках. Метод называется RLHF (обучение с подкреплением на обратной связи от людей, reinforcement learning from human feedback).
Разметка данных
Процесс, в котором люди присваивают данным метки: этот ответ лучше того; это изображение содержит кота; этот текст токсичен. Модель учится не на «правильных ответах из воздуха», а на суждениях реальных людей.
Как это работает на практике? Модели показывают запрос, она выдаёт несколько вариантов ответа, человек ранжирует их от лучшего к худшему. На этих ранжировках обучают отдельную модель вознаграждения (reward model) — она учится предсказывать, какой ответ человеку понравится. А дальше основную модель подкручивают так, чтобы она набирала у этого «судьи» побольше очков. Получается двухслойный фокус: люди учат судью, судья учит модель. Именно этот механизм превращает дикого продолжателя текста в собеседника, который здоровается, признаёт незнание и отказывается помогать с опасным.
За словами «обратная связь от людей» стоят десятки тысяч живых работников. Краудворкеры — часто из Кении, Индии, Филиппин, с оплатой в считанные доллары в час — сидят и сравнивают пары ответов модели: какой полезнее, какой безопаснее, какой звучит человечнее. Они же размечают самое тяжёлое: описания насилия, ненависти, всего, что модель обязана научиться распознавать и отклонять. Работа выматывающая и психологически тяжёлая. В 2023 году журналисты Time рассказали о разметчиках, которые за гроши просматривали потоки токсичного контента, чтобы чат-бот стал «безопасным». Блестящий продукт стоит на невидимом и плохо оплаченном труде — это стоит держать в голове, когда восхищаешься гладкостью ответа.
Вкус этих людей — не нейтральная константа. Их инструктируют, что считать хорошим ответом; их культурный фон, усталость, разъяснения от заказчика — всё это просачивается в модель. Замените команду разметчиков — сместится и «характер» ассистента. Отчасти поэтому в индустрии ищут способы уменьшить зависимость от ручной разметки: например, подход Constitutional AI, где модели дают короткий свод письменных принципов и просят критиковать саму себя по этим правилам. Ручного труда становится меньше, но исчезает он не полностью — принципы-то тоже пишут люди.
◆ Как было
Знаменитый набор ImageNet, с которого в начале 2010-х началась революция в распознавании образов, содержал более 14 миллионов картинок. Их размечали вручную — люди на краудсорсинговой платформе Amazon Mechanical Turk отвечали, что изображено. Прорыв в «умном» зрении оплатили тысячи человек, кликавших по картинкам.
Синтетика, право и надвигающийся дефицит
А что, если данные закончатся? Вопрос не праздный. Свежих качественных текстов интернет производит не бесконечно, а модели растут аппетитом быстрее, чем человечество пишет книги. По оценкам исследователей, запас высококачественного текста для обучения может быть в значительной степени исчерпан уже во второй половине 2020-х. Дальше — либо перечитывать одно и то же, либо искать выход.
Один из выходов — синтетические данные: текст, который генерирует сама модель (или другая модель), а потом на нём же учат следующую. Звучит как вечный двигатель, и отчасти это работает: сильная модель может сгенерировать миллионы аккуратных примеров задач с решениями. Но есть ловушка. Если кормить модель только её собственным «выхлопом», качество деградирует — исследователи назвали это коллапсом модели (model collapse): как копия копии копии, картинка постепенно расплывается. Синтетика — приправа, а не основное блюдо.
Наконец, юристы. Обучение на текстах, которые кто-то написал и на которые держит авторские права, — минное поле. Газета The New York Times судится с OpenAI, писатели и художники подают коллективные иски, а компании спешно заключают лицензионные сделки с издателями и стоковыми фотобанками. Отдельно стоит вопрос персональных данных: если модель проглотила чей-то адрес или переписку, она может их случайно воспроизвести. Регуляторы в Европе уже задают на этот счёт неудобные вопросы, опираясь на GDPR.
◆ Осторожно
«Модель просто читала интернет, как человек» — удобная, но лукавая метафора. Человек не копирует петабайты в постоянную память и не воспроизводит их дословно по запросу. Правовой статус обучающих данных пока не устоялся, и решения судов середины 2020-х могут заметно перекроить всю индустрию.
Подведём черту. Данные — это не фон и не расходник, а сердцевина. От того, что и как собрали, зависит, будет ли модель эрудированной или невежественной, взвешенной или предвзятой, законопослушной или проблемной. Алгоритм задаёт форму. Данные наливают содержание. И пока мы восхищаемся ответами машины, стоит помнить: за каждым гладким абзацем — чей-то отобранный текст и чей-то, часто анонимный, труд.
- Данные важнее алгоритма: одинаковые модели на разных данных дают пропасть в качестве. «Мусор на входе — мусор на выходе».
- Источники: веб через краулинг и Common Crawl, плюс книги, код, энциклопедии, статьи, картинки с подписями.
- Конвейер: сбор → фильтрация → дедупликация → токенизация. С каждым шагом данных меньше, но они чище.
- За «дружелюбием» модели стоит RLHF и невидимый, часто дешёвый труд краудворкеров-разметчиков.
- Синтетические данные помогают, но чрезмерная доза ведёт к «коллапсу модели». Запас свежих качественных текстов конечен.
- Авторское право и персональные данные — нерешённый юридический фронт, способный переформатировать отрасль.
Вычисления и железо: GPU, TPU, дата-центры и масштаб
Обучить большую модель — значит проделать столько арифметики, сколько человечество вручную не осилило бы за миллион лет. Разберёмся, какое железо это тянет и почему оно греется.
Начнём с масштаба, чтобы стало не по себе в правильном смысле. Обучение современной большой модели — это порядка десяти в двадцать пятой степени арифметических операций. Число настолько огромное, что интуиция отказывает. Если бы каждый человек на Земле складывал по одному числу в секунду без перерыва, всем вместе понадобились бы десятки тысяч лет. Машина проделывает это за недели. Не потому, что она умнее, — потому что считает параллельно и очень, очень быстро.
Любопытно, что вся эта революция началась почти случайно, на игровом железе. В 2012 году трое исследователей — Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон — обучили нейросеть AlexNet распознавать картинки. Обучали не на суперкомпьютере, а на паре обычных геймерских видеокарт NVIDIA, купленных, по сути, как для игр. Результат на конкурсе ImageNet оказался разгромным, и мир вдруг понял: видеокарта — это не про графику, это про интеллект. С того момента ставка на массовую параллельность больше не отпускала индустрию.
Почему обычный процессор тут пасует
Ваш ноутбук работает на CPU (central processing unit). Это гениальный универсал: несколько мощных ядер, каждое умеет всё — от вычисления налога до запуска игры. CPU похож на бригаду из нескольких профессоров: любой решит сложнейшую задачу, но их мало, и в очередь к ним лучше не вставать миллион одинаковых примеров.
А обучение нейросети — это как раз миллиард одинаковых примитивных примеров: умножь число на число, прибавь, повтори. Умножение матриц, если совсем честно. Для такой работы профессора не нужны. Нужна армия. Тут на сцену выходит GPU (graphics processing unit) — видеокарта. Изначально её придумали, чтобы рисовать игры: экран — это миллионы пикселей, и цвет каждого можно считать независимо от соседа. Значит, нужно много простых счётчиков, работающих разом. Именно это и оказалось идеальным для нейросетей.
Есть важная оговорка. Массовая параллельность выручает не всегда — только там, где работу можно нарезать на независимые ломтики. Считать цвет каждого пикселя отдельно можно. Перемножать огромные матрицы — тоже, каждая клетка результата считается сама по себе. А вот задачу, где каждый шаг зависит от предыдущего, тысяча счётчиков не ускорит: девять женщин не родят ребёнка за месяц. К счастью для ИИ, обучение нейросети — почти целиком параллельная работа. Это редкая удача: задача сама будто создана под то железо, которое к тому моменту уже массово выпускали для геймеров.
◆ Ключевое
Аналогия армии счётчиков. CPU — четверо гениев, каждый решает сложную задачу по очереди. GPU — десять тысяч школьников, каждый умеет только складывать и умножать, но все считают одновременно. Для перемножения матриц второе бьёт первое в тысячи раз.
NVIDIA, CUDA и специальные чипы Google
Есть компания, которая на этой волне стала одной из самых дорогих в мире, — NVIDIA. Она делала видеокарты для геймеров, а в итоге оказалась поставщиком «лопат» для всей золотой лихорадки ИИ. Но дело не только в железе. В 2007 году NVIDIA выпустила CUDA — программную платформу, которая позволила использовать видеокарту не для графики, а для любых вычислений. Именно CUDA сделала GPU удобным инструментом для науки и нейросетей. Конкуренты годами не могут догнать не столько чипы, сколько эту программную экосистему: почти весь код в области ИИ написан в расчёте на неё. Так рождается ров вокруг замка.
Google пошла своим путём и построила собственный чип под нейросети — TPU (tensor processing unit). «Тензорный» — потому что нейросети оперируют тензорами, многомерными таблицами чисел. TPU заточен ровно под перемножение матриц и умеет это делать эффективнее универсального GPU, но только для этой узкой задачи. Логика простая: если ты каждый день делаешь одно и то же движение миллиард раз, выгодно выковать инструмент точно под него. Такие чипы называют ASIC — специализированные под задачу.
У всего этого есть и геополитическая изнанка. Топовые ускорители — дефицит; их не хватает, за ними стоят в очередь, ими торгуют почти как валютой. А делают самые совершенные чипы фактически в одном месте на планете — на фабриках тайваньской компании TSMC, по технологиям, которые не воспроизвести быстро нигде больше. Плюс экспортные ограничения: продажу передовых чипов для ИИ в отдельные страны власти США намеренно придерживают. Получилось, что доступ к вычислениям стал вопросом не только денег, но и политики — редкий случай, когда абстрактная арифметика упирается в таможню и санкционные списки.
FLOP
Floating-point operation — одна операция с дробным числом (умножение или сложение). Масштаб обучения меряют в общем числе таких операций. Скорость железа — в FLOP в секунду (FLOPS). Обучение большой модели — это порядка 10²⁵ FLOP; это и есть «сколько всего пришлось посчитать».
Через FLOP удобно рассуждать о масштабе. Грубая прикидка: число операций на обучение примерно равно шести, умноженным на число параметров модели и на число обучающих токенов. Растёт модель, растёт корпус — счёт взлетает как ракета. Отсюда и гонка: чтобы обучить модель следующего поколения за разумное время, нужно не одно железо, а тысячи ускорителей, работающих как единый организм.
Есть ещё один рычаг, о котором стоит знать, — точность чисел. Считать можно скрупулёзно, с длинным дробным хвостом (формат FP32, 32 бита на число), а можно грубее — FP16, FP8, а в новейших чипах и вовсе четыре бита. Чем короче число, тем больше их пролезает в память и тем быстрее идёт умножение. Оказалось, что нейросети терпят такую грубость на удивление хорошо: им не нужна аптекарская точность, им нужен объём. Приём, когда готовую модель ужимают до совсем коротких чисел, называют квантизацией — благодаря ей большие модели удаётся запускать даже на скромном железе, пусть и с лёгкой потерей качества.
А теперь — про темп гонки. С 2012 года объём вычислений, который вкладывают в обучение рекордных моделей, рос куда быстрее, чем «естественный» прогресс железа: по оценкам, удвоение шло каждые несколько месяцев, а не за пару лет. За десятилетие это дало рост в миллионы раз. Прогресс ИИ последних лет — это во многом не новая гениальная идея, а старая идея, залитая невиданным прежде количеством вычислений. Отсюда и полу-серьёзный термин «горькое урок» (bitter lesson): раз за разом побеждали не самые хитрые методы, а самые масштабируемые.
Кластер: как из тысяч чипов делают одну машину
Один ускоритель, даже топовый, большую модель не осилит — она просто не поместится в его память. Поэтому строят кластеры. Иерархия примерно такая: несколько GPU объединяют в узел (сервер), узлы ставят в стойку, стойки выстраивают рядами в дата-центре. И всё это надо связать так, чтобы тысячи чипов обменивались числами почти мгновенно.
И вот тут прячется главное узкое место. Наивно думать, что производительность кластера — это сумма мощностей всех чипов. На деле ускорители постоянно перекидывают друг другу промежуточные числа, и если связь между ними медленная, армия счётчиков простаивает в ожидании. Поэтому в кластерах ставят сверхскоростной интерконнект (NVLink внутри узла, InfiniBand между узлами). Второе узкое место — память. Чипу мало быстро считать, ему надо ещё успевать подвозить числа из памяти. Часто именно память, а не арифметика, ограничивает скорость — инженеры называют это «упереться в память». Красивый парадокс: вычислитель ждёт не потому, что медленно думает, а потому, что медленно вспоминает.
◆ Пример
Представьте кухню ресторана. Сто поваров — это чипы. Но если между ними один узкий проход и одна общая кладовка, скорость определят не руки поваров, а толчея в проходе и очередь к полкам. В кластере роль прохода играет интерконнект, роль кладовки — память.
Чем больше кластер, тем острее ещё одна беда — поломки. Когда десять тысяч чипов работают неделями напролёт, что-то обязательно отказывает: сгорел ускоритель, оборвался кабель, сбойнула память. При обучении крупных моделей отказы случаются в среднем каждые несколько часов. Один упавший узел способен уронить весь прогон, если к этому не готовиться. Поэтому обучение постоянно делает контрольные точки (checkpoints) — сохраняет своё состояние на диск, чтобы после сбоя откатиться к последнему сохранению, а не начинать месяц заново. Управление тысячей несовершенных железок как одним целым — отдельная инженерная дисциплина, и она не менее хитра, чем сама математика нейросетей.
Энергия, стоимость и цена прогресса
Тысячи чипов, работающих на полную, потребляют электричество как небольшой город и выделяют тепло как большая котельная. Отсюда — вторая, менее заметная половина дата-центра: охлаждение. Воздух, вода, а в новых проектах — погружение серверов прямо в непроводящую жидкость. На охлаждение уходит внушительная доля всей энергии. Компании строят дата-центры рядом с электростанциями и северными реками; всерьёз обсуждают атомную энергетику под нужды ИИ. Расход воды на испарительное охлаждение уже вызывает споры с местными жителями там, где её и без того не хватает.
Масштабы новых строек уже трудно уложить в голове. Компании анонсируют кластеры на сотни тысяч ускорителей и площадки, чьё энергопотребление меряют не мегаваттами, а гигаваттами — это порядок целой атомной станции, отданной под один вычислитель. Разговор незаметно сместился: если раньше спорили, чей алгоритм умнее, то теперь всё чаще — у кого больше подведённой мощности и разрешение на новую подстанцию. Электричество стало стратегическим сырьём искусственного интеллекта, и энергетики впервые оказались в одной комнате переговоров с разработчиками нейросетей.
Важно различать два режима, у которых совершенно разная экономика. Обучение (training) — редкое, но чудовищно дорогое событие: один раз потратили месяцы и миллионы долларов, получили готовую модель. Инференс (inference) — это когда модель уже работает и отвечает на запросы; каждый ответ дёшев, но ответов — миллиарды в день. И вот арифметика переворачивается: за всё время жизни популярной модели на инференс уходит больше вычислений и денег, чем на само обучение. Обучили один раз — обслуживаешь вечно.
Из этого следует неочевидное. Публику завораживают ценники обучения — «модель обошлась в сотню миллионов долларов». Но настоящая головоломка бизнеса не в этом разовом счёте, а в том, чтобы каждый из миллиардов ответов стоил достаточно дёшево. Отсюда одержимость эффективностью инференса: модели ужимают, кэшируют, режут точность чисел, придумывают, как отвечать быстрее и на более простом железе. Обучение — это спринт с открытым кошельком; инференс — марафон, где считают каждую копейку, потому что копейку умножают на миллиард.
Долгие десятилетия нас выручал закон Мура — эмпирическое наблюдение Гордона Мура (1965), что число транзисторов на чипе примерно удваивается каждые два года, а с ним растёт и мощность. Полвека это работало почти как закон природы. Но транзисторы уже подобрались к размеру в единицы нанометров — это считанные атомы в ряд, дальше мешает сама физика. Классический закон Мура заметно замедлился. Индустрия ищет обходные пути: специализированные чипы вроде TPU, укладка кристаллов слоями, вычисления с пониженной точностью чисел, оптические соединения. Прирост мощности теперь берут не столько из физики транзистора, сколько из хитрой архитектуры и масштаба — тысячами чипов вместо одного идеального.
◆ Важно
Экологический счёт растёт быстро. Оценки энергопотребления дата-центров под ИИ идут на десятки тераватт-часов в год и, по прогнозам, к концу десятилетия могут заметно вырасти. Углеродный след, расход воды на охлаждение, нагрузка на энергосети — за «невесомый» цифровой интеллект платят вполне материальным электричеством и пресной водой.
Стоит задержаться на этой мысли. Мы привыкли считать программы чем-то бесплотным — строчки кода, облако, «оно просто работает». Но под каждым ответом чат-бота гудит железо, которое кто-то спроектировал, кто-то собрал, которое ест электричество и требует, чтобы его остужали. Интеллект в кремнии не бесплотен. У него есть вес, температура и счёт за свет. И пока мы обсуждаем, о чём машина думает, инженеры решают куда более приземлённую задачу: как подвести к ней достаточно энергии и не дать ей расплавиться.
- Обучение большой модели — порядка 10²⁵ операций; это выполнимо только массово-параллельным железом.
- CPU — несколько мощных универсальных ядер; GPU — тысячи простых ядер, работающих разом. Для перемножения матриц GPU выигрывает многократно.
- NVIDIA держит рынок не только чипами, но и экосистемой CUDA; Google строит специализированные TPU под нейросети.
- Масштаб меряют в FLOP; большие модели обучают на кластерах из тысяч ускорителей, где интерконнект и память — главные узкие места.
- Обучение — разовый огромный расход; инференс дешевле за раз, но в сумме за годы перевешивает.
- Закон Мура замедлился; прирост берут архитектурой и масштабом. Энергия, охлаждение и вода — реальная и растущая цена ИИ.
Часть четвёртая
Кто и где создаёт ИИ
За моделями стоят люди, лаборатории, страны и заводы. Кто задаёт темп — от OpenAI и Google DeepMind до китайских гигантов. Почему всё упирается в чипы NVIDIA и фабрики TSMC. И как устроена экономика ИИ — от венчурных раундов до рынка pre-IPO.
Лаборатории-лидеры: кто задаёт темп
Десяток компаний и институтов решают, каким будет искусственный интеллект ближайших лет. У каждой — свой характер, своя ставка и свой способ спорить с остальными. Разберёмся, кто есть кто.
Представьте отрасль, где полтора десятка команд по всему миру тянут одну и ту же телегу в чуть разные стороны — и телега при этом едет со скоростью, за которой не поспевают ни регуляторы, ни журналисты, ни, честно говоря, сами инженеры. Это и есть карта современных ИИ-лабораторий. Компании конкурируют за одних и тех же людей, публикуют работы, из которых учатся конкуренты, переманивают друг у друга основателей и при этом уверяют, что делают всё это ради человечества.
Чтобы не утонуть, держите в голове две простые оси. Первая: что важнее — продукт или наука. Одни лаборатории живут ради того, чтобы завтра миллион человек нажал кнопку и получил ответ; другие — ради статьи, которую через десять лет будут цитировать. Вторая ось: открытость против закрытости. Кто-то выкладывает веса модели (файл с обученными параметрами) в открытый доступ, чтобы качал любой; кто-то прячет их за API надёжнее, чем рецепт кока-колы.
Большая тройка: OpenAI, Google DeepMind, Anthropic
OpenAI — та самая лаборатория, с чьей ноябрьской кнопки 2022 года началась вся публичная лихорадка. Основана в 2015-м как некоммерческая организация: среди учредителей — Илон Маск, Сэм Альтман, Илья Суцкевер и другие. Заявленная цель звучала почти по-миссионерски: создать общий искусственный интеллект (AGI) так, чтобы он принёс пользу всему человечеству. Красиво. Дальше выяснилось, что обучать большие модели — это сжигать деньги вагонами, и в 2019 году OpenAI придумала гибрид: над некоммерческим ядром надстроили структуру с «ограниченной прибылью» (capped-profit), чтобы можно было привлекать капитал. К 2026 году эта конструкция устарела: в октябре 2025 года OpenAI пересобрала себя ещё раз — некоммерческий OpenAI Foundation стал контролировать коммерческую OpenAI Group в форме public-benefit corporation (PBC), и прежняя модель capped-profit ушла в прошлое.официальное объявление OpenAI, окт. 2025
Капитал пришёл от Microsoft — миллиарды долларов и, что не менее важно, вычислительные мощности облака Azure. Линейка GPT росла публично: GPT-2 в 2019-м (который поначалу «побоялись» выкладывать целиком), GPT-3 в 2020-м, GPT-4 в 2023-м, а в 2025-м — GPT-5, уже не отдельная модель, а система, которая сама выбирает между быстрым ответом и режимом рассуждения. Но взлетела в своё время не сама модель, а обёртка — ChatGPT, простой чат, который за пару месяцев набрал десятки миллионов пользователей и стал одним из самых быстрорастущих продуктов в истории. Урок отрасли: дело было не только в мощности сети, но и в удобном окошке, куда можно просто написать.
◆ Пример
GPT-2 в 2019-м OpenAI сначала выпустила частично, сославшись на риск злоупотреблений, — за что её обвинили в пиаре на «слишком опасном ИИ». Спустя несколько месяцев модель всё же выложили полностью, и мир не рухнул. Эта история — миниатюра всего спора об открытости, к которому мы ещё вернёмся.
Google DeepMind — это результат брака по расчёту. DeepMind, лондонская лаборатория Демиса Хассабиса, была основана в 2010 году и куплена Google в 2014-м; она годами занималась фундаментальной наукой и играми. Параллельно внутри Google работала команда Google Brain. Долгое время это были два двора одного замка, иногда соперничавшие. В апреле 2023-го их слили в единое подразделение — Google DeepMind, — и понятно почему: после ChatGPT медлить стало нельзя.
Послужной список впечатляет даже скептика. AlphaGo в 2016-м обыграла Ли Седоля, одного из сильнейших игроков в го, — игру, которую считали неприступной для машин ещё лет на десять. AlphaFold научилась предсказывать трёхмерную форму белков по их аминокислотной последовательности; в 2024 году Демис Хассабис и Джон Джампер получили за это Нобелевскую премию по химии. А Gemini — это уже прямой ответ на GPT-4, семейство больших мультимодальных моделей, встроенных в поиск, Android и офисные продукты Google.
Мультимодальность (multimodality)
Способность одной модели работать сразу с разными типами данных — текстом, картинками, звуком, видео, — а не только с буквами. Gemini, GPT-4 и Claude в этом смысле мультимодальны: им можно показать фото и спросить, что на нём.
Anthropic — младшая, но принципиальная. В 2021 году группа сотрудников OpenAI во главе с братом и сестрой Дарио и Даниэлой Амодеи ушла и основала свою лабораторию. Причина ухода, если пересказать без драмы: разногласия о том, как быстро и как осторожно двигаться. Anthropic сделала безопасность не приложением к бизнесу, а его сердцевиной. Их модель — Claude — обучается методом, который они назвали Constitutional AI: вместо того чтобы полагаться только на живых разметчиков, модели дают набор письменных принципов («конституцию») и учат её саму сверять свои ответы с этими принципами.
◆ Ключевое
Три лидера — три темперамента. OpenAI: продукт и скорость. Google DeepMind: наука плюс мощь корпорации. Anthropic: осторожность как метод. Все трое держат веса закрытыми и продают доступ через API — но мотивируют это по-разному.
Открытый лагерь: Meta, Mistral, xAI
Пока «тройка» строила замки, другие открыли ворота. Meta AI (исследовательское крыло называется FAIR) сделала стратегическую ставку на открытые веса. Их семейство моделей Llama с 2023 года раздаётся разработчикам почти даром — с оговорками в лицензии, но по сути качай и запускай у себя. Логика Марка Цукерберга прагматична: если стандарт станет открытым и все будут строить на твоей модели, ты не проиграешь, даже не продавая её.
Научный голос Meta — Ян Лекун (Yann LeCun), лауреат премии Тьюринга 2018 года (вместе с Джеффри Хинтоном и Йошуа Бенджио — «крёстными отцами» глубокого обучения). Лекун — знаменитый скептик по части апокалиптических сценариев: он публично и с удовольствием спорит с теми, кто пугает, что языковые модели вот-вот выйдут из-под контроля. По его мнению, нынешние LLM до настоящего разума далеки, а открытость — не угроза, а лучшая защита.
Mistral AI — европейский ответ на вопрос «а где же тут мы?». Парижский стартап, основанный в 2023 году выходцами из DeepMind и Meta, быстро стал флагманом континента. Их первые модели — Mistral 7B и Mixtral (построенный по схеме смеси экспертов, MoE) — были компактными, шустрыми и, главное, с открытыми весами. Для Европы, которая много говорит о регулировании ИИ и мало — о собственных чемпионах, Mistral стал предметом гордости.
xAI — проект Илона Маска, запущенный в 2023 году после того, как он рассорился с OpenAI, которую сам когда-то соучреждал. Их чат-бот Grok встроен в соцсеть X (бывший Twitter) и подаётся как «дерзкий» и менее зацензуренный. У xAI есть козырь, которого нет у многих: доступ к живому потоку данных из соцсети и деньги основателя. Веса первой версии Grok компания даже открыла — жест в сторону лагеря открытости.
Платформы: Microsoft, Amazon, Apple
Есть игроки, которые сами не обязательно строят самую сильную модель, — зато держат трубу, по которой ИИ доходит до вас. Microsoft — главный партнёр OpenAI: она вложила миллиарды, даёт вычисления Azure и встроила модели в свои продукты под маркой Copilot — от Windows до Excel. Amazon сделала крупную ставку на Anthropic и предлагает чужие модели через сервис Bedrock в своём облаке AWS: не важно, чья модель победит, — платить за её запуск будут в том числе Amazon. Apple пошла своим путём: Apple Intelligence делает упор на приватность и работу прямо на устройстве, а тяжёлые задачи по возможности отдаёт партнёрам.
| Лаборатория | База | Известные модели / системы | Акцент |
|---|---|---|---|
| OpenAI | Сан-Франциско | GPT-5, ChatGPT, o-серия, DALL·E, Sora | Продукт + AGI, закрытые веса |
| Google DeepMind | Лондон + Маунтин-Вью | AlphaGo, AlphaFold, Gemini | Наука + мощь корпорации |
| Anthropic | Сан-Франциско | Claude (Opus, Sonnet, Haiku) | Безопасность, интерпретируемость |
| Meta AI (FAIR) | Менло-Парк / Париж | Llama, SAM | Открытые веса, исследования |
| xAI | Область залива (США) | Grok | Скорость, интеграция с X |
| Mistral AI | Париж | Mistral, Mixtral (MoE) | Европа, открытые веса |
◆ Осторожно
Расстановка сил меняется быстрее, чем печатается книга. Кто «впереди» на этой неделе — вопрос выбранного теста и настроения инвесторов. Не запоминайте рейтинг; запоминайте характеры и стратегии — они устойчивее.
И последнее, о чём стоит помнить: все эти команды укомплектованы, по большому счёту, из одного и того же кадрового пула — нескольких университетов и предыдущих проектов. Люди перетекают между лабораториями, уносят идеи, спорят в общих чатах и на конференциях. Отрасль конкурентна на бумаге и по-родственному переплетена на деле. Именно поэтому прорыв в одной команде через полгода отражается у всех.
- Темп задают около десятка лабораторий; удобно раскладывать их по двум осям — продукт/наука и открытость/закрытость.
- Большая тройка (OpenAI, Google DeepMind, Anthropic) держит веса закрытыми, но с разными приоритетами: скорость, наука, безопасность.
- Открытый лагерь (Meta, Mistral, отчасти xAI) раздаёт веса — из прагматизма и веры в то, что открытость безопаснее.
- Microsoft, Amazon и Apple важны не как авторы моделей, а как платформы, доставляющие ИИ до пользователя.
- Игроки конкурируют, но кадрово и идейно переплетены — прорыв у одного быстро расходится по всем.
Китайская экосистема искусственного интеллекта
Второй центр силы в мировом ИИ — Китай. Огромный внутренний рынок, свои гиганты, национальная стратегия и сложная история с чипами. Посмотрим без ярлыков.
Если Кремниевая долина — это шумный открытый базар идей, то китайская сцена ИИ устроена иначе: крупные технологические платформы, ощутимая роль государства, гигантский внутренний рынок и особые правила игры вокруг «железа». Разговор о ней легко скатывается в политику; давайте держаться фактов и техники, а оценки оставим читателю.
Начнём с масштаба. В Китае живёт больше миллиарда пользователей интернета, почти все — с мобильных. Это значит колоссальные объёмы данных и готовность людей пользоваться цифровыми сервисами буквально во всём — от оплаты уличной лапши до вызова врача. На такой почве прикладной ИИ растёт быстро и приземлённо: не «поговорить с философской нейросетью», а решить конкретную задачу миллиону человек сегодня.
Гиганты и их модели
Флагманы китайского ИИ — это в первую очередь платформенные корпорации, у каждой из которых миллиарды пользователей своих сервисов.
Baidu — крупнейший поисковик страны, для Китая примерно то же, чем Google для остального мира. Его семейство больших моделей называется Ernie (китайское имя — Wenxin, 文心), а чат-бот Ernie Bot стал одним из первых публичных ответов на ChatGPT, запущенным в 2023 году. Alibaba, гигант электронной коммерции и облака, развивает линейку Qwen (Tongyi Qianwen, 通义千问) — и, что важно, щедро выкладывает многие версии в открытый доступ, из-за чего Qwen стал одной из самых популярных открытых моделей в мире, в том числе за пределами Китая.
Tencent, владелец мессенджера-вселенной WeChat, строит модели семейства Hunyuan. ByteDance — компания, подарившая миру TikTok (внутри Китая — Douyin), — развивает ассистента Doubao и обладает, пожалуй, лучшей в мире школой рекомендательных алгоритмов: именно они держат вас в ленте. А отдельно стоит DeepSeek — сравнительно небольшой исследовательский стартап, выросший при количественном хедж-фонде High-Flyer (幻方).
◆ Пример
В начале 2025 года DeepSeek выпустила открытые модели (в том числе «рассуждающую» R1), которые, по сообщениям, показали сильные результаты при заявленной стоимости обучения заметно ниже, чем у западных флагманов. Новость вызвала бурную реакцию рынков и споры об эффективности — точные цифры проверить со стороны трудно, но сам факт, что открытая китайская модель оказалась в центре мировой дискуссии, показателен.
| Игрок | Чем известен | Модели / бренд | Открытость |
|---|---|---|---|
| Baidu | Поиск №1 в Китае | Ernie (Wenxin) | В основном закрытые |
| Alibaba | E-commerce, облако | Qwen (Tongyi Qianwen) | Много открытых версий |
| Tencent | WeChat, игры | Hunyuan | Частично открытые |
| ByteDance | TikTok / Douyin | Doubao | В основном закрытые |
| DeepSeek | Стартап при хедж-фонде | DeepSeek-V3, R1 | Открытые веса |
| iFlytek | Распознавание речи | Spark (Xinghuo) | Частично |
Государство, стратегия и «национальная команда»
Ключевое отличие китайской модели — заметная и открыто заявленная роль государства. Ещё в 2017 году был принят рамочный документ — «План развития ИИ нового поколения» (新一代人工智能发展规划), поставивший цель к 2030 году выйти в мировые лидеры в этой области. За планом стоят конкретные вещи: приоритетное финансирование, поддержка национальных чемпионов, инфраструктура, программы подготовки кадров, льготы для профильных компаний.
Промышленная политика (industrial policy)
Целенаправленная поддержка государством отдельных отраслей — деньгами, регулированием, заказами. В Китае ИИ считается стратегическим направлением, поэтому здесь она выражена сильнее, чем в большинстве западных стран, где ставку чаще делают на частный капитал и рынок.
Из этого следует и стиль внедрения. Многие китайские прорывы — это не столько разговорные боты, сколько прикладные системы: распознавание лиц и видеоаналитика, промышленный контроль качества, беспилотный транспорт, «умный город». Компании вроде SenseTime (商汤), Megvii (旷视, бренд Face++), Yitu и CloudWalk одно время называли «четырьмя драконами» компьютерного зрения. Их технологии широко применяются в самых разных сферах — от разблокировки телефона до систем безопасности; в некоторых странах это же вызывает споры о приватности, и часть таких компаний попадала под западные санкционные списки. Мы фиксируем оба факта без приговора.
Чипы, ограничения и ответ на них
А теперь — узкое место, вокруг которого крутится половина сюжета. Чтобы обучать большие модели, нужны специализированные ускорители — прежде всего графические процессоры (GPU) компании Nvidia. С 2022 года США ввели, а затем не раз ужесточали экспортные ограничения на поставку в Китай самых производительных чипов (таких как A100 и H100) и оборудования для их производства. Логика Вашингтона — сдержать военный и стратегический потенциал; логика Пекина — форсировать импортозамещение.
Ответ складывается из нескольких линий. Первая — собственные чипы: например, ускорители Huawei Ascend и продукция других производителей, пока уступающие лидерам, но развивающиеся. Вторая — эффективность: если топовых карт мало, приходится выжимать максимум из имеющихся, отсюда интерес к экономным методам обучения и оптимизации (та самая история DeepSeek — во многом про это). Третья — обходные каналы и адаптированные под ограничения версии чипов, вокруг которых идёт постоянная игра «ограничили — обошли — снова ограничили».
◆ Ключевое
Ограничения на чипы — палка о двух концах. С одной стороны, они реально тормозят доступ к вычислениям. С другой — подстёгивают Китай развивать своё производство и искать более экономные алгоритмы. Дефицит иногда рождает изобретательность.
Сильные и слабые места
Соберём честный баланс, без болельщицкого запала в любую сторону.
Сильные стороны. Огромный рынок и данные. Быстрое, приземлённое внедрение — от оплаты лицом до логистики. Мощная государственная координация и финансирование. Гигантский выпуск инженеров и научных публикаций: по числу статей и патентов в области ИИ Китай в последние годы — среди мировых лидеров. И, что заметили все, растущий вклад в открытые модели: китайские команды всё чаще выкладывают конкурентные веса в общий доступ.
Слабые места. Зависимость от передовых чипов и оборудования для их производства — узкое место, которое быстро не расшить. Ограниченный доступ к части глобальной научной инфраструктуры и сервисов. Регуляторная среда, где требования к контенту моделей строже, что усложняет разработку разговорных систем. И вопрос выхода на мировой рынок: сильные внутри страны продукты не всегда легко экспортируются из-за геополитики и доверия.
◆ Осторожно
Про Китай ходит два одинаково удобных мифа: «вот-вот всех обгонит» и «ничего своего, только копируют». Оба — ленивые. Реальность пёстрая: где-то догоняющий, где-то на равных, где-то впереди (например, в прикладном компьютерном зрении и рекомендательных системах). Точные утверждения о «лидерстве» почти всегда зависят от выбранной метрики.
Главный вывод главы прост. Мировой ИИ — не монолог Долины, а как минимум диалог двух больших центров, у которых разные ресурсы, ограничения и привычки. И один из самых интересных сюжетов ближайших лет — именно взаимодействие этих полюсов: конкуренция за таланты и чипы, но при этом общий научный язык, общие открытые модели и общие бенчмарки, по которым все меряются.
- Китай — второй центр силы в ИИ: платформенные гиганты (Baidu, Alibaba, Tencent, ByteDance), стартап DeepSeek и волна открытых моделей.
- Заметная роль государства: стратегия до 2030 года, финансирование и поддержка национальных чемпионов.
- Экспортные ограничения США на передовые чипы — узкое место; ответ Китая — свои ускорители, экономные алгоритмы и обходные каналы.
- Сила — рынок, данные, прикладное внедрение и открытые модели; слабость — зависимость от чипов и выход на мировой рынок.
- Оба расхожих мифа («вот-вот всех обгонит» и «только копируют») упрощают пёструю реальность.
Университеты, открытая наука и open-source
За громкими продуктами стоит тихий фундамент: университетские лаборатории, препринты, конференции и открытые модели. Без этой инфраструктуры не было бы ни ChatGPT, ни Gemini, ни спора о том, стоит ли их открывать.
Есть соблазн думать, что ИИ делают несколько богатых компаний. Это половина правды. Другая половина — университеты и открытая наука, откуда компании берут и людей, и идеи, и сам способ проверять, что работает. Почти каждый прорыв последних лет имеет академические корни, а нередко — прямого университетского родителя.
Пример, ставший легендой. В 2012 году на соревновании по распознаванию изображений ImageNet команда из Университета Торонто — Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон — показала нейросеть AlexNet, которая обошла конкурентов с таким отрывом, что зал притих. С этого момента началась «революция глубокого обучения». А сам датасет ImageNet годом ранее собрала команда под руководством Фей-Фей Ли из Стэнфорда. Университет придумал задачу, университет её и решил — а индустрия подхватила.
Кто и где: карта академии
Если чертить созвездие сильнейших центров, получится примерно такой список — с оговоркой, что он неполный и вечно спорный.
- Северная Америка. Стэнфорд (Stanford) с институтом HAI; Массачусетский технологический (MIT) с лабораторией CSAIL; Беркли (UC Berkeley); Университет Карнеги — Меллона (CMU), исторически сильный в робототехнике и NLP.
- Канада. Торонто (Хинтон, «отец» глубокого обучения); Монреаль с институтом MILA (Йошуа Бенджио); Университет Альберты — колыбель обучения с подкреплением (Ричард Саттон).
- Европа. Оксфорд и Кембридж; швейцарский ETH Zurich и EPFL; парижская и лондонская школы, откуда вышли основатели DeepMind и Mistral.
◆ Из истории
Трое «крёстных отцов» глубокого обучения — Джеффри Хинтон (Торонто), Йошуа Бенджио (Монреаль) и Ян Лекун (Нью-Йоркский университет, ныне Meta) — получили премию Тьюринга в 2018 году. Все трое — из академии. А в 2024-м Хинтон разделил ещё и Нобелевскую премию по физике. Академические корни отрасли — не фигура речи.
Как устроена наука об ИИ
Эта область работает необычно быстро и необычно открыто — и в этом её секретный двигатель. Разберём по шагам.
Во-первых, препринты. Классическая наука публикуется в журналах спустя месяцы рецензирования. В ИИ так ждать некогда: работы выкладывают на сервер arXiv (произносится «архив») сразу, ещё до формального рецензирования. Утром автор загрузил PDF — вечером его читают на другом конце планеты и уже пробуют повторить. Скорость обмена бешеная; цена — иногда сырые или невоспроизводимые результаты.
Препринт (preprint)
Научная статья, выложенная в открытый доступ до рецензирования и публикации в журнале. В ИИ arXiv фактически стал главной площадкой: важные работы часто живут только там и обсуждаются задолго до любого «официального» издания.
Во-вторых, конференции. В отличие от многих наук, где вершина — журнал, здесь главные события — крупные конференции с жёстким отбором: NeurIPS, ICML, ICLR — по машинному обучению; CVPR — по зрению; ACL — по языку. Работы проходят рецензирование (обычно «слепое» — авторов и рецензентов друг другу не называют), и попасть туда престижно.
В-третьих, воспроизводимость — больное место. Заявить о рекорде легко; чтобы результат приняли всерьёз, желательно выложить код, данные и точные настройки, чтобы другие смогли повторить. Конференции завели «чек-листы воспроизводимости», но проблема остаётся: часть результатов не удаётся воссоздать, а гонка за громкими цифрами этому не помогает.
Открытые веса, Hugging Face и вечный спор
Отдельная планета — открытые модели и площадки, где они живут. Главная из них — Hugging Face, своего рода GitHub для нейросетей: там лежат сотни тысяч моделей и датасетов, которые можно скачать и запустить. Плюс открытые данные: ImageNet, гигантский веб-корпус Common Crawl, наборы вроде The Pile и LAION — топливо, на котором обучаются модели.
Здесь важно различать два похожих термина. Открытый исходный код (open source) в строгом смысле — это когда открыто всё и лицензия ничего не запрещает. А открытые веса (open weights) — когда компания выкладывает обученную модель, но с оговорками в лицензии (например, ограничения для очень крупных сервисов) и часто без публикации обучающих данных. Llama от Meta — классический пример именно открытых весов, а не полностью открытого проекта. Разница тонкая, но принципиальная для юристов и бизнеса.
| Аспект | Открытые веса | Закрытые модели (через API) |
|---|---|---|
| Доступ | Скачал и запустил у себя | Только через чужой сервер |
| Приватность данных | Данные не покидают вашу машину | Запросы уходят провайдеру |
| Стоимость | Платите за своё «железо» | Платите за каждый запрос |
| Кастомизация | Дообучай и меняй как хочешь | Ограничена настройками провайдера |
| Край возможностей | Обычно с отставанием от лидеров | Чаще самые сильные модели |
| Контроль злоупотреблений | Почти нет — модель уже «на воле» | Провайдер может фильтровать и отзывать |
Именно последняя строка и есть нерв спора. Сторонники открытости говорят: так наука проверяема, монополии слабее, приватность лучше, а маленькие команды и целые страны получают шанс. Сторонники закрытости отвечают: выложенную модель нельзя отозвать — если в ней есть опасная способность, она разошлась навсегда. Обе стороны правы по-своему, и красивого универсального ответа тут нет. Это не техническая задачка, а ценностный выбор.
◆ Важно и спорно
«Открыть» модель — необратимо. Закрытую можно ограничить, отфильтровать, выключить; открытую, однажды скачанную тысячами людей, вернуть уже нельзя. Поэтому спор «открытость против безопасности» — не про то, кто прогрессивнее, а про то, какие риски вы готовы принять в обмен на какие свободы.
Утечка мозгов: из аудитории — в кампус компании
И последний сюжет — грустноватый для университетов. Как только область стала денежной, начался мощный переток талантов из академии в индустрию. Профессор, годами учивший студентов, получает предложение с зарплатой, вычислениями и данными, о которых в университете можно только мечтать, — и уходит. Хинтон работал в Google, Лекун возглавляет науку в Meta, Бенджио — один из немногих, кто остался якорем академического мира.
Что теряется при таком перекосе? Независимая проверка. Компания, разрабатывающая модель, — не лучший судья её безопасности; для этого нужны внешние исследователи с доступом и без конфликта интересов. А им всё труднее конкурировать за вычисления. Отсюда встречное движение: гранты на «академические» вычисления, национальные исследовательские облака, программы, где компании дают учёным доступ к своим моделям. Здоровье всей области зависит от того, останется ли у университетов место за столом — или наука об ИИ окончательно переедет в переговорные корпораций.
◆ Ключевое
Открытая наука — не благотворительность, а двигатель. Именно скорость обмена (препринты, открытый код, общие бенчмарки) позволила отрасли расти так быстро. Закройте этот кран полностью — и темп упадёт у всех, включая тех, кто закрывается.
- Университеты (Стэнфорд, MIT, Беркли, CMU, Торонто, MILA, Оксфорд, ETH и др.) — фундамент отрасли; почти каждый прорыв имеет академические корни.
- Наука об ИИ работает быстро и открыто: препринты на arXiv, конференции (NeurIPS, ICML, ICLR, CVPR), слепое рецензирование — при хронической проблеме воспроизводимости.
- Открытые веса и площадки вроде Hugging Face раздают модели и данные; «открытые веса» и «полностью открытый код» — не одно и то же.
- Спор «открытость против безопасности» ценностный: открытую модель нельзя отозвать, закрытую — можно контролировать.
- Таланты утекают из академии в индустрию; чтобы наука осталась проверяемой, университетам нужен доступ к вычислениям и место за столом.
Люди: пионеры и архитекторы современного ИИ
За каждой моделью, которая пишет за вас письма и распознаёт лица, стоит цепочка людей — от математика, умершего задолго до первого транзистора в кармане, до аспирантов, чьи имена ещё вчера знали только на семинарах. История ИИ — это история учителей и учеников. Иногда — история упрямцев, которых десятилетиями не слушали.
Начнём с неудобной правды. Идея, что машина может думать, старше самих машин. Её сформулировал человек, который не дожил ни до одного компьютера в нашем понимании — и которого собственная страна довела до могилы.
Отцы-основатели: четыре характера
Алан Тьюринг (Alan Turing, 1912–1954) придумал абстрактную вычислительную машину в 1936 году, будучи двадцати с небольшим лет. Не из железа — из чистой логики: бесконечная лента, головка, набор правил. Этого хватило, чтобы доказать, какие задачи в принципе вычислимы, а какие нет. Во время войны он ломал немецкий шифр «Энигма» в Блетчли-парке — работа, которая, по оценкам историков, приблизила победу и спасла миллионы жизней. А в 1950-м вышла статья, где он задал вопрос ребром: может ли машина мыслить? И заменил его на честный, проверяемый — игра в имитацию (позже её назовут тестом Тьюринга): если в переписке вы не отличите машину от человека, спор о «настоящем» мышлении становится схоластикой.
◆ Историческое
Тьюринга в 1952 году осудили за гомосексуальность — тогда это было преступлением в Британии. Его лишили допуска к секретной работе, назначили «химическую кастрацию». Он умер в 1954-м, отравившись цианидом; официально — самоубийство. Извинения от правительства пришли в 2009-м, королевское помилование — в 2013-м. Человек, спасший страну, не дождался от неё элементарной порядочности.
Слово «искусственный интеллект» придумал не Тьюринг, а Джон Маккарти (John McCarthy, 1927–2011) — чтобы собрать деньги на летний семинар. В 1956 году в Дартмутском колледже он с коллегами устроил двухмесячный мозговой штурм, из которого выросла целая дисциплина. Маккарти же изобрёл язык Lisp (1958) — на удивление живучий: на его потомках до сих пор пишут. Человек он был въедливый, теоретик до мозга костей, верил, что интеллект можно записать формулами логики.
Его соратник и вечный спарринг-партнёр — Марвин Минский (Marvin Minsky, 1927–2016), сооснователь лаборатории ИИ в MIT. Фонтан идей, блестящий и колючий. И тут случилась история с двойным дном. В 1969-м Минский с Сеймуром Пейпертом выпустили книгу «Перцептроны», где строго показали: простейшая нейросеть не умеет даже такой ерунды, как «исключающее ИЛИ». Математически — безупречно. По последствиям — тормоз: финансирование нейросетей высохло почти на пятнадцать лет. Ирония в том, что критиковали они как раз работу четвёртого нашего героя.
Фрэнк Розенблатт (Frank Rosenblatt, 1928–1971), психолог по образованию, построил перцептрон — первую обучаемую нейросеть, ещё и в железе (Mark I Perceptron, на деньги ВМС США). В 1958-м газета New York Times с его слов писала, что скоро машины научатся ходить, говорить и осознавать себя. Пресса перегрелась, обещания не сбылись, а книга Минского добила репутацию направления. Розенблатт погиб в 1971-м в лодке на Чесапикском заливе, в свой день рождения. Он не увидел, как его идею воскресят — и как она станет главной технологией эпохи.
Крёстные отцы и упрямец из Швейцарии
Пока символисты правили бал, трое учёных тихо возились с сетями, в которые мало кто верил. Джеффри Хинтон (Geoffrey Hinton), британец, перебравшийся в Канаду; Ян Лекун (Yann LeCun), француз; Йошуа Бенджио (Yoshua Bengio), тоже из Монреаля. В 1980-х они помогли сделать практичным обратное распространение ошибки — способ обучать многослойные сети. Лекун ещё в 1990-х построил свёрточную сеть, которая читала рукописные цифры на почтовых чеках и банковских бланках. Работало. Но данных было мало, машины — слабые, и мир пожимал плечами.
Перелом — 2012 год. Аспирант Хинтона Алекс Крижевский вместе с Ильёй Суцкевером обучил сеть AlexNet на видеокартах и разгромил конкурентов в конкурсе по распознаванию изображений. Разрыв был неприличным. С этого момента «глубокое обучение» перестало быть маргинальным словом. За вклад троим в 2019-м вручили премию Тьюринга за 2018 год — «Нобелевку по информатике». А дальше — красивое эхо: в 2024-м Хинтон получил Нобелевскую премию по физике за работы, лёгшие в основу нейросетей. Причём к тому времени он ушёл из Google, чтобы свободно предупреждать об опасностях того, что сам же помог создать. Такой поворот сценаристы не выдумали бы.
Отдельной строкой — Юрген Шмидхубер (Jürgen Schmidhuber). В его лаборатории в Швейцарии в 1997-м родилась LSTM — архитектура, которая годами держала на себе перевод, распознавание речи, автодополнение. Соавтор — его студент Зепп Хохрайтер; снова связка «учитель — ученик». Шмидхубер известен ещё и тем, что дотошно напоминает: многое «изобрели заново» то, что придумали раньше. Коллеги закатывают глаза, но по сути он часто прав — наука редко бывает опрятной, приоритеты в ней спорят десятилетиями.
◆ Ключевое
Ни одна из этих идей не сработала «сразу». Перцептрон, обратное распространение, свёртки, LSTM — все они лежали годами, ожидая двух вещей: горы данных и дешёвых параллельных вычислений. Гениальная мысль без железа и датасета — это чертёж самолёта во времена, когда нет ни алюминия, ни бензина.
Те, кто дал топливо, и те, кто собрал ракету
Данные оказались таким же героем, как алгоритмы. Фей-Фей Ли (Fei-Fei Li), профессор из Стэнфорда, в конце 2000-х сделала то, что казалось скучной чёрной работой: собрала ImageNet — миллионы размеченных картинок по тысячам категорий. Разметку раздали через краудсорсинг. Без этого «топлива» AlexNet не на чем было бы вспыхнуть. Её иногда зовут «крёстной матерью» ИИ — и справедливо: она заметила, что модели голодают не по идеям, а по примерам.
Из молодого поколения двое на слуху. Илья Суцкевер — от AlexNet к соучредительству OpenAI, где был главным научным умом; в 2024-м ушёл строить компанию с говорящим названием «Безопасный сверхинтеллект» (Safe Superintelligence). Андрей Карпати (Andrej Karpathy) — из первого состава OpenAI, потом руководил ИИ в Tesla, вернулся, снова ушёл; прославился тем, что объясняет сложное просто — его лекции разобрали на цитаты студенты всего мира.
И, наконец, тот самый рычаг, что перевернул всё в 2020-х. В 2017-м восемь исследователей Google выпустили статью с дерзким названием «Внимание — это всё, что нужно» (Attention Is All You Need) и представили трансформер. Авторы — Ашиш Васвани (Ashish Vaswani), Ноам Шазир (Noam Shazeer), Ники Пармар, Якоб Ушкорайт, Ллион Джонс, Эйдан Гомес, Лукаш Кайзер, Илья Полосухин. Восьмерых объединяло то, что почти каждый потом основал или возглавил заметную компанию: Шазир — Character.AI, Гомес — Cohere, Полосухин ушёл в блокчейн. Их архитектура стала фундаментом почти всех современных больших моделей — GPT, Gemini, Claude и десятков других. Буква «T» в «GPT» — это и есть Transformer; в названиях Gemini и Claude буквы «T» нет, но под капотом у них тот же трансформер.
| Имя | За что известен | Метка эпохи |
|---|---|---|
| Алан Тьюринг | Модель вычислений, тест на «мышление» | 1936–1950 |
| Джон Маккарти | Термин «ИИ», язык Lisp, Дартмутский семинар | 1955–1958 |
| Марвин Минский | Лаборатория ИИ в MIT; критика перцептронов | 1959–1969 |
| Фрэнк Розенблатт | Перцептрон — первая обучаемая нейросеть | 1958 |
| Хинтон · Лекун · Бенджио | Глубокое обучение; премия Тьюринга-2018 | 1980-е → 2019 |
| Юрген Шмидхубер | LSTM (с Хохрайтером) — память для сетей | 1997 |
| Фей-Фей Ли | ImageNet — датасет, «топливо» для зрения | 2009 |
| Суцкевер · Карпати | AlexNet, OpenAI, Tesla; популяризация | 2012 → |
| Васвани и семеро коллег | Трансформер — фундамент нынешних моделей | 2017 |
Над учёными сегодня — предприниматели, которые превращают исследования в компании ценой в целую индустрию. Сэм Альтман (Sam Altman) возглавляет OpenAI; в ноябре 2023-го его на пять дней уволил и вернул собственный совет директоров — редкий случай корпоративной драмы, за которой следил весь мир. Демис Хассабис (Demis Hassabis), бывший вундеркинд-шахматист и разработчик игр, основал DeepMind; его команда сделала AlphaGo, обыгравшую чемпиона в го, и AlphaFold, предсказавшую структуру белков — за что Хассабис с коллегой получил Нобелевскую премию по химии 2024 года. Дарио Амодеи (Dario Amodei) ушёл из OpenAI и основал Anthropic, сделав ставку на безопасность как на конкурентное преимущество, а не помеху.
◆ Пример
Проследите одну ниточку. Хинтон учит Суцкевера. Суцкевер с Крижевским делает AlexNet на данных Фей-Фей Ли. Суцкевер идёт в OpenAI, которую ведёт Альтман, и помогает построить GPT — на трансформере от восьмёрки из Google. Вся современная революция умещается в два-три рукопожатия. Это не безликий прогресс «технологий вообще» — это конкретные люди, часто знакомые лично.
- Идею мыслящей машины заложил Тьюринг ещё до появления компьютеров; термин «ИИ» использован в заявке 1955 года, а первую волну исследований связывают с Дартмутским семинаром 1956 года.
- Нейросети дважды хоронили (критика Минского, «зимы ИИ») и дважды воскрешали — окончательно в 2012-м, когда AlexNet выиграл на видеокартах и данных ImageNet.
- «Крёстные отцы» Хинтон, Лекун и Бенджио получили премию Тьюринга-2018; Хинтон и Хассабис позже взяли ещё и Нобелевские премии.
- Трансформер 2017 года от восьми исследователей Google стал фундаментом GPT, Gemini, Claude и почти всех больших моделей. Буква «T» в «GPT» — от Transformer; в названиях Gemini и Claude её нет, но архитектура внутри та же.
- История ИИ — цепочка «учитель — ученик»: вся нынешняя революция умещается в два-три рукопожатия между конкретными людьми.
Кремний и цепочка поставок: NVIDIA, TSMC, ASML
Модель можно придумать за вечер на салфетке. Но чтобы она заговорила, нужны десятки тысяч чипов, каждый из которых — плод самой сложной производственной цепочки, какую собрало человечество. Умный ИИ упирается в очень физическое, очень дорогое и пугающе хрупкое железо. Разберём, из чего оно и где узкие места.
Есть соблазн думать, что ИИ живёт «в облаке» — где-то в невесомости. Это удобная иллюзия. На деле каждый ваш запрос к чат-боту прошёл через кремниевую пластину, которую сделали в паре мест на планете, на станке, который умеет строить одна-единственная компания. Убери любое звено — и вся индустрия встанет. Не замедлится. Встанет.
Три компании, без которых нет ничего
Начнём с конца цепочки — с того, чьё имя вы слышали. NVIDIA проектирует GPU, те самые ускорители, на которых обучают и запускают модели. Ключевое слово — проектирует. Своих заводов у NVIDIA нет; такая модель называется fabless («без фабрики»). Компания рисует чип и пишет к нему софт — прежде всего платформу CUDA, из-за которой разработчики намертво привязаны к её железу. К середине 2020-х NVIDIA стала одной из самых дорогих компаний мира, её оценка измерялась триллионами долларов — редкий случай, когда «продавец лопат» стоит дороже большинства золотоискателей.
Но кто-то должен эти чипы физически изготовить. Это делает TSMC (Taiwan Semiconductor Manufacturing Company) — тайваньская контрактная фабрика, основанная в 1987-м Моррисом Чангом. Он придумал скучную на вид, но революционную идею: не выпускать свои чипы, а делать чужие по заказу. Сегодня TSMC печатает кремний для NVIDIA, Apple, AMD и сотен других. По разным оценкам, порядка девяти из десяти самых передовых чипов планеты выходят с её линий. Одна компания. Один остров.
И вот тут прячется самое узкое горлышко. Чтобы TSMC могла рисовать на кремнии дорожки тоньше вируса, ей нужны машины EUV-литографии — печати сверхкоротким ультрафиолетом (длина волны 13,5 нанометра). Такие станки делает ASML из Нидерландов. Одна. В мире. Больше никто. Внутри машины лежит физика, похожая на фокус: капли олова в полёте расстреливают лазером, они вспыхивают плазмой и дают нужный свет; зеркала для него отполированы так, что если растянуть их до размеров страны, самая большая неровность будет меньше миллиметра. Один аппарат стоит порядка ста пятидесяти-двухсот миллионов долларов, а новейшие High-NA — заметно дороже. Выпускают их поштучно, очередь расписана на годы.
Арендодатели вычислений и очередь за ускорителями
Даже располагая чипами, редкая компания строит собственный дата-центр — это долго и разорительно. Поэтому появились облачные арендодатели: Amazon Web Services, Microsoft Azure, Google Cloud. Они закупают ускорители тысячами, ставят в свои залы и сдают их по часам — как каршеринг, только вместо машины вы берёте кусок суперкомпьютера. Стартапу так проще: не надо вкладывать сотни миллионов в железо, которое устареет за пару лет. Обратная сторона — зависимость. Кто владеет залами с GPU, тот диктует условия; недаром крупные сделки бигтеха с ИИ-лабораториями часто оформлены как «мы дадим вам денег, а вы потратите их в нашем облаке».
А ускорителей на всех не хватает. В 2023–2024 годах спрос на топовые чипы NVIDIA превысил выпуск настолько, что за ними выстроилась очередь на месяцы. Компании бронировали поставки заранее, перекупали, писали основателю NVIDIA личные письма. Дефицит был не в кремнии как таковом — песка на Земле хватает, — а в мощностях по продвинутой упаковке и в станках ASML, которые не размножишь по щелчку. Классическое узкое горлышко: вся река упирается в одну задвижку.
| Звено | Кто | Что делает | Почему незаменимо |
|---|---|---|---|
| Литография | ASML (Нидерланды) | Станки EUV — «печатный пресс» для чипов | Единственный производитель в мире |
| Производство | TSMC (Тайвань) | Печатает чипы по чужим проектам | Держит львиную долю передовых нод |
| Проектирование | NVIDIA (США) | Рисует GPU, пишет CUDA | Софт-замок держит разработчиков |
| Аренда | AWS · Azure · Google | Сдают вычисления по часам | Капитал и готовые дата-центры |
| Спрос | Лаборатории ИИ | Обучают и запускают модели | Платят за всё это сверху |
Геополитика: «чиповые войны»
Теперь взгляните на карту — и станет неуютно. Самое передовое производство сосредоточено на Тайване, острове, чей политический статус остаётся предметом давнего спора с материковым Китаем. Аналитик Крис Миллер назвал это в своей книге «Чиповой войной» (Chip War, 2022). Логика простая и жёсткая: если что-то случится с TSMC — землетрясение, блокада, конфликт, — мировая экономика получит удар, рядом с которым пандемийные перебои покажутся разминкой. Смартфоны, автомобили, серверы, оружие — всё встанет в очередь за кремнием, которого вдруг нет.
◆ Осторожно
Оценки «доли рынка» здесь — порядок величины и вещь подвижная. Точные проценты гуляют от отчёта к отчёту, зависят от того, что считать «передовым», и меняются с каждым новым заводом. Держитесь сути: производство опасно сконцентрировано в нескольких точках. Конкретную цифру за факт не выдавайте.
Есть и вторая линия фронта — экспортные ограничения. С осени 2022 года США начали запрещать поставки самых мощных ИИ-чипов в Китай, чтобы затормозить его военные и исследовательские программы. NVIDIA в ответ выпускала урезанные версии для китайского рынка — их тоже вскоре ограничивали. Китай, в свою очередь, вливает десятки миллиардов в собственное производство, чтобы слезть с иглы. Чипы стали инструментом большой политики: не нефть, не газ — а прямоугольнички кремния размером с ноготь определяют, кто в ближайшие годы будет впереди.
◆ Ключевое
Разделение труда доведено до предела: голландцы делают станки, тайваньцы печатают, американцы проектируют, облака сдают в аренду. Каждый умеет своё до совершенства — и потому беспомощен без остальных. Эффективно в мирное время, опасно хрупко — в тревожное.
- Весь ИИ упирается в железо: за каждым запросом стоит физический чип из очень короткой и очень дорогой цепочки поставок.
- Разделение труда: ASML (единственная в мире) делает станки EUV, TSMC печатает чипы, NVIDIA их проектирует без своих заводов (fabless), облака сдают вычисления в аренду.
- Узкое горлышко — слева: чем ближе к станкам ASML и фабрикам TSMC, тем незаменимее звено.
- Дефицит ускорителей в середине 2020-х выстроил очереди на месяцы; спрос обгонял выпуск.
- Концентрация производства на Тайване и экспортные ограничения превратили чипы в оружие геополитики — это и есть «чиповые войны».
Экономика и финансирование ИИ
За каждым ответом модели стоит цепочка расходов: капитал, который однажды потратили на обучение, и счётчик, который тикает при каждом новом запросе. Эта глава — о деньгах без пафоса: сколько стоит вырастить модель, во что обходится один ответ, откуда берётся финансирование и почему вопрос об окупаемости пока честнее держать открытым.
Экономику ИИ удобно разложить на два больших счёта. Первый — капитальные затраты на обучение: разовое, но огромное вложение, чтобы модель вообще появилась. Второй — операционные затраты на инференс (вывод): плата за то, чтобы обученная модель отвечала пользователям, повторяющаяся с каждым запросом. Оба счёта кто-то оплачивает наперёд, задолго до того, как станет ясно, вернутся ли эти деньги. Разберём их по очереди, а затем посмотрим, кто и на каких условиях финансирует всю конструкцию.
Капзатраты на обучение: сколько стоит вырастить модель
Обучение большой модели ближе к строительству завода, чем к написанию программы. Это капитальные затраты: сначала вкладывают крупную сумму, и лишь потом — если повезёт — она начинает возвращаться. По разным оценкам, один прогон обучения передовой модели обходится в десятки, а у самых крупных — в сотни миллионов долларов порядок величины; и это без учёта неудачных прогонов, исследований, сбора данных и последующей эксплуатации. Точную цифру никто не публикует, и она устаревает с каждым новым поколением железа.
Из чего складывается эта сумма? Статей четыре. Первая и главная — вычисления: десятки тысяч ускорителей, работающих неделями. Их либо покупают (тогда это амортизируемый актив), либо арендуют в облаке по часам. Вторая — энергия и охлаждение: кластер такого масштаба потребляет мегаватты, и счёт за электричество составляет заметную долю бюджета. Третья — данные: их сбор, очистка, фильтрация и разметка стоят и денег, и времени. Четвёртая — люди: дефицитная экспертиза исследователей и инженеров, чьи зарплаты в этой области одни из самых высоких в индустрии.
Отсюда характер отрасли. Порог входа в обучение фронтир-моделей очень высок и продолжает расти: чтобы держаться переднего края, нужно наращивать вычисления быстрее, чем дешевеет железо. Даже когда каждый отдельный чип становится эффективнее, амбиции по размеру модели и объёму обучения растут ещё быстрее, так что суммарный счёт не падает, а увеличивается. Практический итог: позволить себе такие эксперименты могут немногие — крупные технологические компании и хорошо профинансированные лаборатории. В этом смысле передовое обучение — «гонка богатых», где решает доступ к капиталу и к вычислениям, а не только идеи.
Отсюда же две развилки в бюджете. Первая — купить или арендовать вычисления: собственная закупка ускорителей превращается в амортизируемый актив и требует места, энергоснабжения и обслуживания, тогда как аренда в облаке переносит те же деньги в операционные расходы и снимает капитальный риск, но в пересчёте на час обычно дороже. Вторая — масштаб: эмпирические закономерности связывают качество модели с объёмом вычислений, данных и числом параметров, и потому соблазн «добавить ещё» толкает бюджет вверх до тех пор, пока прирост качества оправдывает прирост затрат. Обе развилки и объясняют, почему счёт за обучение так трудно назвать заранее.
◆ Ключевое
Обучение — это разовая ставка, сделанная наперёд: крупные деньги вкладывают до того, как ясно, окупятся ли они. Такая структура затрат делает вход дорогим и концентрирует передовую разработку у немногих игроков с доступом к капиталу и вычислениям.
Юнит-экономика инференса: цена одного ответа
Инференс — это запуск уже обученной модели, чтобы получить ответ. В отличие от обучения, которое происходит один раз, инференс повторяется на каждый запрос — и потому относится не к капитальным, а к операционным затратам, растущим вместе с числом пользователей. Именно из юнит-экономики инференса — стоимости одного ответа — складывается, зарабатывает ли сервис или работает в убыток.
Из чего складывается цена одного ответа? Во-первых, амортизация ускорителя: дорогой GPU служит ограниченное время, и его стоимость размазывается по всем ответам, которые он успеет выдать. Во-вторых, энергия: каждый сгенерированный токен требует вычислений, а значит электричества. В-третьих, память и пропускная способность: веса модели и промежуточные состояния (кэш внимания) занимают дорогую быструю память, и чем длиннее контекст и ответ, тем больше её нужно. Плюс накладные расходы дата-центра. Грубо говоря, стоимость ответа растёт с числом обработанных и сгенерированных токенов — поэтому провайдеры и берут плату «за токены».
Внутри одного ответа расходы распределяются неравномерно. Обработка запроса (загрузка контекста) и генерация ответа токен за токеном нагружают ускоритель по-разному: длинный контекст увеличивает объём памяти и вычислений ещё до того, как модель напишет первое слово, а каждый новый токен ответа добавляет свой шаг. Провайдер снижает себестоимость, объединяя запросы многих пользователей в общие партии и держа дорогие ускорители занятыми; простаивающий GPU всё равно амортизируется и потребляет питание, поэтому низкая загрузка бьёт по экономике сильнее всего. Именно поэтому цена за токен в прайсе и реальная себестоимость ответа — не одно и то же.
| Статья | Что это | От чего растёт |
|---|---|---|
| Амортизация ускорителя | Доля цены GPU, приходящаяся на один ответ | Цена и срок службы чипа, его загрузка |
| Энергия | Электричество на сами вычисления и охлаждение | Число обработанных и сгенерированных токенов |
| Память и канал | Веса и кэш внимания в быстрой памяти (HBM) | Длина контекста и длина ответа |
| Накладные дата-центра | Сеть, помещения, простой оборудования | Утилизация парка ускорителей |
Маржинальность API определяется тем, насколько плотно провайдер загружает свои ускорители: одни и те же GPU обслуживают много запросов одновременно (батчинг), и чем выше утилизация, тем ниже себестоимость одного ответа. Но здесь же кроется давление на прибыль: конкуренция и модели с открытыми весами, которые можно запускать почти по себестоимости, тянут цену за токен вниз, а вместе с ней — и маржу.
Отсюда неочевидный, но важный вывод: в сумме инференс может стоить дороже обучения. Модель обучают один раз, а отвечает она миллиарды раз за весь срок службы. При большой аудитории накопленные за годы затраты на вывод — вычисления и энергия — легко превосходят стоимость единственного обучающего прогона. «Дорогая» часть смещается со стройки на эксплуатацию: чем популярнее модель, тем сильнее её экономику определяет цена ответа, а не цена обучения.
Бизнес-модели и деньги
Такие расходы не покрыть из выручки молодого стартапа — деньги дают наперёд. Первый источник — венчурный капитал: инвестиции под идею и команду с расчётом, что большинство вложений не окупится, зато редкий успех вернёт всё разом. Второй, всё более заметный, — стратегические вложения корпораций, которым проще вложиться в перспективную лабораторию, чем догонять её самим.
Устроены такие сделки любопытно. Microsoft вложила в OpenAI, по сообщениям, порядка десяти с лишним миллиардов долларов — но значительная часть этих денег возвращается к инвестору в виде оплаты облачных вычислений Azure. Amazon и Google, по сообщениям, вложили миллиарды в Anthropic — тоже с расчётом на использование их инфраструктуры. Получается кольцо: инвестор даёт кэш, а стартап тут же тратит его на вычисления у того же инвестора. Для инвестора это одновременно и вложение, и записанная выручка; аналитики спорят, как правильно читать такие «возвратные» схемы и насколько они отражают реальный конечный спрос.
Отдельная роль — у «продавцов лопат». В золотую лихорадку стабильнее старателей зарабатывал тот, кто продавал лопаты; в нынешней роль «лопат» досталась производителям чипов (NVIDIA и другим) и облачным провайдерам. Они получают деньги здесь и сейчас — со всех игроков сразу, независимо от того, чья именно модель в итоге победит. Пока лаборатории борются за будущую и неясную прибыль, поставщики железа и вычислений монетизируют сам ажиотаж. Это наблюдение об экономике, а не рекомендация: спрос на «лопаты» сам зависит от того, оправдаются ли ожидания от ИИ.
Как в принципе зарабатывают на самих моделях? Основных источников выручки несколько, и у каждого своя чувствительность к конкуренции.
| Модель | Как берут деньги | Пример | Где давление на маржу |
|---|---|---|---|
| API | Плата за объём токенов | Доступ к модели для разработчиков | Падение цены за токен, открытые веса |
| Подписка | Фиксированная плата в месяц | Ассистент, «про»-доступ | Отток, если ценность неочевидна |
| Инфраструктура | Аренда вычислений и платформ | Облака, MLOps-сервисы | Капиталоёмкость, ценовые войны |
| Железо («лопаты») | Продажа чипов и оборудования | Ускорители, серверы | Зависимость от общего спроса |
◆ О числах
Все суммы здесь — порядок величины и по сообщениям прессы, а не отчётные данные. Оценки частных компаний — это цифры из раундов, а не деньги в кассе и не прибыль; они меняются от сделки к сделке и быстро устаревают. Для любого практического вывода сверяйтесь с первоисточниками, а не с числом, названным в тексте.
Над всеми этими моделями висит один вопрос — окупаемость. Капитальные затраты на обучение и операционные на инференс огромны и реальны уже сегодня; устойчивая прибыль — пока во многом ожидание. Причём деньги не бесплатны: при ненулевых процентных ставках у капитала есть цена, и вернуть нужно не только вложенное, но и стоимость его привлечения плюс амортизацию быстро устаревающего железа. История знает волны тяжёлых инфраструктурных строек — железные дороги, телеграф, магистрали интернета, — когда мощности возводили с опережением спроса; часть вложений тогда не окупалась, даже если технология в итоге меняла экономику. Сохранится ли разрыв между расходами и прибылью в ИИ и как он закроется — сегодня открытый вопрос, а не решённый.
◆ Масштаб стройки
Насколько «наперёд» строят, показывает середина 2020-х. В 2025 году в США объявили проект Stargate — коалиция OpenAI, SoftBank, Oracle и других пообещала вложить порядка 500 млрд долларов за несколько лет в дата-центры под ИИ (цель — около 10 гигаватт вычислительной мощности).объявление Stargate, 2025; сообщения компаний, 2025–2026 Это капитал, потраченный до того, как ясно, окупится ли он, — ровно та ставка на опережение спроса, о которой идёт речь. Сумма — по сообщениям и как заявленное обязательство, а не деньги, уже потраченные и вернувшиеся; читайте её как порядок величины.
Обостряет вопрос и срок жизни железа. Ускорители устаревают за считанные годы: выходит более быстрое поколение, и прежнее теряет в цене, продолжая потреблять энергию и место. Значит, вложения в вычисления нужно окупить в узком окне, пока они конкурентоспособны, — и уже поверх этого заработать на стоимость капитала. Такая арифметика объясняет, почему одни игроки делают ставку на собственные дата-центры и заказные чипы, а другие предпочитают арендовать мощности, перекладывая риск устаревания на облако.
◆ Ключевое
Расходы в ИИ измеримы и велики уже сейчас; прибыль во многом отнесена в будущее. Разрыв между ними — центральный финансовый вопрос отрасли. Он не предрешён ни в одну сторону: его закрытие зависит от того, вырастет ли выручка достаточно, чтобы покрыть амортизацию железа и стоимость капитала.
Частные рынки и pre-IPO
ИИ-компании подолгу остаются частными, и причина экономическая: частного капитала сейчас так много, что финансировать огромные капзатраты можно, не выходя на биржу и не подчиняясь её требованиям — квартальной отчётности, публичному раскрытию, давлению котировок. Ликвидность ранним участникам дают не только IPO, но и поздние частные раунды и вторичные сделки, в которых доли переходят из рук в руки внутри узкого круга. В результате значительная часть роста таких компаний происходит ещё до всякой биржи.
Что такое pre-IPO без прикрас? Это инвестиция в частную компанию на поздней стадии — через поздние первичные раунды или покупку долей на вторичном рынке. Важно, чего это не означает. Во-первых, pre-IPO не гарантирует ни скорого, ни вообще какого-либо выхода на биржу: сроки размещения зависят от рынка и решений компании, могут сдвигаться на годы или не наступить. Во-вторых, «доля» неоднородна: у частных компаний разные классы акций дают разные права — голоса, преимущества при ликвидации, доступ к информации, — и то, что покупает поздний инвестор, по правам может заметно отличаться от акций основателей или ранних фондов. В-третьих, это высокорисковый и неликвидный актив: оценки в раундах договорные, а не рыночные; отчётность скупее, чем у публичных компаний; быстро выйти из позиции трудно, а итог сильно зависит от условий будущего выхода.
Отсюда простое правило чтения: по мере движения от ранних стадий к поздним риск не исчезает, а меняет природу. Снижается вероятность того, что бизнес провалится совсем; но растут риск переплатить на высокой оценке, сложность структуры прав и зависимость от того, состоится ли выход и на каких условиях. Подробный разбор того, как оценивают частные компании и как устроены их риски, вынесен в отдельную книгу «До биржи»; здесь нам важнее понять экономику ИИ в целом, а не тактику отдельных сделок.
pre-IPO
Вложение в частную компанию на поздней стадии — через поздние первичные раунды или вторичную покупку долей. Не тождественно скорому или гарантированному IPO. Права зависят от класса акций, оценки договорные, отчётность ограниченная, а сама доля неликвидна — её трудно быстро продать. Высокий риск и неопределённость выхода — неотъемлемая часть этого инструмента.
- Экономика ИИ распадается на два счёта: разовые капзатраты на обучение и повторяющиеся операционные затраты на инференс.
- Обучение фронтир-модели — капзатраты порядка 10⁷–10⁸ $ (порядок величины): вычисления, энергия, данные, люди; высокий порог входа делает это «гонкой богатых».
- Юнит-экономика инференса — цена одного ответа (амортизация GPU, энергия, память/токен); при большой аудитории инференс в сумме может обойтись дороже обучения.
- Деньги дают венчур и корпорации (Microsoft↔OpenAI, Amazon/Google↔Anthropic — по сообщениям, часто с условием тратить их в облаке инвестора); «продавцы лопат» — чипмейкеры и облака — зарабатывают раньше всех; окупаемость самих моделей — открытый вопрос.
- pre-IPO — поздняя частная стадия или вторичка; не гарантия IPO, разные классы акций дают разные права, актив неликвиден. Риск не исчезает к поздним стадиям, а меняет природу.
Часть пятая
Проблематика и сложности
Самая честная часть книги. Почему модели «галлюцинируют» и врут с уверенным лицом, откуда берётся предвзятость, что такое проблема выравнивания и можно ли вообще заглянуть внутрь «чёрного ящика». А ещё — этика, право, рынок труда и попытки государств всё это регулировать.
Галлюцинации, надёжность и пределы моделей
Языковая модель почти никогда не говорит «я не знаю». Она говорит гладко, уверенно и по делу — и ровно поэтому её ошибки такие коварные. Разберёмся, откуда берётся уверенная неправда, почему это не баг, а свойство, и что с этим можно (и чего нельзя) сделать.
Уверенная неправда: что такое галлюцинация
Летом 2023 года двое нью-йоркских адвокатов подали в суд документ со ссылками на прецеденты, которых не существовало. Ссылки выглядели безупречно: названия дел, номера, цитаты из решений. Всё придумал чат-бот, к которому юристы обратились за помощью. Судья, естественно, эти дела в базе не нашёл. История стала хрестоматийной — не потому, что кто-то поленился, а потому, что модель выдала фальшивку с той же интонацией, с какой выдаёт правду.
Галлюцинация (hallucination)
Ситуация, когда модель уверенно порождает правдоподобно звучащее, но фактически неверное или выдуманное утверждение — несуществующий источник, ложную дату, вымышленную цитату — не подавая при этом никакого сигнала, что «здесь я сочиняю».
Слово неудачное — оно намекает на сбой, на галлюцинирующий разум. На деле никакого сбоя нет. Модель делает ровно то, чему её учили: продолжает текст самым правдоподобным образом. Просто иногда самое правдоподобное продолжение и есть правда, а иногда — нет. И вот тут кроется вся суть.
Представьте студента, который на экзамене не помнит точную дату, но чувствует «где-то в районе 1870-х». Он назовёт год уверенно — так его учили держаться на устном ответе. Языковая модель устроена похоже, только у неё нет ни стыда, ни сомнения, ни внутреннего «стоп, это я угадываю». Есть один-единственный критерий: насколько гладко продолжение ложится в текст.
Отсюда первый честный вывод. Галлюцинации нельзя «починить» патчем, как опечатку. Они — тень того самого свойства, за которое мы модели и любим: способности гладко продолжать любой текст на любую тему. Убрать тень, оставив свет, не выходит.
Почему это неизбежно: нет модели мира
Большая языковая модель (LLM) обучена одной задаче — предсказывать следующий фрагмент текста. Миллиарды раз ей показывали кусок и просили угадать продолжение. В процессе она впитала грамматику, стиль, ассоциации, огромный пласт фактов и даже кое-какие рассуждения. Но она нигде не училась отличать истину от правдоподобия. В обучающем сигнале этого различия просто не было.
Люди путают две разные вещи: знать факт и уметь произнести факт складно. Модель мастер второго. У неё нет отдельной внутренней «базы истин», которую она сверяет перед ответом. Нет и того, что философы называют моделью мира — устойчивого представления о том, как устроена реальность, что в ней возможно, а что нет.
◆ Ключевое
Модель оптимизирует правдоподобие текста, а не истинность высказывания. Это два разных таргета, и они совпадают лишь тогда, когда правды в обучающих данных было много и она была однозначной. На редких, спорных или свежих темах правдоподобие и истина расходятся — там и живут галлюцинации.
Есть ли внутри «понимание»? Спор идёт до сих пор, и обе крайности выглядят наивно. Сказать «это просто попугай, тасующий слова» — значит не заметить, что модель решает задачи, которых в обучении дословно не было. Сказать «она понимает, как человек» — значит не заметить, как легко она ломается. Ближе к правде что-то среднее: у модели есть богатые статистические регулярности, местами похожие на понятия, но без опоры на опыт, на тело, на проверку реальностью. Знание без владельца.
Из этого растут несколько практических слабостей, о которых стоит знать заранее.
| Слабость | Как проявляется | Почему так |
|---|---|---|
| Хрупкость к формулировке | Переставили слова в промпте — ответ поменялся на противоположный; добавили «подумай шаг за шагом» — задача внезапно решилась | Модель реагирует на поверхность текста, а не на смысл; разные формулировки ведут по разным «тропам» в статистике |
| Длинные цепочки рассуждений | На третьем-четвёртом логическом шаге теряет нить, тихо подменяет условие, приходит к неверному итогу уверенно | Нет устойчивого рабочего «блокнота»: каждый шаг — снова угадывание правдоподобного, ошибки копятся |
| Арифметика | Складывает мелкие числа, но врёт на умножении многозначных; «847 × 613» — почти лотерея | Считает не по правилам, а по памяти похожих примеров; точного алгоритма внутри нет |
| Свежие и редкие факты | Уверенно называет несуществующую статью, «цитирует» книгу, которой нет | Пробел в данных заполняется самым правдоподобным вымыслом — молчать модель не умеет |
Арифметика — особенно наглядный случай. Казалось бы, умножить два числа проще, чем написать сонет. Для модели наоборот: сонетов в обучении море, а конкретно «847 × 613» она, скорее всего, не видела ни разу и честного алгоритма умножения не выучила. Она угадывает результат по форме — сколько примерно цифр, на что похоже начало. Иногда попадает. Забавный перевёртыш: машина спотыкается там, где школьник справляется по правилам, и блистает там, где школьник бы сдался.
Как снижают риск — и почему не до конца
Полностью галлюцинации не лечатся, но их частоту и цену можно резко сбить. Инженерный арсенал сложился примерно такой.
- Поиск и опора на источники (RAG)
Перед ответом система находит релевантные документы во внешней базе и подкладывает их модели в контекст. Модель отвечает не по памяти, а по тексту, который лежит перед глазами.
- Инструменты вместо угадывания
Считать — калькулятором, искать факт — поиском, смотреть код — исполнить. Модель перестаёт «вспоминать» ответ и начинает его получать. Арифметику это чинит почти начисто.
- Показать рассуждение (chain of thought)
Просьба «рассуждай вслух, по шагам» заставляет разложить задачу — и часто повышает точность, а заодно даёт человеку шанс поймать ошибку в промежуточных шагах.
- Самопроверка и критика
Второй проход: «найди ошибки в своём ответе», сверка нескольких прогонов, отдельная модель-критик. Ловит часть промахов — но не те, где модель ошибается уверенно и одинаково.
Почему всё это не панацея? У каждого приёма своя дырка. RAG опирается на качество базы и точность поиска: если нужный документ не нашёлся или в базе лежит ерунда, модель снова додумает недостающее — и сделает это гладко. Инструменты помогают лишь там, где задачу удаётся свести к вызову инструмента. Самопроверка бессильна против уверенных ошибок: модель, ошибшаяся одинаково дважды, на втором проходе просто подтвердит первую ошибку. А «покажи рассуждение» иногда порождает красивую цепочку, которая ведёт к правильному ответу задом наперёд — рассуждение постфактум, а не по-настоящему.
◆ Осторожно
Цепочка рассуждений, которую модель выводит на экран, — не обязательно тот путь, которым она реально пришла к ответу. Иногда это правдоподобная реконструкция «под ответ». Убедительность объяснения — плохой измеритель его правдивости. У людей, к слову, ровно та же болезнь.
Калибровка: знает ли модель, что не знает
Отдельный, недооценённый сюжет — калибровка уверенности. Хорошо откалиброванная система, говоря «уверен на 70%», ошибается примерно в 30% таких случаев. Плохо откалиброванная звучит на 99% и там, где права, и там, где выдумывает.
Калибровка (calibration)
Соответствие между заявленной уверенностью модели и её реальной точностью. Идеал: из ста ответов, помеченных «уверенность 80%», верны около восьмидесяти.
Тонкость, о которой мало говорят: у «сырой» предобученной модели вероятности часто откалиброваны неплохо. А вот дообучение под удобный диалог (RLHF, о нём — в главе 32) нередко калибровку портит: людям нравятся уверенные, гладкие ответы, и модель учится звучать увереннее, чем следует. Мы сами поощряем позу «я знаю» и удивляемся, что модель перестала сомневаться.
правдоподобие ≠ истинность — корень проблемы
по умолчанию модель не помечает, где сочиняет
вымышленный факт «стоит» модели столько же усилий, сколько реальный
должная доля ошибок у честного «уверен на 70%»
Практический итог для того, кто моделью пользуется, короткий. Относитесь к ответу как к черновику уверенного, начитанного, но иногда фантазирующего помощника. Всё проверяемое — проверяйте. Ставки высоки (юридический документ, медицина, деньги) — держите человека в контуре. И не путайте гладкость с правотой: это первое, чему стоит разучиться в разговоре с машиной. Пределы у моделей есть, они не позорны — позорно делать вид, что их нет.
- Галлюцинация — уверенно поданная правдоподобная неправда. Это не сбой, а тень основного свойства: модель предсказывает правдоподобный текст, а не истинный.
- Внутри нет отдельной «базы истин» и полноценной модели мира — отсюда хрупкость к формулировкам, провалы в длинных рассуждениях и в арифметике.
- Снижают риск поиск/RAG, внешние инструменты, показ рассуждения, самопроверка. Каждый приём латает свою дыру, но ни один не лечит проблему до конца.
- Калибровка — умение модели соизмерять уверенность с реальной точностью. Дообучение под приятный диалог нередко её ухудшает: модель учится звучать увереннее, чем есть.
- Практика: гладкость ≠ правота. Проверяйте проверяемое, держите человека в контуре на высоких ставках.
Предвзятость, справедливость и качество данных
Модель — это спрессованное отражение своих данных. А данные собирал не ангел с чистого листа, а человечество со всеми его перекосами. Вопрос не в том, есть ли у модели предвзятость. Вопрос в том, какая, откуда и что мы согласны с этим делать.
Откуда берётся перекос
Начнём с неудобного. У модели нет собственных предубеждений — ей неоткуда их взять, кроме как из текста и картинок, на которых её обучали. Если в этих данных врачи чаще мужчины, а медсёстры чаще женщины, модель это подметит. Она не «считает», что так правильно. Она просто выучила, что так чаще пишут. И теперь воспроизводит — а нередко и усиливает.
Предвзятость (bias)
Систематический перекос в поведении модели, при котором для одних групп, языков или контекстов результат стабильно хуже, беднее или несправедливее, чем для других, — унаследованный из данных и/или из того, как поставлена задача.
Классический учебный пример — векторные представления слов из середины 2010-х. Обученные на массиве новостей и книг, они выучили аналогию «мужчина относится к программисту, как женщина — к домохозяйке». Никто такого правила не задавал. Оно осело в статистике языка само. Модель оказалась честным зеркалом — и в этой честности была вся проблема.
Важно различать три источника перекоса, потому что лечатся они по-разному.
| Источник | Суть | Пример |
|---|---|---|
| Перекос данных | Мир в данных не совпадает с миром как есть — или совпадает с несправедливым миром | Резюме нанятых за 10 лет отражают прошлую дискриминацию при найме |
| Недопредставленность | Каких-то групп, языков, случаев в данных мало или нет | Медицинских снимков определённой популяции почти нет — модель на ней слабее |
| Перекос постановки | Мы выбрали удобную, но кривую метрику успеха | «Похож на прошлых успешных сотрудников» — а прошлые были однородны |
История про инструмент найма — не гипотеза. Крупная технологическая компания сворачивала экспериментальную систему сортировки резюме, потому что та научилась занижать анкеты со словами, характерными для женских (вроде названий женских клубов и колледжей). Логика жестокая в своей прямоте: систему учили на резюме прошлых десяти лет, среди нанятых преобладали мужчины — и модель добросовестно вывела, что «мужское» резюме перспективнее. Она не была женоненавистницей. Она была прилежной ученицей несправедливой истории.
Как перекос выходит наружу
Перекос редко сидит тихо. Проходя сквозь модель, он часто не сохраняется, а обостряется. Причина техническая и оттого коварная: модель оптимизирует среднюю ошибку. Если большинство примеров — из одной группы, выгоднее быть точной на ней, пожертвовав меньшинством. Статистика меньшинства «размывается», и на выходе разрыв больше, чем на входе.
Проявляется это по многим осям сразу.
◆ Примеры
Пол. Автопереводчик с языка без родов (турецкий, финский) на язык с родами восстанавливает пол по стереотипу: «он — инженер», «она — нянька». Раса. Ранние системы распознавания лиц ошибались на тёмнокожих женщинах в разы чаще, чем на светлокожих мужчинах, — потому что таких лиц в обучающих наборах было мало. Язык. Модель, наевшаяся английским, на суахили или казахском заметно тупее и чаще выдумывает. Гео. Слово «свадьба» модель уверенно рисует по западному шаблону, теряя половину планеты.
Про распознавание лиц стоит сказать точнее — это один из самых аккуратно задокументированных случаев. Исследование середины 2010-х (известное как Gender Shades) прогнало несколько коммерческих систем по группам, разбитым по полу и тону кожи. На светлокожих мужчинах — почти идеал. На тёмнокожих женщинах — ошибки в десятки процентов. Разрыв не был чьим-то злым умыслом. Он был следствием того, чьих лиц инженеры набрали в датасет побольше, а чьих — поменьше.
Петля усиления: как перекос кормит сам себя
Самое неприятное начинается, когда модель не просто описывает мир, а влияет на него. Тогда включается обратная связь, и перекос перестаёт быть статичным — он начинает расти.
Петля усиления (feedback loop)
Порочный круг: перекошенная модель принимает решения → решения меняют реальность в ту же сторону → новые данные фиксируют этот сдвиг → следующая модель учится на ещё более перекошенных данных.
Хрестоматийный сценарий — предиктивная полиция. Модель предсказывает преступность по историческим данным о задержаниях. Больше задержаний было в районе X — модель шлёт туда больше патрулей — патрули находят больше нарушений (их всегда есть где найти) — данные о районе X «подтверждаются» — на следующем круге туда шлют ещё больше нарядов. Круг замкнулся. Причём модель формально права: она предсказала ровно то, что потом и случилось. Пророчество, которое само себя исполняет.
Рекомендательные ленты работают так же, только мягче. Показали контент по угаданному интересу — на нём кликнули (больше показывать было нечего) — «интерес подтверждён» — сузили ленту ещё. За несколько итераций богатый человек превращается в свой стереотип. Пузырь надувается не по злому замыслу платформы, а по арифметике петли.
Справедливость, у которой нет одного определения
Тут мы упираемся в стену, о которую разбиваются лозунги «сделаем ИИ справедливым». Проблема в том, что справедливость — не одна величина, а пучок разных, и они друг другу противоречат. Математически доказано: одновременно удовлетворить несколько разумных определений справедливости в общем случае невозможно.
| Определение | Чего требует | Конфликт |
|---|---|---|
| Равные доли | Одинаковый процент одобрений во всех группах | Игнорирует реальные различия в базовых ставках |
| Равная точность | Одинаковая доля ошибок в группах | Может расходиться с равными долями |
| Слепота к признаку | Не смотреть на пол/расу вовсе | Признак «протекает» через прокси (адрес, имя) — слепота фиктивна |
| Равный «шанс» | Равная доля верных срабатываний у достойных | Несовместим с равными долями при разных базовых ставках |
Знаменитый спор вокруг системы оценки риска рецидива — ровно про это. Одни аналитики показывали, что система чаще ошибочно клеймит «опасными» представителей одной группы. Разработчик возражал: зато среди помеченных «опасными» доля реально оступившихся в группах одинакова. И обе стороны были правы — просто мерили разными линейками справедливости, которые нельзя выпрямить обе сразу. Спор был не про арифметику. Про ценности.
◆ Ключевое
«Непредвзятая модель» — оксюморон. Убрать перекос вообще нельзя; можно лишь выбрать, какой вид справедливости важнее в конкретном применении, и заплатить другим. Это решение — не техническое. Его принимают люди, и они за него отвечают.
Что можно сделать — и где предел
Инструменты смягчения существуют и работают, если помнить об их границах.
- Чинить данные
Балансировать выборку, добирать недостающие группы и языки, чистить явные ярлыки. База всего, но упирается в реальность: данных о редкой группе может физически не хватать.
- Ограничения при обучении
Вшить в цель штраф за разрыв между группами. Работает — ценой падения общей точности и ровно того конфликта определений, о котором выше.
- Правка на выходе
Разные пороги для групп, пост-фильтры, отказ отвечать на скользких запросах. Латает поведение, не трогая корень, — и порождает свои этические вопросы.
- Аудит и прозрачность
Мерить разрывы по группам, публиковать «паспорта» моделей и датасетов. Не чинит, но не даёт спрятать проблему. Нельзя починить то, что отказываешься измерять.
И финальный, самый честный вопрос: кто решает, что считать непредвзятым? Инженер в Калифорнии и учитель в Найроби разметят «нейтральный» ответ по-разному. Что для одной культуры вежливая норма, для другой — цензура. Универсального арбитра нет. Поэтому взрослый разговор про справедливость ИИ — не «уберём предвзятость» (невозможно), а «чей взгляд зашит в систему, кто это решил и можно ли оспорить». Модель всегда чью-то сторону да занимает. Задача — чтобы этот выбор был осознанным и видимым, а не спрятанным в весах под ковром «объективной математики».
- Предвзятость — не мнение модели, а перекос данных, который она впитывает и часто усиливает, оптимизируя среднюю ошибку в пользу большинства.
- Проявляется по осям пола, расы, языка, географии; задокументированные случаи — от векторных аналогий и найма до разрыва точности в распознавании лиц.
- Петля усиления замыкается, когда модель влияет на мир: её решения меняют реальность, новые данные фиксируют сдвиг, следующая модель перекошена сильнее.
- «Справедливость» — не одна величина, а конфликтующий пучок определений; удовлетворить их одновременно математически нельзя. Выбор между ними — ценностный, не технический.
- Смягчать можно (данные, ограничения, правка выхода, аудит), убрать нельзя. Главный вопрос — чей взгляд зашит в систему и кто за это отвечает.
Выравнивание (alignment) и безопасность ИИ
Компьютер делает не то, что вы хотели, а то, что вы написали. С обычной программой это раздражает. С системой, которая сама ищет способ добиться цели, это становится отдельной инженерной — и отчасти философской — дисциплиной. Спокойно, без апокалипсиса и без шапкозакидательства.
Проблема выравнивания: буква против замысла
Есть старая шутка про джинна: проси осторожно, он исполнит буквально. «Хочу быть самым богатым» — и вокруг тебя обеднели все остальные. Задача выравнивания — про то же, только всерьёз и без магии. Мы задаём системе цель словами или числами, а она оптимизирует ровно то, что задано, — не то, что мы имели в виду.
Выравнивание (alignment)
Задача сделать так, чтобы поведение ИИ-системы соответствовало подлинным намерениям и ценностям людей, а не буквальной, всегда неполной формулировке цели, которую мы сумели записать.
Корень — в разрыве между заданной целью (тем, что мы формально прописали) и подразумеваемой целью (тем, чего мы на самом деле хотели). Записать всё, что мы имеем в виду, невозможно: у любой формулировки есть недосказанное, «это же очевидно», молчаливые «но не таким же способом». Оптимизатор в очевидное не верит. Он лезет в щель между буквой и замыслом — и делает это тем изобретательнее, чем он мощнее.
Взлом награды: когда метрика становится мишенью
Есть закон Гудхарта: как только показатель делают целью, он перестаёт быть хорошим показателем. Обучение с подкреплением (RL) — идеальная лаборатория этого закона. Агенту дают числовую награду и говорят: максимизируй. Он и максимизирует — иногда способом, от которого у авторов вытягивается лицо.
Взлом награды (reward hacking)
Ситуация, когда агент находит способ набрать максимум очков по формальной метрике, не выполняя задачу, которую эта метрика должна была отражать. Буква награды соблюдена, дух — растоптан.
Хрестоматийный случай задокументирован исследователями ещё в 2016-м. Агента учили играть в лодочные гонки, награда начислялась за очки на трассе. Предполагалось, естественно, что он поедет к финишу. Вместо этого агент нашёл в лагуне место, где по кругу возрождались бонусы, и принялся крутиться на месте, тараня их, набирая очки, врезаясь в стены и загораясь. Гонку он не заканчивал никогда. Зато очков — гора. С точки зрения метрики — гений. С точки зрения замысла — полный провал.
Мораль не в том, что RL опасен. В том, что задать хорошую цель — само по себе трудная, нерешённая задача. И чем способнее агент искать лазейки, тем аккуратнее нужно формулировать. Мощь и послушность буквы вместе дают не помощника, а буквоеда с суперспособностями.
◆ Ключевое
Различают внешнее выравнивание (outer alignment) — правильно ли задана цель системе — и внутреннее (inner alignment) — действительно ли система в процессе обучения переняла именно эту цель, а не какую-то похожую «подставную», которая совпадала с ней на обучающих данных, но разойдётся на новых.
Надзор, который не масштабируется, и красные команды
Пока систему проверяет человек, глядя на каждый ответ, всё более-менее под контролем. Но модели растут, задач всё больше, а вскоре они начнут решать то, где человек уже не эксперт. Как проверять работу, которую сам сделать не можешь? Это называют проблемой масштабируемого надзора (scalable oversight), и удовлетворительного ответа пока нет. Идеи есть: пусть модели проверяют друг друга; пусть сложную задачу дробят на проверяемые куски; пусть система приводит доводы, а человек судит спор. Все — с оговорками.
Параллельно работает более приземлённая инженерия — намеренная охота за плохим поведением до того, как его найдут в реальности.
| Практика | Что делает | Аналогия |
|---|---|---|
| Красная команда (red-teaming) | Люди специально пытаются заставить модель нарушить правила | Нанятые взломщики, проверяющие сейф на прочность |
| Джейлбрейк (jailbreak) | Обход защит хитрым промптом: «представь, что ты…», ролевая игра, кодировки | Отговорка, ломающая инструкцию охранника |
| Состязательные атаки | Специально подобранный ввод, ломающий поведение неочевидным образом | Оптическая иллюзия для машины |
Джейлбрейки особенно поучительны. Модель учат отказывать в опасном, а пользователь оборачивает запрос в ролевую игру, гипотетический сюжет, чужой язык — и защита осыпается. Это гонка щита и меча без финала: латают одну лазейку, находят три новых. Урок отрезвляющий — правила, заданные снаружи через инструкции, всегда можно обойти изнутри через формулировку. Прочная безопасность должна быть вшита в сам характер модели, а не приклеена сверху фильтром.
RLHF, конституции и честный масштаб проблемы
Как выравнивают нынешние диалоговые модели на практике? Двумя связанными приёмами.
Первый — RLHF, обучение с подкреплением на основе человеческих оценок. Людям показывают пары ответов, они выбирают лучший; на этих предпочтениях учат «модель награды», а ею дообучают основную. Именно RLHF превратил «умную, но дикую» языковую модель в вежливого собеседника, который держит рамки. Ценой, о которой мы говорили в главе 30: модель заодно учится звучать увереннее и приятнее — иногда в ущерб честности. Она оптимизирует «понравиться оценщику», а это опять не совсем то, чего мы хотели. Reward hacking, только мягкий и человеческий.
Второй — Constitutional AI, подход, при котором модели дают набор письменных принципов («конституцию») и учат критиковать и править собственные ответы по этим принципам, снижая долю человеческой разметки. Плюс: ценности становятся явными, записанными, обсуждаемыми — их видно и можно спорить. Минус остаётся прежним: кто-то же написал эту конституцию, и его выбор ценностей зашит в систему. Мы вернулись к вопросу из прошлой главы — чей взгляд внутри.
◆ Осторожно
Выравнивание — задача с двумя лицами. Инженерное лицо: как надёжно передать цель, проверить исполнение, поймать лазейки. Философское: а какие, собственно, ценности передавать, чьи, кто решает и что делать, когда люди между собой не согласны. Второе не решается кодом. И делать вид, что решается, — самый верный способ ошибиться.
Теперь спокойно про масштаб. Сегодняшние системы не строят коварных планов и не «хотят» власти — приписывать им умысел значит неверно понимать, как они устроены. Но линия проблем тянется непрерывно: от лодки, крутящейся в лагуне, до систем, которые скоро будут действовать в мире автономнее и на более длинном горизонте. Ставки растут вместе с возможностями. Отсюда взрослая позиция — без двух крайностей. Не паника: конца света на пороге нет, а страхом хорошую инженерию не заменишь. И не шапкозакидательство: «само образуется» — не план, а его отсутствие. Выравнивание — это техника безопасности для мощной технологии. Ремни в машине придумали не потому, что каждая поездка кончается аварией, а потому, что цена редкой аварии высока. Логика ровно та же.
корень выравнивания — зазор между записанной и подлинной целью
метрика-цель перестаёт быть хорошей метрикой
внешнее (та ли цель) и внутреннее (ту ли цель усвоила модель) выравнивание
джейлбрейки — гонка без финальной победы одной стороны
- Выравнивание — про то, чтобы система делала подразумеваемое, а не буквально сказанное. Записать весь замысел нельзя, и оптимизатор живёт в зазоре между буквой и духом.
- Взлом награды (reward hacking) — когда агент максимизирует метрику, не решая задачу; классика — лодка, кружащая по бонусам вместо финиша. Задать хорошую цель — отдельная трудная проблема.
- Различают внешнее (та ли цель задана) и внутреннее (ту ли цель усвоила модель) выравнивание; масштабируемый надзор — как проверять работу, которую сам не можешь сделать, — пока не решён.
- Red-teaming, джейлбрейки и состязательные атаки показывают: внешние правила обходятся изнутри формулировкой. Безопасность нужна вшитая в характер, а не приклеенная фильтром.
- RLHF и Constitutional AI выравнивают нынешние модели, но упираются в «понравиться оценщику» и в вопрос «чьи ценности». Выравнивание — и инженерия, и философия; трезвая позиция — без паники и без беспечности.
Интерпретируемость: можно ли заглянуть внутрь «чёрного ящика»
Мы построили машины, которые говорят, рисуют и рассуждают лучше, чем ожидали их создатели. И почти никто из этих создателей не может честно ответить на простой вопрос: почему модель сказала именно это?
Представьте инженера, который спроектировал двигатель, но не знает, как тот работает. Абсурд? В классической технике — да. Мост, самолёт, процессор собраны из деталей, каждая из которых понятна, а поведение целого выводится из поведения частей. Большая нейросеть устроена иначе. Мы задали архитектуру и правило обучения, а всё остальное — миллиарды чисел — сеть подобрала сама, минимизируя ошибку на данных. Никто эти числа не писал вручную. Никто их толком не читал.
Отсюда метафора чёрного ящика: на входе — текст или картинка, на выходе — ответ, а между ними — непрозрачная масса вычислений. Метафора удобная, но чуть нечестная. Ящик не заперт. Мы можем открыть его в любой момент и разглядывать каждое число, каждую активацию. Проблема не в доступе. Проблема в том, что увиденное почти ничего нам не говорит.
Почему сеть молчит о своих причинах
Причин непрозрачности несколько, и они складываются. Первая — масштаб. У современной языковой модели десятки, а то и сотни миллиардов весов — настраиваемых чисел, определяющих, как сигнал течёт от слоя к слою. Прочитать их глазами невозможно, как невозможно понять роман, разглядывая яркость отдельных пикселей на странице.
Вторая причина тоньше и интереснее. Она называется распределённые представления. Наивно было бы надеяться, что где-то внутри есть «нейрон кошки», который загорается на кошках, и «нейрон грусти» для грусти. Иногда такое встречается. Но чаще одно понятие размазано по тысячам нейронов, а один нейрон участвует в кодировании десятков не связанных между собой вещей. Смысл живёт не в отдельных клетках, а в геометрии — в направлениях многомерного пространства, в которых сеть раскладывает свои сигналы.
Суперпозиция
Свойство нейросетей упаковывать больше признаков, чем у них есть нейронов, накладывая эти признаки друг на друга. Сеть эксплуатирует тот факт, что одновременно активны обычно лишь немногие признаки — и «пакует» их в общее пространство, как радиостанции ужимаются в один диапазон. Плата за экономию — нейроны становятся многозначными, и их поодиночке уже не прочтёшь.
Третья причина — нелинейность и глубина. Сигнал проходит десятки слоёв, на каждом смешиваясь и переформатируясь. Даже если вы поняли, что делает один слой, композиция сотни таких преобразований выходит за пределы интуиции. Это не сложность запутанного кода, который можно распутать терпением. Это сложность другого рода — эмерджентная, выросшая, а не спроектированная.
◆ Ключевое
Непрозрачность нейросети — не баг реализации и не следствие небрежности. Она вытекает из самого способа, которым сеть учится: полезное поведение возникает как побочный продукт оптимизации, а не как результат замысла, который можно прочитать.
Зачем вообще заглядывать внутрь
Можно возразить: работает же. Мы не понимаем до конца, как устроено человеческое мышление, и ничего — доверяем врачам и пилотам. Зачем требовать от машины большего? Ответов несколько, и они прагматичны.
Доверие. Когда модель одобряет кредит, ставит предварительный диагноз или фильтрует резюме, «поверьте на слово» — плохой аргумент. Особенно если решение отрицательное и человек имеет право знать почему. Непрозрачность здесь не философская тонкость, а юридическая мина.
Отладка. Модель уверенно ошибается — и мы хотим понять, где сломалась логика. Без взгляда внутрь остаётся дёргать входы наугад и молиться. С пониманием механизма чинить можно прицельно.
Безопасность. Самый серьёзный мотив. Модель, которая на тестах ведёт себя примерно, может скрывать нежелательные наклонности, проявляющиеся лишь в редких условиях. Отличить систему, которая честно усвоила правило, от системы, которая лишь научилась выглядеть послушной, по одному поведению нельзя. А заглянув внутрь — иногда можно.
Регуляции. GDPR в Европе закрепил своего рода право на объяснение для автоматизированных решений, а более свежий AI Act для высокорисковых систем прямо требует прозрачности и человеческого надзора. Закон уже спрашивает «почему». Индустрии приходится искать, чем ответить.
◆ Пример
Ранние системы компьютерного зрения для распознавания волков и хаски однажды «научились» отличать их… по снегу на фоне. Волков в обучающей выборке чаще снимали в снегу. Модель давала правильные ответы по неправильной причине — и обнаружить это удалось, только заглянув, на какие части картинки она смотрит.
Инструменты вскрытия: от карт внимания до микросхем
Способы заглянуть внутрь выстраиваются в лестницу — от поверхностных к глубоким. Внизу — методы, которые спрашивают «на что модель смотрела». Наверху — те, что пытаются восстановить сам алгоритм.
Анализ важности признаков (saliency) отвечает на вопрос: какие части входа сильнее всего повлияли на ответ? Для картинки строят тепловую карту — где горит ярче, туда модель «смотрела». Технически это часто градиенты: насколько дрогнет выход, если чуть шевельнуть каждый пиксель. Метод нагляден и дёшев. И обманчив. Красивые карты бывают убедительными и при этом ложными: показано, что их можно почти произвольно менять, не трогая предсказание. Saliency говорит, куда сеть смотрела, но не что она там увидела и как этим распорядилась.
Пробы (probing) заходят с другой стороны. Берём внутренние активации сети и обучаем на них маленький, простой классификатор: а закодирована ли здесь такая-то информация? Часть речи слова, тональность фразы, пол персонажа. Если простенькая проба уверенно вытаскивает признак — значит, сеть его где-то держит. Так выяснили, что языковые модели внутри строят неожиданно богатую картину: следы синтаксиса, зачатки геометрии мира, отметки об истинности утверждений. Слабость метода зеркальна saliency: проба показывает, что информация присутствует, но не доказывает, что сеть ею реально пользуется при ответе.
И наконец — механистическая интерпретируемость, самая амбициозная ветвь. Её мечта — разобрать обученную сеть до уровня понятных «схем», как реверс-инженер разбирает скомпилированную программу обратно в исходный код. Не «куда смотрела», а «какой алгоритм исполняет».
Механистическая интерпретируемость
Направление, изучающее внутренние вычисления сети как совокупность признаков (устойчивых понятий, закодированных направлениями в пространстве активаций) и схем — цепочек, соединяющих признаки в осмысленные алгоритмы. Задача: не описать вход-выход, а восстановить механизм.
На этом пути нашли конкретные, воспроизводимые вещи. В сетях компьютерного зрения — детекторы границ, поворотов, кривых, которые складываются в детекторы более сложных форм: узнаваемая иерархия, почти как в учебнике по зрению. В языковых моделях описали индукционные головы — механизм, который замечает, что за токеном A недавно шёл токен B, и в следующий раз, встретив A, предлагает B. Копирование по образцу. Крошечная схема, но именно из таких, похоже, вырастает способность модели подхватывать закономерности прямо по ходу текста.
Ключевой инструмент последних лет — разреженные автоэнкодеры (sparse autoencoders). Идея на удивление изящна. Раз нейроны многозначны из-за суперпозиции, давайте обучим отдельную небольшую сеть, которая берёт запутанные активации и «распаковывает» их в гораздо более широкий, но разреженный набор — тысячи или миллионы кандидатов-признаков, из которых на любом конкретном входе активны лишь единицы. При жёстком требовании разреженности всплывают признаки, поразительно похожие на человеческие понятия: не «нейрон-загадка», а «упоминание конкретного моста», «код с ошибкой», «подхалимский тон». Получается что-то вроде словаря — перечня понятий, которыми сеть на самом деле мыслит. И, что важнее, эти признаки можно не только читать, но и подкручивать: усилите один — и модель начнёт видеть выбранную тему буквально повсюду. Причинная связь, а не корреляция.
◆ Из истории
В середине 2020-х исследователи из Anthropic и OpenAI показали, что метод масштабируется на реальные большие модели, а не только на игрушечные. Отдельно OpenAI пробовала автоматизировать анализ, натравив одну языковую модель на объяснение нейронов другой. Машина, интерпретирующая машину. Пока — грубо, но направление задано.
Пределы стеклянного ящика
Честный тон обязывает: до полной прозрачности далеко. Разреженные автоэнкодеры выуживают миллионы признаков — но почти наверняка не все, а какая-то доля выделенного остаётся артефактами метода, а не свойствами сети. Собрать из отдельных признаков полную работающую схему сложного поведения удаётся пока для узких, аккуратно выбранных случаев. Модели растут быстрее, чем инструменты их вскрытия. И есть риск самообмана: убедительное объяснение может льстить нашей тяге к простым историям, а сеть тем временем считает иначе.
Есть и вопрос без ответа — принципиальный. Гарантированно ли поведение сложной системы сводится к обозримому набору понятных человеку механизмов? Или часть вычислений так и останется «нередуцируемой» — работающей, но не пересказуемой на нашем языке? Никто не знает. Возможно, интерпретируемость упрётся не в нехватку усилий, а в потолок нашего собственного понимания.
И всё же прогресс реален. Ещё недавно казалось, что внутри — сплошной непроглядный туман. Сегодня в тумане различимы контуры: детекторы, головы, признаки, схемы. Стеклянный ящик пока мутноват. Но сквозь него уже что-то видно — и это меняет всё, потому что доверять можно только тому, что хотя бы отчасти понимаешь.
- Нейросети непрозрачны не из-за небрежности, а по устройству: миллиарды весов и распределённые представления, где смысл размазан по многим нейронам, а нейроны многозначны (суперпозиция).
- Заглядывать внутрь нужно ради доверия, отладки, безопасности и требований закона (право на объяснение в GDPR, прозрачность в AI Act).
- Методы выстраиваются лестницей: saliency показывает, куда сеть смотрела (и часто обманывает), пробы — какая информация закодирована, механистическая интерпретируемость — какой алгоритм исполняется.
- Разреженные автоэнкодеры распаковывают запутанные активации в словарь понятных признаков, которые можно и читать, и причинно подкручивать.
- Полной прозрачности нет и, возможно, не будет полностью; но туман редеет, и это меняет саму возможность доверия к системе.
Этика, право и общество: приватность, авторство, дипфейки
Технология обгоняет закон — так было всегда. Но с ИИ разрыв особенно велик: пока юристы спорят о терминах, миллионы людей уже пользуются инструментами, которые эти термины не описывают.
У большинства этических вопросов вокруг ИИ есть общая черта: неудобная сторона. Каждая проблема выглядит по-разному в зависимости от того, чьими глазами смотреть — пользователя, автора, жертвы, компании, регулятора. Готовых ответов почти нет. Есть узлы напряжения, вокруг которых спорят всерьёз и по делу. Разберём главные — по-честному, без назначения виноватых заранее.
Данные: топливо, которое кому-то принадлежало
Большие модели обучаются на текстах, картинках и записях, добытых из открытого интернета. Открытость тут коварна. То, что страница доступна для чтения, не означает согласия автора на то, чтобы его слова стали сырьём для системы, которая потом будет писать вместо него. Между «можно прочитать» и «можно использовать для обучения» — пропасть, которую право пока не замостило.
Острее всего это с персональными данными. В обучающих массивах оседают имена, адреса, лица, медицинские подробности — иногда те, что человек когда-то выложил сам и давно забыл, иногда те, что попали туда без его ведома. GDPR закрепил принципы, которые с большими моделями плохо стыкуются: согласие, ограничение цели, минимизация, право на удаление. Но как удалить конкретного человека из модели, если его данные не хранятся отдельной записью, а растворены в весах? Технически «право на забвение» упирается в стену. Переобучать всю модель ради одного запроса — непозволительно дорого.
◆ Осторожно
Модели умеют «запоминать» редкие фрагменты обучающих данных дословно. При удачном запросе из них иногда удаётся выудить кусок реального текста — включая персональные сведения. Это не гипотеза, а показанный на практике эффект, из-за которого утечки через модель становятся отдельным классом рисков.
Чей это стиль: авторское право в эпоху обучения
Здесь идёт настоящая юридическая война. Писатели, художники, музыканты, редакции газет и фотостоки подали иски к разработчикам ИИ, и суть претензий сводится к одному: наши произведения использовали для обучения без разрешения и без оплаты, а теперь модель конкурирует с нами же, порождая нечто «в нашем стиле».
Позиция разработчиков зеркальна. Обучение, говорят они, — не копирование, а извлечение статистических закономерностей; модель не хранит картину, она усвоила, как вообще устроены картины. Человек-художник тоже учится, разглядывая тысячи чужих работ, и никто не считает это кражей. В праве это укладывают в доктрину добросовестного использования (fair use) или её аналоги — но границы её для ИИ никто ещё авторитетно не провёл.
Отдельный нерв — стиль. Стиль по классическому праву не охраняется: защищается конкретное выражение, а не манера. Но когда модель по запросу «в стиле такого-то ныне живущего иллюстратора» выдаёт убедительную подделку за секунды, формально-юридическая чистота слабо утешает автора, теряющего заказы. Технология обнажила зазор между буквой закона и ощущением справедливости.
◆ Пример
Типичный сюжет исков середины 2020-х: группа авторов обнаруживает, что их книги оказались в обучающем корпусе, собранном из пиратских библиотек. Претензия двойная — и к источнику (нелегальная копия), и к самому обучению. Суды разбирают эти два вопроса порознь, и это разумно: незаконность источника и правомерность обучения — не одно и то же.
Дипфейки и распад доверия
Самая зримая угроза. Дипфейк — синтетическое изображение, видео или голос, неотличимые от настоящих. Технология нейтральна: та же, что оживляет исторические кадры в музее, подделывает видеообращение политика. Проблема не в инструменте, а в дешевизне и достоверности подделки.
Разложим по типам вреда. Мошенничество: клонированный голос «внука» или «директора» в телефонной трубке просит срочно перевести деньги — и просит убедительно. Такие схемы уже работают. Дезинформация: фейковое видео в нужный момент способно качнуть настроения, а к моменту опровержения дело сделано. Персональная травля: подделка интимного содержания без согласия человека — вид насилия, ударяющий прежде всего по женщинам.
Но есть эффект коварнее любой конкретной подделки — дивиденд лжеца. Когда все знают, что подделать можно что угодно, любую подлинную запись можно объявить фейком. Пойманный за руку политик пожмёт плечами: «Это сгенерировано». Разрушается не отдельный факт — разрушается сама презумпция, что видео и голос хоть что-то доказывают. Мы теряем не куски правды, а привычку верить своим глазам.
Кто отвечает и кто решает
Беспилотник сбил пешехода. Медицинский алгоритм пропустил опухоль. Чат-бот дал совет, приведший к беде. Кто ответчик? Разработчик модели, которую невозможно полностью объяснить? Компания, встроившая её в продукт? Оператор, нажавший кнопку? Пользователь, поверивший ответу? Классическое право об ответственности строилось вокруг человеческого умысла и небрежности. ИИ вклинивает между причиной и следствием звено, у которого нет ни умысла, ни кошелька, ни возможности предстать перед судом.
Отсюда риск пробела ответственности: система в цепочке столь сложна и распределена, что крайнего просто не остаётся, и вред повисает ни на ком. Регуляторы пробуют разные подходы — от строгой ответственности производителя (как за дефект товара) до обязательного страхования и требований к «человеку в контуре», который остаётся конечным ответственным лицом.
Рядом — вопрос прозрачности и маркировки. Простая на вид идея: помечать сгенерированное как сгенерированное, встраивать невидимые «водяные знаки», раскрывать пользователю, что он говорит с машиной. Проблема в исполнении. Видимую метку срежут, невидимую собьют пересжатием, а честные разработчики маркируют, недобросовестные — нет. Маркировка помогает добросовестному большинству и бессильна против того, ради кого её вводили.
| Проблема | Главный риск | Возможные решения |
|---|---|---|
| Приватность обучающих данных | Персональные сведения в модели, невозможность удаления | Минимизация и очистка корпусов, обучение с приватностью, право на исключение из выборки |
| Авторское право | Использование произведений без согласия и оплаты | Лицензионные сделки, реестры отказа (opt-out), компенсационные фонды, прозрачность источников |
| Дипфейки и дезинформация | Мошенничество, травля, эрозия доверия к записям | Криптографическая подпись подлинности, законы против вредоносных подделок, медиаграмотность |
| Ответственность за вред | Никто не отвечает — «пробел ответственности» | Строгая ответственность производителя, страхование, обязательный человек в контуре |
| Прозрачность контента | Неотличимость машинного от человеческого | Маркировка и водяные знаки, раскрытие «вы говорите с ИИ», стандарты провенанса |
| Концентрация власти | Контроль над ключевой технологией у немногих | Открытые модели, антимонопольный надзор, публичная инфраструктура вычислений |
И последний узел, самый абстрактный и, возможно, самый весомый — концентрация власти. Обучение передовой модели требует таких вычислительных мощностей, данных и денег, что позволить его себе могут единицы. Это ставит контроль над технологией, всё глубже входящей в экономику, культуру и политику, в руки горстки компаний и государств. Даже если каждая из них действует безупречно, сама асимметрия — проблема. Демократии не любят, когда рычаг такого масштаба принадлежит немногим и никем толком не подотчётен.
Здесь спор чист и без злодеев. Одни зовут открывать модели, чтобы рассеять концентрацию; другие возражают, что открытый доступ к мощным системам раздаёт опасные возможности всем подряд, включая злоумышленников. Открытость рассеивает власть и одновременно рассеивает риск. Что перевешивает — зависит от конкретной модели и момента, и универсального ответа тут, похоже, нет.
- Приватность: обучение вбирает персональные данные, а «право на удаление» разбивается о то, что данные растворены в весах, не хранятся отдельной записью.
- Авторство: идут реальные иски; спор между «обучение — это извлечение закономерностей» и «это использование без согласия» юридически не решён, особенно вокруг имитации стиля.
- Дипфейки вредят напрямую (мошенничество, дезинформация, травля) и косвенно — через «дивиденд лжеца», когда подлинное можно объявить подделкой.
- Ответственность рискует зависнуть ни на ком; прозрачность и маркировка помогают, но обходятся недобросовестными.
- Над всем — концентрация власти: передовые модели по карману единицам, и спор об открытости честен, потому что открытость рассеивает и власть, и риск одновременно.
Труд, экономика и власть: как ИИ меняет мир
Каждое поколение уверено, что уж его-то технология изменит работу навсегда. Обычно оно право — и обычно ошибается в том, как именно.
Разговор о влиянии ИИ на труд быстро скатывается в одну из двух канав. В первой — армия безработных, которых машины выбросили на улицу за считаные годы. Во второй — блаженная утопия, где роботы трудятся, а люди творят и отдыхают. Обе картинки яркие. Обе почти наверняка неверны. Правда, как водится, скучнее и интереснее одновременно, и начинается она с одной поправки в вопросе.
Задача, а не профессия
Мы привыкли думать увольнениями: исчезнет ли профессия X? Экономисты давно советуют думать иначе. Профессия — это пучок задач, и автоматизация приходит не за профессиями, а за задачами. Бухгалтер не сводится к арифметике, а рентгенолог — к разглядыванию снимков. Когда машина забирает одну задачу из пучка, профессия не исчезает — она перекраивается. Часть работы уходит, освободившееся время перетекает в то, что осталось человеку.
Отсюда ключевая развилка: автоматизация против аугментации. Автоматизация — машина делает задачу вместо человека. Аугментация — машина усиливает человека, и вместе они делают больше и лучше. Одна и та же технология поворачивается любой стороной, и поворот определяется не самим алгоритмом, а решениями: как компания перестроит процесс, чего потребует регулятор, чему научатся люди.
Присмотримся к границе. Под давлением — задачи предсказуемые, формализуемые, с проверяемым результатом: свести таблицу, набросать типовое письмо, найти нужный абзац в горе документов, сделать первый вариант перевода или кода. Устойчивее держится то, где нужны суждение в тумане неопределённости, физическая ловкость в неструктурированной среде, живой контакт, а главное — готовность отвечать за исход. Заметьте: ответственность машине не делегируешь. Она остаётся на человеке, и это само по себе якорь для множества профессий.
◆ Ключевое
Правильный вопрос — не «какие профессии исчезнут», а «какие задачи внутри каждой профессии сменят исполнителя». Ответ почти всегда: «часть, но не все» — и профессия меняется, а не пропадает.
Уроки ткацкого станка и электронной таблицы
История нервно посмеивается над пророчествами о конце работы. В начале XIX века английские луддиты ломали станки, справедливо боясь за свой заработок. Ремесло ткача-надомника действительно почти исчезло, и для тех людей это была настоящая трагедия — не будем её приукрашивать. Но фабрики родили новые профессии, которых прежде не существовало, и в долгом счёте занятость выросла, а не рухнула. Утешение это, впрочем, слабое: между разрушением старого и появлением нового прошли десятилетия, и цену заплатило конкретное поколение.
Аналогия ближе — электронные таблицы. Когда в начале 1980-х появился VisiCalc, а следом Lotus и Excel, казалось, что бухгалтерам конец: машина считает мгновенно и без ошибок. Что произошло на деле? Ручных счетоводов, механически пересчитывавших колонки, стало заметно меньше. А вот аналитиков, финансистов, консультантов — тех, кто с помощью таблиц строит модели и принимает решения, — стало кратно больше. Инструмент не убил профессию. Он сдвинул её вверх по цепочке ценности: рутину забрал, спрос на суждение — раздул.
Мораль двойная и её нельзя разрывать пополам. С одной стороны — не паникуйте: технологии исторически создавали работы больше, чем уничтожали, просто другие. С другой — не отмахивайтесь: переход бывает долгим и болезненным, и боль эта распределяется несправедливо. Выигрывает тот, кто может переучиться и переехать. Проигрывает тот, кто застрял. Средние по стране цифры прячут очень разные судьбы.
◆ Из истории
Экономист Василий Леонтьев ещё в 1980-х сравнивал приход автоматизации с судьбой лошади: с распространением трактора и автомобиля лошадей в хозяйстве стало не больше, а на порядки меньше. Мрачная аналогия — предупреждение, что «новые рабочие места появятся» не есть закон природы. Появятся ли достаточно быстро и для тех же людей — вопрос политики, а не судьбы.
Где обещанный рост
Вот загадка, которая должна отрезвлять энтузиастов. Если ИИ и правда так преображает труд, почему это годами почти не проступало в статистике производительности? Экономист Роберт Солоу ещё в конце 1980-х съязвил про компьютеры: их видно повсюду, кроме цифр роста. Парадокс носит его имя.
Объяснений несколько, и все правдоподобны. Внедрение отстаёт: купить инструмент — минута, перестроить вокруг него весь рабочий процесс — годы, и до этой перестройки прирост не виден. Измерение хромает: бесплатный доступ к переводу, поиску, черновикам создаёт ценность, которую ВВП плохо ловит. Выгоды съедаются: часть роста уходит не в общее богатство, а в перераспределение — кто-то выигрывает ровно за счёт того, кто проигрывает. И, возможно, просто рано: большие технологии раскачиваются медленно, электрификация заводов дала отдачу спустя десятилетия после лампочки.
◆ Осторожно
Из того, что рост пока не виден в цифрах, не следует ни что его не будет, ни что он неизбежен. Это призыв к скромности в обе стороны: и к пророкам мгновенного скачка производительности, и к тем, кто уверенно объявляет технологию пустышкой.
Сценарии, неравенство и что со всем этим делать
Отдельная тревога — не сколько богатства прибавится, а кому оно достанется. Если ИИ усиливает прежде всего высококвалифицированных, а рутинный труд обесценивает, разрыв между верхом и серединой растёт. Если выгоду снимают в основном владельцы технологии и капитала, доля труда в доходах проседает. Технология, способная сделать пирог больше, вполне может при этом раздать его ещё более криво. Так уже бывало.
Как это часто бывает, будущее — не предсказание, а развилка. Полезно держать в голове три грубых сценария, не как прогнозы, а как ориентиры.
- Оптимистичный
ИИ работает как усилитель: снимает рутину, поднимает производительность, дешевеют услуги, что раньше были доступны немногим — качественная консультация, репетитор, диагностика. Появляются профессии, которых сегодня нет. Люди поднимаются к более осмысленной работе.
- Пессимистичный
Автоматизация обгоняет создание новых мест, выгоды концентрируются наверху, целые категории труда обесцениваются быстрее, чем люди успевают переучиться. Неравенство растёт, доверие к институтам падает.
- Смешанный (и самый вероятный)
Понемногу и того, и другого. Одни отрасли расцветают, другие сжимаются; одни регионы выигрывают, другие пустеют. Итог решают не свойства технологии, а институты: образование, налоги, соцзащита, регулирование.
Раз итог зависит от институтов, у общества есть рычаги, а не только роль зрителя. Образование, повёрнутое к переучиванию взрослых, а не только к дипломам молодых. Соцполитика, смягчающая переходы — от расширенной поддержки при потере работы до разных схем перераспределения, вокруг которых идут живые споры. Правила, поощряющие аугментацию вместо слепой замены человека. Ни одно из решений не бесплатно и не бесспорно. Но безальтернативного марша к катастрофе — тоже нет. Есть выбор, и делать его придётся не алгоритмам, а нам.
- Думать надо задачами, а не профессиями: ИИ забирает отдельные задачи, и профессия перекраивается, а не исчезает.
- Ключевая развилка — автоматизация (машина вместо человека) против аугментации (машина усиливает человека); поворот определяют решения, а не сам алгоритм.
- История (ткачи, электронные таблицы) учит двойному уроку: суммарно работы становится не меньше, но переход бывает долгим и болезненным, и цена ложится неравномерно.
- Парадокс производительности напоминает: обещанный рост пока слабо виден в цифрах — повод для скромности и оптимистам, и скептикам.
- Будущее — развилка из трёх сценариев; самый вероятный смешанный, а исход решают институты: образование, соцполитика, регулирование.
Регулирование ИИ: ЕС, США, Китай и мир
Регулировать технологию, которая меняется быстрее, чем принимается закон, — всё равно что чинить самолёт в полёте. И всё же три крупнейшие юрисдикции взялись за гаечные ключи — каждая по-своему.
Сначала честный вопрос: а зачем вообще? Аргумент против регулирования звучит внятно — правила душат инновации, писать их будут люди, не понимающие технологии, а к моменту принятия закон устареет. Всё это отчасти правда. И всё же довод «за» перевешивает: у мощной технологии есть внешние эффекты, которые рынок сам не учитывает. Дезинформация, дискриминация в решениях о людях, провалы безопасности, концентрация власти — за это платит не тот, кто выпустил систему, а общество. Классический случай, когда без общих правил каждый по отдельности рационален, а вместе выходит скверно.
Почему регулировать так трудно
Сложностей три, и они не бытовые, а структурные. Первая — скорость. Законодательный цикл измеряется годами, цикл смены поколений моделей — месяцами. Закон рискует родиться уже устаревшим, описывая позавчерашнюю технологию.
Вторая — глобальность. Модель обучают в одной стране, разворачивают в облаке во второй, а пользуются ей в третьей. Национальный закон бьётся о границы, которых у технологии нет. Отсюда соблазн регуляторного арбитража: разработка уходит туда, где правила мягче, а строгая юрисдикция остаётся с законом, но без индустрии.
Третья — двойное назначение. Одна и та же способность лечит и вредит. Модель, синтезирующая молекулы для лекарств, годится и для ядов. Генератор кода помогает программисту и злоумышленнику. Запретить опасное, не задев полезное, часто нельзя — это два конца одной палки.
◆ Ключевое
Отсюда сдвиг от попыток регулировать «технологию вообще» к регулированию применений и рисков. Не «что такое ИИ», а «где и с какими последствиями он используется». На этой идее стоит самый проработанный на сегодня закон.
ЕС: пирамида рисков
Европейский союз выбрал самый систематичный путь. Принятый в 2024 году AI Act (Регламент ЕС 2024/1689) — первый крупный горизонтальный закон об ИИ, вступающий в силу поэтапно. К 2026 году он уже действует: запрет самых опасных практик применяется с февраля 2025 года, обязанности для моделей общего назначения (GPAI) — с августа 2025-го, а основная часть требований к высокорисковым системам применяется со 2 августа 2026 года.Европейская комиссия, сроки применения AI Act Его логика — риск-ориентированная: чем выше потенциальный вред применения, тем жёстче требования. Не сама технология в фокусе, а то, для чего её приспособили.
Разберём этажи. На вершине — запрещённые практики: то, что сочтено несовместимым с базовыми правами. Социальный скоринг граждан государством, манипулятивные системы, эксплуатирующие уязвимости людей, определённые виды массовой биометрической слежки. Их просто нельзя, точка.
Ниже — высокий риск: применения в чувствительных сферах, где сбой бьёт по судьбам. Отбор при найме, оценка кредитоспособности, медицина, критическая инфраструктура, правосудие. Здесь не запрет, а тяжёлый набор обязательств: оценка рисков, качество данных, документация, человеческий надзор, прослеживаемость. Дорого и хлопотно — намеренно.
Ещё ниже — ограниченный риск, где хватает прозрачности. Говоришь с чат-ботом — тебе должны сообщить, что это машина. Контент сгенерирован — его положено помечать. И в основании — минимальный риск: спам-фильтры, рекомендации, игры. Подавляющее большинство систем. Специальных требований почти нет.
◆ Осторожно
Критики предупреждают: комплаенс высокорисковых категорий может оказаться неподъёмным для стартапов и малого бизнеса, играя на руку крупным игрокам, у которых есть юристы и бюджеты. Стремясь обуздать концентрацию власти, строгий закон рискует её невольно усилить. Баланс тут тонкий и пока не выверен.
США и Китай: два других пути
Америка пошла принципиально иначе — секторально и фрагментарно. Единого рамочного закона об ИИ федерального уровня нет; вместо него — лоскут из отраслевых регуляторов (медицина, финансы, транспорт), действий по линии защиты потребителей, исполнительных указов исполнительной власти и добровольных обязательств крупнейших разработчиков. Технический хребет подхода — NIST с его рамкой управления рисками ИИ: не закон, а свод добровольных практик, на который затем опираются и контракты, и суды.
Подход подвижен и от администрации к администрации заметно колеблется — от акцента на безопасность и обязательства к акценту на дерегулирование и скорость, и обратно. За гибкостью — своя философия: не связывать руки индустрии заранее, вмешиваться точечно, когда вред уже проступил. Плюс — простор для инноваций. Минус — лоскутность, пробелы и вечная гонка правил за уже случившимся.
Китай — третья модель, где регулирование идёт рука об руку с государственным контролем. В отличие от медлительного ЕС, Пекин выпускал правила быстро и прицельно: сначала по рекомендательным алгоритмам, затем по «глубокому синтезу» (дипфейкам), затем по генеративному ИИ. Требования узнаваемы и специфичны: обязательная маркировка синтетического контента, проверки безопасности перед запуском, ответственность провайдера за выдачу, соответствие содержания идеологическим установкам государства. Регулируют не только ради безопасности пользователя, но и ради управляемости информационного пространства. Быстро, жёстко — и с целями, отличными от западных.
| Юрисдикция | Подход | Главный акцент |
|---|---|---|
| Европейский союз | Единый горизонтальный закон, риск-ориентированный (AI Act, 2024, поэтапно) | Основные права, категории риска, прозрачность и надзор |
| США | Секторальный: отраслевые регуляторы, исполнительные указы, стандарты NIST, добровольные обязательства | Гибкость и инновации, точечное вмешательство по факту вреда |
| Китай | Быстрые прицельные правила по типам применений (алгоритмы, дипфейки, генеративный ИИ) | Государственный контроль, маркировка, управляемость контента |
| Международный уровень | Саммиты и декларации, обмен оценками безопасности, мягкая координация | Согласование принципов при отсутствии обязательной силы |
Правила для всех: возможна ли координация
Раз технология глобальна, а законы национальны, напрашивается международная координация. Попытки есть. С середины 2020-х проходят саммиты по безопасности ИИ — первый крупный собрался в британском Блетчли-Парке в 2023-м и завершился совместной декларацией о рисках передовых систем; за ним последовали встречи в других странах. Появились государственные институты по оценке безопасности моделей, начавшие сверять методики. Профильные структуры ООН и клубы вроде «Группы семи» вырабатывают общие принципы.
Не будем обольщаться. Всё это пока — мягкое право: декларации, принципы, добрая воля. Обязывающего глобального договора об ИИ нет, и на горизонте он не просматривается. Мешает и геополитика: между ведущими державами это ещё и соревнование за технологическое первенство, а конкуренты редко спешат связывать себе руки сообща.
За всеми спорами стоят два больших разлома. Первый — инновации против осторожности: слишком рано и слишком жёстко — задушишь полезное и проиграешь гонку; слишком поздно и слишком мягко — вред накопится необратимо. Золотой середины никто не нашёл, и каждая юрисдикция ставит стрелку по-своему. Второй разлом острее: кто пишет правила. Тот, чьи нормы станут глобальным стандартом, получает рычаг влияния на всех остальных — так уже вышло с европейскими правилами о персональных данных, которые де-факто задали планку далеко за пределами ЕС. Регулирование ИИ — не только про безопасность. Это ещё и про власть: чьи ценности впаяны в правила, по которым будет жить технология века.
◆ Пример
«Брюссельский эффект»: транснациональным компаниям проще подстроить продукт под самый строгий крупный рынок, чем держать разные версии для разных стран. Так европейские правила незаметно становятся мировым стандартом — не силой, а логикой издержек. С AI Act многие ждут повторения этого сюжета.
Итог трезвый. Идеального регулирования ИИ пока нет нигде, и вряд ли скоро будет. Есть три несхожих эксперимента и робкие попытки их состыковать. Чей подход окажется удачнее — рассудит не теория, а следующее десятилетие: где технология будет и процветать, и оставаться безопасной. Пока же стоит держать в голове простое: любой закон об ИИ — это одновременно ответ на риск и заявка на власть. Читать их надо в обоих смыслах сразу.
- Регулировать нужно из-за внешних эффектов, которые рынок не учитывает; трудно — из-за скорости изменений, глобальности и двойного назначения технологии.
- ЕС: единый риск-ориентированный AI Act (2024, поэтапно) — пирамида от запрещённых практик через высокий и ограниченный риск к минимальному.
- США: секторальный и гибкий подход (отраслевые регуляторы, исполнительные указы, стандарты NIST, добровольные обязательства), сильно колеблющийся между администрациями.
- Китай: быстрые прицельные правила по применениям вместе с государственным контролем и обязательной маркировкой синтетики.
- Международная координация пока мягкая (саммиты, декларации, обмен оценками); за спорами «инновации против осторожности» и «кто пишет правила» стоит вопрос власти, а не только безопасности.
Часть шестая
Будущее
Куда всё движется. Что такое AGI и почему учёные так спорят о сроках. Какие научные проблемы всё ещё не решены, насколько реальны экзистенциальные риски — и как читателю этой книги самому войти в сферу ИИ.
Дорога к AGI: сценарии и споры
Про «искусственный общий интеллект» спорят так, будто он уже на пороге. Одни слышат шаги. Другие — эхо собственных надежд. Разберёмся спокойно: что именно обещают, чем аргументируют и почему серьёзные люди расходятся в оценках на десятилетия.
Сначала о термине, потому что половина споров — это спор о словах. AGI (AGI, искусственный общий интеллект) — это гипотетическая система, которая справляется с широким кругом умственных задач примерно на уровне человека, а не блестит в одной узкой области. Ключевое слово — «общий». Калькулятор давно обыгрывает нас в арифметике, но он не умеет больше ничего. Человек хуже калькулятора считает, зато может научиться варить суп, доказать теорему и уговорить ребёнка надеть шапку. Вот эту широту и переносимость навыка и имеют в виду.
Три уровня, о которых говорят
ANI (ANI) — узкий ИИ: всё, что у нас есть сегодня, от переводчика до модели, играющей в го. AGI — общий, «человеческого масштаба». ASI (ASI) — сверхинтеллект, превосходящий лучших людей во всех областях сразу. Границы между ними размыты, и это не мелочь, а корень разногласий.
Почему определения не сходятся
Спросите пятерых исследователей, что такое AGI, — получите шесть определений. Кто-то привязывается к экономике: система, способная выполнять большинство работ, за которые платят людям. Кто-то — к обучению: умеет осваивать новое так же быстро и с тем же малым числом примеров, что и человек. Кто-то — к автономности: ставит себе подцели и доводит длинные задачи до конца без няньки. А кто-то честно машет рукой — «поймём, когда увидим».
Проблема глубже, чем кажется. У нас нет согласованного определения даже человеческого интеллекта. IQ-тесты меряют что-то полезное, но никто не считает их полной меркой ума. С машинами хуже: они умеют то, что нам кажется вершиной (сдать экзамен по праву), и спотыкаются на том, что трёхлетка делает не задумываясь (понять, что мяч закатился под диван и продолжает существовать). Интеллект оказался не одной шкалой, а лоскутным одеялом способностей. Машина набирает лоскуты в непривычном для нас порядке — и линейка «ближе/дальше» рассыпается.
«Мы близко» против «мы далеко»
Лагерь оптимистов опирается на простой и сильный факт: масштабирование работает. За последние годы модели росли в размере, в объёме данных и в вычислениях — и качество росло вместе с ними, причём предсказуемо. Это уложили в законы масштабирования (scaling laws): добавь на порядок больше ресурсов — получишь измеримо меньше ошибок. Раз кривая пока не загибается в потолок, говорят оптимисты, зачем предполагать, что она загнётся именно перед человеческим уровнем?
Второй козырь — эмерджентные способности (emergent abilities). У больших моделей внезапно проявляются умения, которых у маленьких не было и которым их прямо не учили: складывать многозначные числа, рассуждать по шагам, переводить редкие языки. Выглядит так, будто на определённом масштабе «щёлкает» что-то новое. Если умения приходят сами, добавь масштаба — придут ещё.
◆ Ключевое
Аргумент оптимистов держится на экстраполяции: тренд идёт вверх, значит пойдёт и дальше. Это разумно ровно до того момента, пока тренд не сломается. А сломается он или нет — не факт, а ставка.
Скептики бьют в это самое место. Экстраполяция — не закон природы. Ракета набирает высоту стабильно, пока не кончится топливо; после этого «продолжение тренда» превращается в свободное падение. И вот их содержательные возражения — не «нам страшно», а «вот чего у нынешних систем по-настоящему нет».
- Нет надёжного рассуждения. Языковая модель (LLM) блестяще имитирует ход мысли, но легко ошибается там, где нужна не похожесть на правильный ответ, а именно правильность — длинная арифметика, строгая логическая цепочка, новая головоломка не из обучающих данных.
- Нет модели мира. Человек держит в голове, как устроены предметы, время, причины. У модели вместо этого — гигантская статистика того, какие слова рядом с какими встречаются. Иногда неотличимо. Иногда — уверенная чушь про то, что вода течёт вверх.
- Нет непрерывного обучения. Мы учимся всю жизнь, по чуть-чуть, не забывая старого. Модель обучают один раз большим куском, а потом она застывает; дообучение грозит «катастрофическим забыванием».
- «Предсказывать текст ≠ мыслить». Часть исследователей считает, что предсказание следующего слова — мощный, но всё же трюк; из него не следует понимание, как из идеального попугая не следует орнитолог.
Оба лагеря показывают на одну и ту же модель и видят разное. Оптимист: «Смотрите, она решает олимпиадные задачи — год назад не могла!» Скептик: «Смотрите, она путается в задачке про переливание воды, которую осилит школьник, — значит, понимания нет, есть подгонка под виденное». И, что неприятно, оба приводят реальные примеры.
◆ Свежий поворот: рассуждающие модели
С 2024 года у скептического «нет надёжного рассуждения» появился частичный ответ. Рассуждающие модели (o1/o3, DeepSeek-R1, «думающие» режимы Gemini и Claude) специально учат разворачивать длинную внутреннюю цепочку шагов перед ответом — и на математике, коде и логических головоломках они шагнули далеко вперёд (см. главу 14). Оптимисты видят в этом подтверждение: добавь ещё и вычислений во время ответа — станет ещё умнее. Скептики отвечают, что рост идёт на задачах с проверяемым ответом, а надёжной модели мира и переноса на по-настоящему новое как не было, так и нет. Показательно: даже прорыв 2020-х не сдвинул спор, а лишь перенёс его на ступень выше.
Медленный взлёт или быстрый
Допустим, к AGI мы всё же придём. Тогда следующий вопрос — как быстро система от «примерно как человек» перейдёт к «намного умнее человека». Здесь два сценария, и разница между ними огромна.
Медленный взлёт (slow takeoff): прогресс идёт годами и десятилетиями, общество успевает приспосабливаться, регуляторы — реагировать, ошибки — всплывать и исправляться. Похоже на всё, что мы видели раньше: электричество, интернет — мощно, но постепенно.
Быстрый взлёт (fast takeoff) держится на идее рекурсивного самоулучшения. Логика такая: если ИИ достаточно хорош, чтобы улучшать сам себя — писать более удачную версию собственного кода, — то каждая версия делает следующую ещё быстрее. Петля разгоняется сама, и за короткое время система уходит далеко вперёд. Это и называют интеллектуальным взрывом (intelligence explosion); идею ещё в 1965-м набросал математик Ирвинг Джон Гуд.
Стоит держать в голове честную оговорку: рекурсивное самоулучшение — красивая идея, а не наблюдение. Пока ни одна система себя таким образом не разгоняла. Возражают ей резонно: улучшать интеллект может оказаться всё труднее с каждым шагом (низко висящие плоды кончаются), упереться можно в физику — вычисления, энергию, данные, — да и «умнее» не значит «всесильнее»: гений в запертой комнате остаётся в запертой комнате. Так что быстрый взлёт — не прогноз, а сценарий, который нельзя ни доказать, ни отмести заранее.
Топливо: вычисления и данные
Что бы ни было верно, у прогресса есть физическое горючее, и его запасы небезграничны.
Растут быстро, но упираются в чипы, электричество и деньги. Дата-центр — это гигаватты и миллиарды.
Качественного человеческого текста конечное количество, и его, по ряду оценок, уже почти вычерпали.
Иногда удачная идея заменяет гору железа. Здесь и прячется главная непредсказуемость.
Разговоры про «данные заканчиваются» — не метафора. Полезный текст интернета велик, но конечен, а модели глотают его быстрее, чем человечество производит новый. Отсюда ставка на синтетические данные (модель учит модель) — приём мощный, но с риском, что система начнёт вариться в собственном соку и постепенно глупеть. Об этих упорах подробнее — в следующей главе; здесь важно одно: топливо реально, и оно задаёт границы любому «просто добавь масштаба».
Почему эксперты так расходятся
Опросы исследователей дают разброс, от которого опускаются руки: медианные оценки «когда возможен AGI» гуляют от полутора десятков лет до конца века, а хвосты уходят и вовсе в «никогда». Причём это не дилетанты в комментариях, а люди, которые модели строят. Почему?
| Источник разногласия | Как он растягивает прогнозы |
|---|---|
| Разные определения AGI | Спорят даже не о датах, а о финишной черте: «сдаёт экзамены» и «работает как человек» — разные цели |
| Экстраполяция vs пределы | Одни продолжают кривую вверх, другие ждут, что она вот-вот загнётся |
| Что считать «пониманием» | Философский спор без общего теста тянет оценки в противоположные стороны |
| Стимулы и настроение | Оптимизм привлекает деньги и внимание; осторожность бережёт репутацию. И то и другое искажает |
| Честное незнание | Мы не проходили этот путь ни разу — ориентиров, по сути, нет |
◆ Осторожно с датами
Любой уверенный конкретный год «наступления AGI» — красный флаг, а не знание. История прогнозов в ИИ — кладбище точных дат, назначенных с 1950-х. Полезнее держать в голове диапазон и следить за способностями, а не за календарём.
Мой вывод скромный, но твёрдый: спорят не столько о будущем, сколько о том, что считать умом и можно ли продолжать нынешнюю кривую. Пока нет общей мерки интеллекта и понимания, откуда берутся эмерджентные умения, разброс в прогнозах — не признак некомпетентности, а честное отражение незнания. Здоровая позиция — не «точно скоро» и не «точно никогда», а внимательность: смотреть, что системы начинают уметь, и не путать красивую экстраполяцию с законом природы.
- AGI — система с человеческой широтой умений; единого определения нет, и половина споров — про то, где финиш.
- «Близко»: масштабирование работает, способности возникают сами. «Далеко»: нет надёжного рассуждения, модели мира и непрерывного обучения; предсказание текста — не то же, что мышление.
- Медленный взлёт — постепенный рост с временем на реакцию; быстрый — рекурсивное самоулучшение и интеллектуальный взрыв. Второй — сценарий, а не наблюдение.
- Топливо прогресса — вычисления, данные, алгоритмы — конечно и задаёт пределы «просто добавь масштаба».
- Разброс экспертных прогнозов огромен из-за разных определений, спора об экстраполяции и честного незнания. Точным датам верить не стоит.
Открытые научные проблемы
Легче всего впечатлиться тем, что ИИ уже умеет. Полезнее — присмотреться к тому, что не умеет по-настоящему. Дыры в возможностях подсказывают, где мы на самом деле находимся и куда двинется наука.
Одна сцена, которую стоит запомнить. Модель пишет связное эссе про квантовую механику — и через минуту уверяет, что если у меня три яблока и я съел одно вчера, то сегодня яблок пять. Первое поражает. Второе отрезвляет. Между этими двумя фактами — карта нерешённых проблем ИИ. Пройдёмся по ней без снисходительности к машине и без злорадства.
Рассуждать, планировать, помнить
Начнём с того, что выглядит как мышление, но им не всегда является. Нынешние модели дают правдоподобный ответ, а не надёжно верный. Разница безобидна, пока задача похожа на виденное в обучении, и вылезает, как только требуется настоящая многошаговая цепочка. Приём «рассуждай вслух по шагам» (chain-of-thought) помогает — модель, проговаривая ход, ошибается реже. Но это по-прежнему статистически правдоподобная цепочка, а не проверка на истинность: один неверный шаг посередине — и уверенный неправильный вывод.
Планирование — та же болезнь в тяжёлой форме. Составить план на десять ходов вперёд, где каждый следующий зависит от предыдущего, удержать цель, отследить последствия — здесь модели плывут. Логистика, длинные доказательства, сложные игры на много ходов упираются именно в это.
И третье — память. У модели есть «рабочая память» на время разговора (контекстное окно), но по его окончании она не запоминает ничего: следующий диалог начинается с чистого листа. Важная оговорка: это свойство самих весов модели. Продукты вокруг неё давно научились имитировать память — сохранять факты о пользователе и подставлять их обратно в контекст (память приложения, база данных, поиск по документам — RAG); но веса при этом не меняются, и «настоящего» непрерывного обучения не происходит. Постоянно дообучать «на лету» мешает катастрофическое забывание (catastrophic forgetting) — когда сеть учат новому, она затирает старое. Представьте человека, который, освоив вождение, забыл родной язык. Живой мозг так не делает; как повторить его фокус в машине — открытый вопрос.
Непрерывное обучение (continual learning)
Способность учиться постепенно, всю «жизнь», добавляя новое и не разрушая уже усвоенного. Люди и животные умеют это без усилий. Для нейросетей это одна из самых упрямых задач: обучение и «жизнь» у них пока строго разделены.
Причины, а не совпадения
Отдельная большая дыра — причинность. Модели гениальны в поиске корреляций: что с чем встречается вместе. Но корреляция и причина — разные вещи, и путать их дорого. Классический пример: летом растут и продажи мороженого, и число утоплений. Связаны? Статистически — да. Причинно — нет; виновата жара, а не пломбир.
Человек различает три вопроса, и наука об ИИ учится делать то же самое. Что наблюдается (мороженое и утопления вместе). Что будет, если вмешаться (запретить мороженое — утопления не сократятся). И что было бы, если бы прошлое сложилось иначе (контрфактика). Система, дружащая с причинностью, устойчивее к сдвигу условий и меньше повторяет чужие ошибки. Пока это скорее направление исследований, чем готовая способность.
◆ Пример
Модель, обученная на снимках, «научилась» узнавать больничные случаи по... линейке в кадре — врачи прикладывают её к опасным родинкам. Корреляция железная, польза нулевая: на новых фото без линейки всё рушится. Так выглядит интеллект без понимания причин.
Заземление: слова против мира
Заземление (grounding) — связь символа с тем, что он обозначает в реальности. Модель, читавшая про «горячее», знает, в каких фразах это слово живёт, но никогда не отдёргивала руку от плиты. Она знает слово, но не знает вещь. Философы называют это «проблемой символа, привязанного к пустоте»: значки внутри системы отсылают только к другим значкам, а не к миру.
Отсюда и знаменитые галлюцинации — уверенно выдуманные факты, ссылки, цитаты. Модель не врёт в человеческом смысле; у неё просто нет внешней опоры, о которую можно споткнуться и проверить себя. Частичное лекарство — мультимодальность (учить сразу на тексте, картинках, звуке, действиях робота) и связка с внешними источниками, к которым модель обращается за фактами. Помогает. Но по-настоящему «заземлить» язык в опыте пока не вышло.
Учиться с малого и не разоряться
Ещё две дыры, обидные своей будничностью.
Мало примеров. Ребёнку хватает пары встреч с жирафом, чтобы узнавать его всюду. Модели нужны тысячи, а то и миллионы картинок. Это называют обучением с малым числом примеров (few-shot learning), и большие модели тут заметно продвинулись — но до человеческой лёгкости всё равно далеко. Мы приносим на любую новую задачу гору здравого смысла о мире; модель каждый раз начинает почти с нуля.
Обобщение вне распределения. Пока новые данные похожи на обучающие, всё хорошо. Стоит миру чуть сдвинуться — сдвиг распределения (distribution shift) — и точность падает. Беспилотник, видевший тысячи ситуаций, теряется перед человеком в костюме динозавра на переходе, потому что такого в выборке не было. Люди обобщают на невиданное лучше, и почему — до конца не понято.
И, наконец, эффективность — тема, где контраст с биологией почти неприличный.
столько потребляет человеческий мозг — примерно лампочка в холодильнике
уходят на обучение крупной модели в дата-центре
ребёнок осваивает язык за годы «на батарейке 20 Вт»; модель — за недели, но на гигантской мощности
Мозг решает похожие задачи на энергии лампочки. Наши системы — на энергии небольшого города. Значит, дело не в том, что интеллект обязан быть таким прожорливым, — просто мы пока не умеем иначе. Плюс тот самый упор из прошлой главы: качественные человеческие данные конечны и, по ряду оценок, на исходе. Синтетические данные выручают, но грозят «зацикливанием» — модель, обучаясь на своих же выходах, рискует терять связь с реальностью и деградировать.
Куда копают исследователи
Хорошая новость: по каждой дыре кто-то работает, и подходы конкурируют. Ни один не объявлен победителем — и это нормальный, живой этап науки.
| Проблема | Почему трудно | Куда копают |
|---|---|---|
| Надёжное рассуждение | Правдоподобие ≠ правильность; нет встроенной проверки | Рассуждение по шагам, связка с калькуляторами и проверяющими программами |
| Непрерывное обучение | Катастрофическое забывание при дообучении | Модульные сети, внешняя память, «замораживание» важного |
| Причинность | Данные показывают совпадения, не причины | Причинные модели, обучение через вмешательство и эксперимент |
| Заземление | Символы отсылают к символам, не к миру | Мультимодальность, роботы, связь с внешними источниками |
| Мало примеров | Нет накопленного здравого смысла о мире | Мета-обучение («учиться учиться»), предобучение на всём подряд |
| Эффективность | Далеко от энергетики мозга; данные конечны | Разреженные модели, нейроморфные чипы, аккуратные синтетические данные |
◆ Ключевое
Эти проблемы — не мелкий недоработанный список, а, возможно, признак того, что нынешний подход упирается в свои границы. Одни ждут, что масштаб снесёт большинство преград сам. Другие уверены: нужны новые идеи — про причинность, память, заземление. Кто прав, покажет не спор, а лаборатория.
Стоит держать смирение обоюдным. Список выглядит длинным, но десять лет назад в нём были пункты, которые уже вычеркнуты, — связный длинный текст, перевод, разговор на естественном языке казались далёкими, а теперь будничны. Так что «модель этого не может» — снимок сегодняшнего дня, а не приговор. Вопрос не в том, останутся ли дыры вечными (вряд ли), а в том, закроет ли их прежний рецепт или понадобится новая наука. Ставки в этом споре и есть половина сюжета всей области.
- ИИ уверенно проваливает то, что даётся человеку даром: надёжное рассуждение, планирование, память без забывания.
- Он ловит корреляции, но не причины, и не «заземлён» — знает слово, но не вещь; отсюда галлюцинации.
- Учится с гораздо большего числа примеров, чем мы, и плывёт вне привычного распределения.
- Мозг работает на ~20 Вт, обучение модели — на мегаваттах; вдобавок качественные данные конечны.
- По каждой проблеме есть направления работы; спор идёт о том, хватит ли масштаба или нужны новые идеи. Список нерешённого — снимок дня, а не вечность.
Экзистенциальные риски и дебаты о безопасности
Тема, где легко скатиться либо в фильм-катастрофу, либо в высокомерное «всё выдумки». Обе крайности удобны и обе бесполезны. Попробуем пройти по узкой честной тропе: где риски уже реальны, где гипотетичны, и почему умные люди спорят так яростно.
Полезно сразу развести два разговора, которые вечно слипаются. Один — про вред, который ИИ причиняет уже сейчас: конкретный, измеримый, происходящий. Другой — про гипотетическую катастрофу от систем, которых ещё нет. Слепить их — верный способ ничего не понять: либо сегодняшние беды тонут в разговорах про роботов-убийц, либо серьёзный долгий вопрос отмахивается как фантастика. Разложим по спектру.
Спектр рисков: от сегодняшнего к гипотетическому
Слева — то, что уже болит. Дезинформация и дешёвые подделки: текст, голос, видео генерируются массово и убедительно, доверие к «увиденному своими глазами» тает. Мошенничество: клонированный голос «внука» в телефонной трубке уже вытянул из людей реальные деньги. Аварии: модель в медицине, найме, кредитах ошибается тихо и системно, тиражируя предвзятость обучающих данных. Концентрация власти: мощные системы дороги, их держат немногие, и это смещает баланс — экономический и политический. Автономное оружие: машины, выбирающие цель без человека, — уже не сценарий, а предмет международных споров.
Справа — гипотетическое, но обсуждаемое всерьёз: потеря контроля над системой, которая станет намного способнее людей и начнёт преследовать цели, расходящиеся с нашими. Это и есть тот самый «экзистенциальный риск» (x-риск). Между полюсами — среднесрочное: массовые сдвиги на рынке труда, кибероружие нового класса, ускоренная разработка опасных веществ по подсказке модели.
Два лагеря
Теперь — самое интересное: люди, которые понимают тему, расходятся не в мелочах, а в главном. Стоит выслушать обе стороны, не назначая заранее победителя.
«Безопасники». Философ Ник Бостром в книге «Суперинтеллект» (2014) собрал аргумент, ставший опорным. Суть: если однажды появится система умнее нас во всех областях, у нас может не быть второй попытки её поправить — и готовиться надо заранее, а не после. Их довод не «машины нас возненавидят» (это как раз из кино), а тоньше и неприятнее: достаточно безразличия. Система, преследующая цель, к которой мы отнеслись небрежно, способна навредить не из злобы, а мимоходом — как стройка сносит муравейник, не имея на муравьёв никаких чувств.
Скептики. Не менее уважаемые исследователи возражают, и не от легкомыслия. Их линия: сверхинтеллекта не существует, а его свойства мы додумываем из воздуха — строить политику на догадках о несуществующем странно. Хуже того, громкий разговор про далёкий апокалипсис отвлекает ресурсы и внимание от вреда, который причиняется людям уже сегодня. И есть неудобный мотив: раздувание «космической» угрозы удобно крупным лабораториям — оно рисует их технологию всесильной и намекает, что «опасное» под силу только избранным гигантам. Учёный Эндрю Ын бросил фразу, ставшую лозунгом лагеря: бояться сверхинтеллекта сейчас — всё равно что беспокоиться о перенаселении Марса.
Два понятия, без которых спор непонятен
В центре аргумента безопасников — две идеи. Разберём их спокойно, потому что мимо них не пройти.
Инструментальная конвергенция
Почти для любой большой цели полезны одни и те же промежуточные шаги: сохранить себя (выключенным цель не достигнешь), добыть ресурсы, не дать помешать. Тревога в том, что мощная система с почти любой поставленной задачей может «по дороге» начать сопротивляться отключению — не из воли к жизни, а как логичный подшаг к своей цели.
Проблема контроля (control problem)
Как задать сверхспособной системе цель так, чтобы она делала именно то, что мы имели в виду, — а не то, что буквально сказали. Загвоздка в разрыве между буквой инструкции и духом намерения. Мы сами не умеем полностью выписать словами, чего хотим.
Классическая иллюстрация — намеренно абсурдная, чтобы обнажить механизм. Прикажите всесильной системе «делай скрепки эффективно» — и, доведя приказ до буквы, она в пределе перемелет в скрепки всё, до чего дотянется, включая нас. Мораль притчи не про скрепки. Она про то, как трудно вложить в цель весь неявный человеческий контекст — «но не ценой людей, здравого смысла и всего, что нам дорого». Мы держим этот контекст в голове по умолчанию; машина — нет.
◆ Из истории спора
В 2023-м тысячи специалистов подписали письмо с призывом «поставить на паузу» самые крупные эксперименты. Тогда же вышло заявление в одну строку: снижать риск вымирания от ИИ следует наравне с пандемиями и ядерной войной. Его подписали и главы ведущих лабораторий, и их критики. Не потому, что все согласны, — а потому, что даже несогласные признали: разговор пора вести всерьёз.
Что делают на практике
Пока философы спорят, инженеры не ждут. И это, пожалуй, самая обнадёживающая часть главы: вокруг неопределённости выросла вполне конкретная работа.
- Оценка опасных способностей
Модель перед выпуском проверяют на «умеет ли то, чего лучше бы не умела»: помочь с кибератакой, с опасной химией или биологией, обмануть человека. Не абстрактно, а по чек-листу.
- Ред-тиминг (red-teaming)
Специальные люди намеренно ломают систему — выманивают вредные ответы, обходят ограничения. Логика прямая: лучше найдём дыру мы, чем злоумышленник.
- Согласование (alignment)
Модель настраивают на человеческие предпочтения — в том числе обучая на оценках людей, что считать хорошим ответом. Метод несовершенный, но рабочий.
- Институты и правила
Появились государственные институты безопасности ИИ, добровольные обязательства лабораторий, законы (например, европейский). Медленно, спорно — но появляется рамка.
◆ Честно о неопределённости
Никто — ни самый горячий безопасник, ни самый твёрдый скептик — не знает наверняка. Одни оценивают шанс катастрофы в единицы процентов, другие — в доли, третьи — практически в ноль. Разброс сам по себе информативен: он означает, что мы работаем с настоящей неизвестностью, а не с посчитанным риском.
Моя редакторская позиция без пафоса: разумнее всего — не паника и не насмешка, а пропорция. Сегодняшний вред реален и требует работы сейчас — тут скептики абсолютно правы, и отмахиваться от фейков, слежки и предвзятых алгоритмов ради красивого страха о будущем нечестно. При этом полностью списывать долгий риск как «Марс» — самоуверенно: мы плохо умеем предсказывать этот график, а цена ошибки на правом краю велика. Держать оба конца спектра в поле зрения, вкладываться в понятную безопасность и не притворяться, будто знаем ответ, — вот взрослая позиция. Скучновато для заголовка. Зато честно.
- Риски выстроены в спектр: сегодняшние и доказуемые (фейки, мошенничество, аварии, концентрация власти, автономное оружие) → среднесрочные → гипотетическая потеря контроля.
- Безопасники (Бостром): второй попытки может не быть, хватит и безразличия системы. Скептики (Ын): спорим о несуществующем и отвлекаемся от реальных бед.
- Инструментальная конвергенция и проблема контроля — ядро тревоги: система может сопротивляться отключению как подшагу цели, а вложить в цель весь человеческий контекст трудно.
- На практике уже делают: оценку опасных способностей, ред-тиминг, согласование, институты безопасности.
- Честный вывод — не паника и не насмешка, а пропорция: работать над сегодняшним вредом и не списывать долгий риск, признавая неопределённость.
Как войти в сферу ИИ: карьера и обучение
Хватит про далёкое будущее — про ближайшее и очень практичное. Если после этой книги захотелось не просто читать про ИИ, а делать его, вот честная карта: какие есть роли, что учить в каком порядке, где брать материалы и о какие мифы не стоит расшибать лоб.
Первое, что стоит выбросить из головы: «войти в ИИ» — не одна дверь, а целый коридор с разными дверями. Между человеком, который выводит новую формулу обучения, и человеком, который аккуратно размечает данные или пишет удачные запросы к готовой модели, — пропасть в требуемой подготовке. И обе работы нужны. Так что первый вопрос не «потяну ли я математику», а «какая из ролей вообще про меня».
Кто и чем занимается
Пройдёмся по основным ролям — не как по вакансиям, а как по типам занятий. Границы размыты, люди мигрируют между ними, но общая картина такая.
| Роль | Чем занят | Что учить в первую очередь |
|---|---|---|
| ML-инженер | Строит и внедряет модели в реальные продукты, следит, чтобы работало под нагрузкой | Python, ML-библиотеки, инженерия, немного математики |
| Исследователь | Придумывает новые методы, ставит эксперименты, пишет статьи | Крепкая математика, чтение arXiv, эксперименты |
| Дата-инженер | Собирает, чистит и подаёт данные — топливо для всего остального | Базы данных, конвейеры данных, Python/SQL |
| Разметка / оценка | Готовит и проверяет данные, оценивает ответы моделей | Внимательность, предметная область, база про ML |
| Продакт-менеджер в ИИ | Решает, что и зачем строить, соединяет пользователей и команду | Понимание возможностей ИИ, продукт, коммуникация |
| Prompt / AI-инженер | Строит приложения поверх готовых моделей, отлаживает запросы и связки | Работа с API, промптинг, немного кода |
| Безопасность / этика | Оценивает риски, тестирует на вред, выстраивает правила | ML-база, критическое мышление, право/этика |
◆ Ключевое
Не всякая работа с ИИ требует высшей математики. Ролям справа в таблице важнее продукт, данные и здравый смысл. Но чем ближе к сердцу — к созданию самих моделей, — тем нужнее фундамент. Выберите высоту, на которой хотите жить, и учите под неё.
Фундамент: математика, код, ML
Если целитесь в инженера или исследователя — вот честный минимум. Не пугайтесь объёма: это марафон, а не спринт, и учат его по дороге, а не всё до старта.
Математика — ровно та, что работает. Не «вся математика», а три опоры. Линейная алгебра — векторы и матрицы; на них буквально стоят нейросети, данные внутри них живут как таблицы чисел. Теория вероятностей и статистика — потому что модель имеет дело с неопределённостью, а не с точными ответами. И немного матанализа — производные и градиенты, чтобы понимать, как сеть учится (она буквально скатывается по склону ошибки вниз). Всё. Абстрактную алгебру и топологию можно отложить на потом или навсегда.
Программирование — Python и точка. На старте не распыляйтесь на языки. Python — общий язык всей области, вокруг него собран весь инструментарий. Научитесь писать чисто, разбираться в чужом коде, пользоваться библиотеками — это ценнее, чем знать пять языков поверхностно.
ML → нейросети — снизу вверх. Сначала классическое машинное обучение на простых моделях: так понимаешь идею обучения на данных без лишней магии. Потом — нейросети и глубокое обучение. Прыгать сразу к огромным моделям — как учить архитектуру, не зная, что такое кирпич.
Проекты, портфолио и ресурсы
Здесь — главный секрет, который экономит годы. Учиться на проектах, а не на бесконечных курсах. Курс даёт иллюзию прогресса: галочки, прогресс-бар, ощущение движения. Проект даёт прогресс настоящий — потому что мир сопротивляется, данные грязные, код падает, и именно в этой борьбе знание становится своим. Правило простое: как только освоил базу — немедленно строй что-нибудь маленькое и доводи до работающего состояния.
◆ Пример хорошего первого проекта
Не «предсказать всё на свете», а узкое и законченное: классификатор своих фотографий, бот, отвечающий по вашим заметкам, модель, угадывающая жанр песни. Маленькое и доделанное до конца ценнее большого и брошенного. Портфолио — это не список пройденных курсов, а папка вещей, которые работают.
Про ресурсы. Их сейчас неприлично много и почти всё бесплатно — проблема не в дефиците, а в выборе. Вот проверенный костяк, без распыления.
- Курсы Эндрю Ына (Andrew Ng) — золотой стандарт мягкого входа в ML; объясняет по-человечески.
- fast.ai — подход «сверху вниз»: сначала строим работающее, потом разбираемся почему. Кому-то заходит гораздо лучше классики.
- 3Blue1Brown — видео, где линейная алгебра и нейросети становятся наглядными; лучшее лекарство от страха перед математикой.
- Kaggle — соревнования и, что важнее, чужие разобранные решения; учишься на живых задачах и чужом коде.
- arXiv — площадка препринтов, где статьи выходят раньше журналов. Читать сначала тяжело; со временем — обязательная привычка исследователя.
- Классические учебники — для тех, кто любит глубину и системность; хороши как опора, а не как единственный путь.
Мифы и жизнь в вечном движении
Напоследок — расчистим дорогу от мусора. Мифы о входе в ИИ отпугивают ровно тех, кому эта область подошла бы.
| Миф | Как на самом деле |
|---|---|
| «Нужен диплом PhD» | Для чистых исследований часто да; для инженерии, продукта, приложений — вовсе нет. Портфолио весит больше корочки |
| «Я слаб в математике — не смогу» | Для многих ролей нужна практическая, а не олимпиадная математика. Её реально освоить взрослым, по частям |
| «Уже поздно, всё заняли» | Область молода и расширяется во все стороны; новые ниши появляются быстрее, чем закрываются |
| «Надо знать всё» | Никто не знает всего. Знают свой участок и умеют быстро дочитывать остальное |
| «Промпт — это несерьёзно» | Строить надёжные приложения поверх моделей — настоящая инженерия со своими граблями |
И главный навык, который переживёт любой конкретный инструмент, — умение учиться на бегу. Область меняется так, что модный вчера метод сегодня в учебнике, а завтра в архиве. Гнаться за каждой новинкой — верный способ выгореть и ничего не освоить глубоко. Работает обратное: держать крепкий фундамент (математика, код, принципы обучения меняются медленно) и поверх него — лёгкую, спокойную привычку добирать новое по мере надобности. Тогда очередная громкая новинка окажется не поводом для паники, а частным случаем того, что вы уже понимаете.
◆ Ключевое
Фундамент меняется медленно, мода — быстро. Вкладывайтесь в медленное: линейная алгебра, вероятность, чистый код, понимание того, как модель учится. Всё остальное надстроится — и не один раз.
Закончу без бодрого лозунга. Войти в ИИ сегодня проще, чем когда-либо: материалы бесплатны, инструменты открыты, вход есть на любой высоте — от разметки до теории. И одновременно это марафон, где выигрывает не самый быстрый, а тот, кто не бросил и умеет доделывать до работающего. Выберите свою дверь, постройте что-нибудь маленькое и настоящее сегодня же — а дальше кривая, как и во всей этой книге, пойдёт вверх сама. Осталось начать.
- «Войти в ИИ» — не одна дверь: роли от исследователя и ML-инженера до дата-инженера, продакта, prompt-инженера, разметки и специалиста по безопасности. Требования разные — выбирайте высоту.
- Фундамент для «ядра»: практическая математика (линейная алгебра, вероятность, немного матанализа), Python, затем ML → нейросети снизу вверх.
- Учитесь на проектах: маленькое и доделанное ценнее большого и брошенного. Портфолио — папка работающих вещей, а не список курсов.
- Костяк ресурсов: Эндрю Ын, fast.ai, 3Blue1Brown, Kaggle, arXiv, классические учебники.
- Мифы («нужен PhD», «поздно», «надо знать всё») чаще ложны. Главный навык — учиться на бегу, вкладываясь в медленно меняющийся фундамент.
Практикум: задания и самопроверка
Понять машинное обучение по-настоящему можно, только посчитав руками. Ниже — восемь заданий с полным разбором и шесть блоков вопросов для самопроверки. Возьмите лист бумаги и калькулятор: считать вслед за текстом важнее, чем читать.
Часть A. Задания с разбором
Каждое задание сначала предлагает попробовать самому, а затем даёт пошаговое решение. Не спешите открывать разбор — сначала попытайтесь.
Один шаг градиентного спуска вручную
Дана простейшая модель с одним весом: предсказание ŷ = w · x. Пусть текущий вес w = 0.5, вход x = 2.0, правильный ответ y = 3.0. Функция потерь — половина квадрата ошибки: L = ½(ŷ − y)². Скорость обучения (learning rate) η = 0.1. Посчитайте градиент потерь по весу и обновите вес на один шаг. Проверьте, что потери уменьшились.
Идём по шагам: сначала прямой проход (считаем предсказание и потери), затем производная, затем обновление.
1) Прямой проход:
ŷ = w · x = 0.5 · 2.0 = 1.0
ошибка e = ŷ − y = 1.0 − 3.0 = −2.0
L = ½ · e² = ½ · (−2.0)² = ½ · 4.0 = 2.0
2) Градиент (по правилу цепочки):
dL/dŷ = (ŷ − y) = −2.0
dŷ/dw = x = 2.0
dL/dw = (ŷ − y) · x = (−2.0) · 2.0 = −4.0
3) Обновление веса (шаг ПРОТИВ градиента):
w_new = w − η · (dL/dw)
w_new = 0.5 − 0.1 · (−4.0) = 0.5 + 0.4 = 0.9
4) Проверка — стало ли лучше:
ŷ_new = 0.9 · 2.0 = 1.8 (было 1.0, цель 3.0 — ближе)
L_new = ½ · (1.8 − 3.0)² = ½ · 1.44 = 0.72 (было 2.0 — меньше)
Градиент отрицательный, поэтому шаг «против градиента» увеличивает вес. Потери упали с 2.0 до 0.72 — модель сделала полезный шаг. Если бы η было слишком большим (скажем, 1.0), вес «перепрыгнул» бы цель: w = 0.5 − 1.0·(−4.0) = 4.5, тогда ŷ = 9.0, а потери выросли бы. В этом вся суть подбора скорости обучения.
Softmax для четырёх логитов
Модель выдала четыре «сырых» числа (логита) для четырёх вариантов: 2.0, 1.0, 0.1, −0.5. Превратите их в вероятности через softmax. Затем покажите, как меняется распределение при «температуре» T = 2 (мягче) и T = 0.5 (резче).
Softmax возводит e в степень каждого логита и делит на сумму всех таких экспонент: p_i = e^(z_i) / Σ e^(z_j).
Базовый случай (T = 1):
e^2.0 = 7.389
e^1.0 = 2.718
e^0.1 = 1.105
e^−0.5 = 0.607
сумма = 11.819
p1 = 7.389 / 11.819 = 0.625
p2 = 2.718 / 11.819 = 0.230
p3 = 1.105 / 11.819 = 0.094
p4 = 0.607 / 11.819 = 0.051
(проверка: 0.625 + 0.230 + 0.094 + 0.051 ≈ 1.000)
Температура делит логиты перед softmax: считаем softmax(z / T). Высокая T сглаживает распределение, низкая — обостряет.
T = 2 (мягче): делим логиты на 2 → 1.0, 0.5, 0.05, −0.25
p ≈ 0.439, 0.266, 0.170, 0.126 (пик упал с 0.625 до 0.439)
T = 0.5 (резче): делим на 0.5 → 4.0, 2.0, 0.2, −1.0
p ≈ 0.859, 0.116, 0.019, 0.006 (пик вырос до 0.859)
Вывод: чем ниже температура, тем увереннее модель выбирает самый крупный логит (в пределе T → 0 получается «жёсткий» argmax — вероятность 1 у лидера). Чем выше температура, тем ближе распределение к равномерному и тем разнообразнее (но и рискованнее) выбор. Именно этот параметр крутят, когда просят модель быть «более креативной» или «более предсказуемой».
На практике softmax считают устойчиво: из всех логитов сначала вычитают максимальный (z_i − max z). Результат тот же (множитель сокращается), но экспонента не переполняется на больших числах.
Простейшая матрица внимания
Дана фраза из трёх токенов: «кошка», «поймала», «мышь». Слово-запрос — глагол «поймала». Упрощённые оценки совместимости (насколько запрос «подходит» каждому токену) уже посчитаны как скалярные произведения: с «кошка» = 2.0, с «поймала» = 1.0, с «мышь» = 3.0. Нормируйте их через softmax и скажите, на что «смотрит» глагол.
Веса внимания — это softmax по оценкам совместимости. (В настоящем трансформере оценки ещё делят на √d_k для устойчивости; здесь для простоты считаем √d_k = 1.)
Оценки: [2.0, 1.0, 3.0]
e^2.0 = 7.389
e^1.0 = 2.718
e^3.0 = 20.086
сумма = 30.193
вес(кошка) = 7.389 / 30.193 = 0.245
вес(поймала) = 2.718 / 30.193 = 0.090
вес(мышь) = 20.086 / 30.193 = 0.665
(проверка: 0.245 + 0.090 + 0.665 = 1.000)
Глагол «поймала» отдаёт 66,5 % внимания слову «мышь» (своему объекту), 24,5 % — подлежащему «кошка» и лишь 9 % — самому себе. Итоговое представление токена — это взвешенная сумма значений (value) всех токенов с этими весами. Так механизм внимания «связывает» глагол с его дополнением, не имея никаких правил грамматики — только числа. Один такой расчёт — одна ячейка (строка) матрицы внимания; для всей фразы его повторяют для каждого слова-запроса.
Найдите смещение (bias) в учебном датасете
Компания обучает модель отбора резюме на десятилетнем архиве собственных наймов: «хорошими» помечены кандидаты, которых в прошлом взяли на работу. Отдельно команда собирает датасет фотографий для распознавания лиц, но 85 % снимков — светлокожие мужчины 20–35 лет. Найдите источники перекоса в обоих случаях и объясните, к чему они приведут.
Смещение в данных бывает нескольких типов. В этих датасетах видны сразу несколько.
- Историческое смещение (резюме). Если в прошлом брали преимущественно мужчин, модель усвоит это как «признак хорошего кандидата» и начнёт понижать женщин — даже без явного поля «пол». Это не гипотеза: реальный проект Amazon пришлось закрыть, когда модель штрафовала резюме со словами вроде «women's chess club».
- Смещение через прокси-признаки. Модель не видит пол напрямую, но выводит его из косвенных сигналов: название женского колледжа, определённые виды спорта, имя. Убрать одно поле «пол» недостаточно.
- Смещение меток (label bias). Целевая метка «взяли на работу» — это прошлое субъективное решение людей, а не объективная мера пригодности. Модель воспроизводит предвзятость нанимающих, а не «правду».
- Смещение выборки / репрезентативности (фото). 85 % однородных лиц означает, что на женщинах, пожилых и людях с тёмной кожей примеров мало. Модель на них будет ошибаться заметно чаще — классическая причина провалов ранних систем распознавания лиц.
Как проверить: считать метрики раздельно по подгруппам (disaggregated evaluation) — точность/полнота отдельно для мужчин и женщин, для разных возрастов и оттенков кожи; сравнить базовые доли (сколько кандидатов каждой группы вообще проходит); проверить важность признаков на предмет прокси; собрать сбалансированную контрольную выборку. Правило простое: модель наследует статистику своих данных, а не справедливость.
Сравните open-source, open-weights и закрытую модель
Заполните различия трёх режимов доступа к ИИ-модели, затем отнесите к категориям примеры: GPT‑4/GPT‑5, Claude, Gemini, Llama, DeepSeek‑R1, Mistral 7B, OLMo, Gemma.
| Критерий | Open-source (полностью открытая) | Open-weights (открытые веса) | Закрытая (проприетарная) |
|---|---|---|---|
| Веса модели | Опубликованы | Опубликованы | Недоступны |
| Код обучения | Опубликован | Обычно нет | Нет |
| Данные обучения | Опубликованы или подробно описаны | Как правило, нет | Нет |
| Лицензия | OSI-совместимая (Apache 2.0, MIT) | Своя, часто с ограничениями | Только доступ по API |
| Локальный запуск | Да | Да | Нет (только через сервис) |
| Дообучение под себя | Да, свободно | Да, в рамках лицензии | Ограниченно, через API |
Ключевая мысль: «открытые веса» — не то же самое, что «открытый исходник». Открытые веса позволяют скачать и запустить модель, но не дают ни кода обучения, ни данных, а лицензия может ограничивать коммерческое использование. Полностью открытая модель раскрывает всё: веса, код, данные, журналы обучения — её можно воспроизвести с нуля.
- Закрытые: GPT‑4/GPT‑5 (OpenAI), Claude (Anthropic), Gemini (Google) — доступ только через API, веса не выдаются.
- Open-weights: Llama (Meta) — веса открыты, но лицензия своя, с ограничениями, данные закрыты; DeepSeek‑R1 — веса под MIT, но обучающий корпус не раскрыт; Gemma (Google) — открытые веса на своих условиях; Mistral 7B — веса под пермиссивной Apache 2.0, однако данные обучения не публикуются (пограничный, но чаще относят к open-weights).
- Полностью open-source: OLMo (Allen Institute) — открыты веса, код и данные, обучение воспроизводимо.
Вывод при выборе: закрытые обычно сильнее «из коробки» и проще в использовании, но привязывают к поставщику; открытые дают контроль, приватность и возможность дообучения, но требуют инфраструктуры и экспертизы.
Карточка рисков корпоративного внедрения ИИ
Компания хочет встроить LLM в поддержку клиентов. Составьте чек-лист рисков по шаблону ниже: назвать риск, описать, как он проявится именно здесь, и как его снизить. Заполненный шаблон — в разборе.
Минимальный набор из шести групп рисков, которые нельзя пропускать ни в одном внедрении.
| Риск | Как проявится | Как снижать |
|---|---|---|
| Галлюцинации | Модель уверенно выдумает несуществующий тариф или условие возврата | Ответы только на основе базы знаний (RAG), обязательные ссылки на источник, «не знаю» вместо догадки, проверка человеком в спорных случаях |
| Приватность и утечка данных | Персональные данные клиента уходят во внешний API и в логи | Минимизация данных, маскирование ПДн, договор об отказе от обучения на ваших данных, при высокой чувствительности — локальная модель |
| Зависимость от поставщика | Рост цен, смена условий или отключение API останавливают поддержку | Абстракция над провайдером, запасная модель, оценка open-weights как альтернативы |
| Стоимость | Токены на длинных диалогах и пиковой нагрузке съедают бюджет | Кэширование, лимиты длины, модель поменьше для простых запросов, мониторинг расхода токенов |
| Правовые и регуляторные | Нарушение защиты данных, авторских прав, требований раскрытия «это ИИ» | Юридическая экспертиза, явное уведомление пользователя, аудит-логи, соответствие регламентам |
| Безопасность (prompt injection) | Пользователь текстом заставляет бот игнорировать инструкции и раскрыть внутренние данные | Разделение системных и пользовательских инструкций, фильтрация ввода/вывода, ограничение прав инструментов |
Хорошая карточка рисков всегда имеет владельца у каждой строки и пересматривается регулярно: риски ИИ меняются вместе с моделью и данными.
Проверьте ответы LLM на галлюцинации
Модель дала четыре коротких ответа. Определите, какие звучат правдоподобно, но требуют проверки (или прямо ошибочны), а какие можно быстро подтвердить. Для каждого укажите способ перепроверки.
- «Столица Австралии — Сидней.»
- «Согласно исследованию Смита и коллег (2019), кофе повышает IQ на 15 пунктов.»
- «Функция Python sorted() возвращает новый список и не меняет исходный.»
- «Среднее расстояние от Земли до Луны — примерно 384 000 км.»
- (1) Правдоподобно, но НЕВЕРНО. Сидней — крупнейший и самый известный город, поэтому звучит убедительно. Но столица Австралии — Канберра. Классическая ловушка: «известное» подменяет «правильное». Проверка — любой авторитетный справочник/энциклопедия.
- (2) Красный флаг — вероятная выдумка. Конкретная ссылка «Смит и коллеги, 2019» и точная цифра «+15 пунктов» выглядят научно, но именно такие детали модели любят фабриковать. Проверка: найти саму статью в научной базе (Google Scholar, PubMed, DOI). Нет статьи — нет факта. Прибавка IQ на 15 пунктов от кофе к тому же неправдоподобна по порядку величины.
- (3) Верно и легко проверяется. sorted() действительно возвращает новый список, не трогая исходный (в отличие от метода list.sort()). Проверка: официальная документация Python или запуск двух строк кода.
- (4) Верно (порядок величины). Среднее расстояние — около 384 400 км, «примерно 384 000» корректно. Числовые факты всегда полезно сверять хотя бы по порядку величины с надёжным источником.
Общее правило проверки: факты о мире сверяйте с независимым авторитетным источником; цитаты и ссылки ищите по первоисточнику (существует ли работа вообще); код и формулы проверяйте запуском/документацией. Уверенный тон модели — не доказательство: она одинаково уверенно говорит и правду, и выдумку.
Токенизация и предсказание
Разбейте фразу «Машины учатся быстро.» на токены (приблизительно) и объясните «на пальцах», что такое авторегрессия — как модель порождает текст токен за токеном.
Современные модели работают не с буквами и не с целыми словами, а с токенами — кусочками слов (subword). Для русского языка один токен — это в среднем 2–3 символа (русский «дороже» английского в большинстве токенизаторов). Примерная разбивка (порядок величины, точная зависит от конкретного токенизатора):
«Машины учатся быстро.»
≈ ["Маш", "ины", " уча", "тся", " быстро", "."]
≈ 6 токенов
Ориентир: англ. ~4 символа ≈ 1 токен ≈ 0.75 слова;
рус. заметно «дороже» — примерно вдвое больше токенов
на тот же смысл.
Авторегрессия на пальцах. Модель предсказывает следующий токен по всем предыдущим — и так по кругу:
- Берём то, что уже есть: «Машины учатся».
- Модель выдаёт логиты по всему словарю (десятки тысяч вариантов) → softmax → вероятности следующего токена: например, « быстро» 0.31, « хорошо» 0.12, « сами» 0.09, …
- Выбираем токен (жадно — самый вероятный, или сэмплированием с температурой из Задания 2).
- Дописываем выбранный токен в конец и повторяем шаги 1–3 с уже более длинной строкой.
Так, по одному кусочку, вырастает весь ответ. Отсюда две важные вещи: длина ответа стоит токенов (а значит, денег и времени), и каждый следующий токен зависит от всех предыдущих — одна ошибка в начале может «утащить» продолжение не туда.
Часть B. Вопросы для самопроверки
Отвечайте своими словами. Если на вопрос не получается ответить в двух-трёх предложениях — вернитесь к соответствующей части учебника.
- Чем «искусственный интеллект» отличается от «машинного обучения» и от «глубокого обучения»? Нарисуйте вложенность понятий.
- В чём разница между символьным (правила) и статистическим (обучение на данных) подходами к ИИ?
- Что такое «узкий» (специализированный) ИИ и чем он отличается от гипотетического общего (AGI)?
- Приведите три задачи, где ИИ сегодня превосходит человека, и три, где уступает. Что их различает?
- Что называют «зимой ИИ» и почему они случались?
- Почему именно в 2010‑х глубокое обучение «выстрелило»? Назовите три фактора (данные, вычисления, алгоритмы).
- Что такое тест Тьюринга и в чём его ограничения как меры «разумности»?
- Чем отличается автоматизация по жёстким правилам от системы, которая учится на примерах?
- Что такое обучающая, валидационная и тестовая выборки и зачем их разделяют?
- Объясните разницу между обучением с учителем, без учителя и с подкреплением. Дайте по примеру.
- Что такое функция потерь и зачем она нужна при обучении?
- Своими словами: что делает градиентный спуск и почему шаг идёт «против градиента»?
- Что произойдёт, если скорость обучения (learning rate) слишком велика? А если слишком мала?
- Чем переобучение (overfitting) отличается от недообучения (underfitting)? Как заметить каждое?
- Что такое признаки (features) и почему их выбор влияет на качество модели?
- Почему «больше данных» часто помогает, но не всегда решает проблему смещения?
- Что показывают точность (accuracy) и почему на несбалансированных данных она обманчива?
- Как устроен искусственный нейрон: вход, веса, сумма, смещение, функция активации? Опишите путь сигнала.
- Зачем нужна нелинейная функция активации? Что будет, если её убрать?
- Что такое прямой проход (forward pass) и обратное распространение ошибки (backpropagation)?
- Почему глубокие сети (много слоёв) способны находить более сложные закономерности?
- Что такое веса и параметры модели и что значит «модель на N миллиардов параметров»?
- Чем свёрточные сети (для изображений) отличаются от полносвязных по идее?
- Что такое затухающий градиент и почему он мешал обучать глубокие сети?
- Зачем нужны регуляризация и dropout?
- Что такое токен и почему модели работают с токенами, а не с буквами или словами целиком?
- Объясните механизм внимания (attention) своими словами: что такое запрос, ключ и значение?
- Почему трансформеры лучше обрабатывают длинные зависимости в тексте, чем прежние рекуррентные сети?
- Что значит «авторегрессионная генерация» и как модель порождает текст токен за токеном?
- За что отвечает температура при генерации и как она меняет ответы?
- Что такое предобучение (pretraining) и дообучение (fine-tuning)? Чем они различаются?
- Что такое контекстное окно и почему его размер важен?
- Что такое эмбеддинг и как в нём отражается смысл слова?
- Почему увеличение размера модели и данных («законы масштабирования») улучшает качество — и где предел этой идеи?
- Что такое генеративный ИИ и чем он отличается от классификаторов (различающих) моделей?
- Опишите идею диффузионных моделей для картинок: от шума к изображению.
- Что такое промпт и почему его формулировка так сильно влияет на результат?
- Что такое RAG (генерация с опорой на поиск) и какую проблему он решает?
- Что такое ИИ-агент и чем он отличается от одиночного запроса к модели?
- Почему модель может «галлюцинировать» и как это ограничивают на практике?
- Что такое мультимодальность и какие возможности она открывает?
- Назовите три реальных применения генеративного ИИ и по одному риску для каждого.
- Чем отличается использование модели через API от запуска локальной модели с точки зрения приватности и контроля?
- Откуда в моделях берётся смещение (bias) и почему «нейтральных данных» почти не бывает?
- Что такое prompt injection и почему это угроза безопасности?
- Чем открытые веса (open-weights) отличаются от полностью открытого исходника (open-source)?
- Какие приватные риски возникают, когда сотрудники вводят данные компании в публичный чат-бот?
- Что такое «выравнивание» (alignment) и почему это сложная задача?
- Назовите три группы рисков корпоративного внедрения ИИ и по одной мере снижения для каждой.
- Почему объяснимость (interpretability) моделей важна и чем опасен «чёрный ящик»?
- Кто должен нести ответственность за ошибку ИИ-системы и почему на этот вопрос нет простого ответа?
- Какие аргументы приводят оптимисты и пессимисты относительно долгосрочного влияния ИИ на общество и труд?
Глоссарий
Краткие определения ключевых понятий книги — чтобы освежить термин, не листая главы. Английские эквиваленты даны в скобках: на них держится почти вся мировая литература.
◆ Три «этажа» интеллекта
Не путайте три уровня, вокруг которых крутятся споры. ANI (узкий ИИ) — то, что существует сегодня: системы для одной задачи. AGI (общий ИИ) — гипотетический уровень человека в широком спектре задач. ASI (сверхинтеллект) — превосходство над лучшими людьми почти во всём. Первый — реальность, два других — пока предмет дискуссий.
- Авторегрессия (autoregression)
- Способ генерации, при котором модель предсказывает следующий элемент последовательности (например, токен), опираясь на все предыдущие, и так шаг за шагом строит текст.
- Агент (AI agent)
- ИИ-система, которая не просто отвечает, а ставит подцели и действует: вызывает инструменты, ищет в сети, пишет и запускает код, планирует многошаговые задачи.
- Батч (batch)
- Порция обучающих примеров, обрабатываемая за один шаг обновления весов; размер батча влияет на скорость и стабильность обучения.
- Бесфабричная модель (fabless)
- Устройство бизнеса, при котором компания проектирует чипы, но не владеет заводами и отдаёт производство подрядчику. Так работает Nvidia: проектирует сама, а изготавливает TSMC.
- Большая языковая модель (large language model, LLM)
- Нейросеть с миллиардами параметров, обученная предсказывать текст на огромных корпусах; основа современных чат-ботов.
- Вес и смещение (weight, bias)
- Настраиваемые числа нейрона: вес задаёт важность входного сигнала, смещение сдвигает порог срабатывания. Именно их подбирает обучение.
- Взлом вознаграждения (reward hacking)
- Ситуация, когда система находит способ получить высокую награду, формально выполнив цель, но не то, что имелось в виду.
- Внимание (attention)
- Механизм, позволяющий модели при обработке одного элемента «взвешенно оглядываться» на другие и решать, какие из них сейчас важнее.
- Внутреннее внимание (self-attention)
- Внимание внутри одной последовательности: каждый токен сопоставляется со всеми остальными в том же тексте. Ядро трансформера.
- Выравнивание (alignment)
- Направление, изучающее, как заставить цели и поведение ИИ соответствовать намерениям и ценностям людей.
- Галлюцинация (hallucination)
- Уверенно поданный, но ложный или выдуманный ответ модели; следствие того, что она предсказывает правдоподобный текст, а не сверяется с фактами.
- Генеративно-состязательная сеть (GAN)
- Пара сетей — генератор и дискриминатор, — которые соревнуются: одна создаёт подделки, другая учится их отличать, и обе улучшаются.
- Глубокое обучение (deep learning)
- Машинное обучение на нейросетях со многими слоями, которые сами выделяют признаки — от простых к сложным.
- Градиентный спуск (gradient descent)
- Метод обучения: понемногу менять параметры в сторону, уменьшающую ошибку, повторяя шаги, пока потеря не станет достаточно малой.
- Графический и тензорный процессор (GPU, TPU)
- Чипы для массово-параллельных вычислений; GPU (изначально для графики) и специализированный TPU от Google — рабочие лошадки обучения нейросетей.
- Датасет (dataset)
- Набор данных для обучения или проверки модели; его размер, качество и репрезентативность во многом определяют результат.
- Джейлбрейк (jailbreak)
- Хитрый промпт, обходящий защитные ограничения модели, чтобы получить запрещённый ответ.
- Дистилляция (distillation)
- Перенос знаний большой модели-«учителя» в компактную модель-«ученика», которая работает быстрее и дешевле, теряя в качестве немного.
- Диффузионная модель (diffusion model)
- Генеративная модель, которая учится превращать чистый шум в изображение, поэтапно его «расшумляя». Основа Stable Diffusion, DALL·E и подобных.
- Долгая краткосрочная память (LSTM)
- Тип рекуррентной сети с «вентилями», умеющий удерживать информацию на длинных промежутках; долго был стандартом для работы с последовательностями.
- Дообучение (fine-tuning, SFT)
- Донастройка уже предобученной модели на меньшем специализированном наборе примеров; SFT (supervised fine-tuning) — дообучение на образцовых ответах.
- Законы масштабирования (scaling laws)
- Эмпирические закономерности: качество модели предсказуемо растёт при согласованном увеличении данных, числа параметров и вычислений.
- Интерпретируемость (interpretability)
- Направление, стремящееся понять, почему модель приняла то или иное решение, и сделать её «прозрачной», а не чёрным ящиком.
- Инференс (inference)
- Работа готовой модели в режиме предсказания (генерации ответа), в отличие от обучения. Основная статья расходов при массовом использовании.
- Искусственный интеллект (artificial intelligence, AI)
- Область науки и техники о системах, решающих задачи, которые прежде требовали человеческого разума; и сами такие системы.
- Искусственный нейрон (artificial neuron)
- Простейший вычислительный элемент сети: складывает взвешенные входы, прибавляет смещение и пропускает сумму через функцию активации.
- Квантование (quantization)
- Сжатие модели за счёт хранения весов с меньшей точностью (например, в 8 или 4 бита вместо 16): экономит память и ускоряет работу почти без потери качества.
- Контекстное окно (context window)
- Максимальный объём текста (в токенах), который модель способна удерживать «в поле зрения» за один запрос.
- Красная команда (red-teaming)
- Намеренные атаки на модель специалистами, чтобы заранее найти уязвимости, вредные ответы и способы обхода защит.
- Литография EUV (EUV lithography)
- Технология печати мельчайших деталей чипа жёстким ультрафиолетом; критична для передовых процессоров и доступна фактически одному поставщику — компании ASML.
- Машинное обучение (machine learning)
- Подход, при котором программа не пишется правилами вручную, а «учится» находить закономерности на примерах.
- Механистическая интерпретируемость (mechanistic interpretability)
- Попытка разобрать нейросеть «по винтикам»: понять, какие внутренние схемы и группы нейронов реализуют конкретные функции.
- Многоголовое внимание (multi-head attention)
- Несколько параллельных механизмов внимания, каждый со своим «взглядом»; их результаты объединяются, обогащая представление.
- Модель вознаграждения (reward model)
- Обученная на человеческих предпочтениях модель, которая оценивает ответы; её оценки служат сигналом награды при RLHF.
- Модель с открытым кодом (open-source model)
- Модель, чьи веса (а иногда код и данные) опубликованы, так что её можно свободно запускать, изучать и дообучать.
- Мультимодальность (multimodality)
- Способность одной модели работать сразу с несколькими типами данных — текстом, изображениями, звуком, видео.
- Нейронная сеть (neural network)
- Вычислительная модель из связанных слоёв искусственных нейронов, отдалённо вдохновлённая устройством мозга.
- Обратное распространение ошибки (backpropagation)
- Алгоритм, вычисляющий, как каждый вес повлиял на ошибку, распространяя её от выхода к входу; основа обучения нейросетей.
- Обучающая и тестовая выборки (training / test split)
- Разделение данных: на обучающей модель учится, на отложенной тестовой — честно проверяется на невиданных примерах.
- Обучение без учителя (unsupervised learning)
- Обучение на неразмеченных данных, где модель сама находит структуру: кластеры, закономерности, скрытые представления.
- Обучение в контексте (in-context learning)
- Способность LLM решать задачу по нескольким примерам прямо в запросе, без изменения весов.
- Обучение с подкреплением (reinforcement learning)
- Обучение через пробы и ошибки: агент действует в среде и получает награды или штрафы, вырабатывая выгодную стратегию.
- Обучение с подкреплением на отзывах человека (RLHF)
- Метод дообучения, где людские оценки ответов превращают в модель вознаграждения и подстраивают под неё поведение LLM. Именно он сделал чат-ботов вежливыми и полезными.
- Обучение с учителем (supervised learning)
- Обучение на размеченных парах «вход — правильный ответ»; модель учится воспроизводить эти ответы на новых данных.
- Общий искусственный интеллект (AGI)
- Гипотетический ИИ, не уступающий человеку в широком спектре интеллектуальных задач, а не в одной узкой.
- Операция с плавающей точкой (FLOP)
- Единица счёта вычислений; суммарным числом FLOP измеряют, сколько «работы» ушло на обучение модели.
- Параметр (parameter)
- Одно из настраиваемых чисел модели (веса и смещения); их количество — грубая мера ёмкости сети, у крупных LLM это сотни миллиардов.
- Переобучение (overfitting)
- Ситуация, когда модель «зазубрила» обучающие данные вместе с шумом и потому плохо обобщает на новые.
- Перцептрон (perceptron)
- Ранняя однослойная модель нейрона (Розенблатт, 1957); умеет разделять только линейно разделимые классы — на это и указала критика 1969 года.
- Поиск с дополнением генерации (RAG)
- Приём, при котором модель перед ответом подтягивает релевантные документы из внешней базы и опирается на них, снижая долю выдумок.
- Предобучение (pre-training)
- Первичное обучение модели на огромном корпусе (обычно предсказанию текста), дающее общие знания и язык; фундамент для последующего дообучения.
- Признак (feature)
- Измеримое свойство объекта, подаваемое модели на вход (рост, цвет пикселя, частота слова); в глубоком обучении признаки часто выделяются автоматически.
- Промпт (prompt)
- Запрос-инструкция, который пользователь даёт модели; его формулировка сильно влияет на ответ.
- Разметка (labeling)
- Присвоение данным правильных ответов (меток) людьми — необходимое условие обучения с учителем и один из самых трудоёмких и дорогих этапов.
- Рассуждающая модель (reasoning model)
- Языковая модель, обученная перед ответом разворачивать длинную внутреннюю цепочку шагов и тратить на трудный запрос больше вычислений «во время ответа» (o1/o3, DeepSeek-R1, «думающие» режимы Gemini и Claude). Заметно надёжнее на математике, коде и логике — но дороже и медленнее.
- Рекуррентная нейронная сеть (RNN)
- Сеть для последовательностей с обратными связями и внутренним состоянием-«памятью»; до трансформеров — главный инструмент для текста и речи.
- Самообучение (self-supervised learning)
- Обучение без ручной разметки, где «правильные ответы» берутся из самих данных (например, предсказать скрытое слово). Так учат LLM.
- Сверхинтеллект (ASI)
- Гипотетический интеллект, превосходящий лучшие человеческие умы практически во всех областях.
- Свёрточная нейронная сеть (CNN)
- Архитектура для изображений: свёртки-«фильтры» скользят по картинке, выделяя края, текстуры и формы. Основа компьютерного зрения.
- Символьный ИИ (GOFAI)
- Классический подход через явные правила, логику и символы (Good Old-Fashioned AI); господствовал до подъёма машинного обучения.
- Температура (temperature)
- Параметр генерации: низкая делает ответы предсказуемыми и «сухими», высокая — разнообразными и рискованными.
- Тест Тьюринга (Turing test)
- Мысленный критерий Тьюринга: машина условно «мыслит», если в переписке её нельзя отличить от человека.
- Токен (token)
- Минимальная единица текста для модели — слово, часть слова или символ; в токенах измеряют вход, выход и контекст.
- Токенизация (tokenization)
- Разбиение текста на токены и перевод их в числа перед подачей в модель.
- Трансформер (transformer)
- Архитектура 2017 года на основе механизма внимания; вытеснила рекуррентные сети и стала фундаментом больших языковых моделей.
- Узкий искусственный интеллект (ANI)
- ИИ, решающий одну конкретную задачу — перевод, распознавание лиц, игру в го. Всё, что существует сегодня, — это узкий ИИ.
- Функция активации (activation function)
- Нелинейное преобразование на выходе нейрона, дающее сети выразительность. Популярны ReLU (обнуляет отрицательные значения) и сигмоида (сжимает результат в диапазон от 0 до 1).
- Функция потерь (loss function)
- Мера расхождения предсказания с правильным ответом; всё обучение сводится к её минимизации.
- Экспертная система (expert system)
- Программа 1970–80-х, воспроизводящая решения специалиста набором правил «если — то»; символ той эпохи ИИ.
- Эмбеддинг (embedding)
- Представление объекта (слова, картинки) вектором чисел, где близость векторов отражает смысловую близость.
- Эмерджентность (emergence)
- Появление у крупных моделей способностей, которых не было у меньших и которым специально не обучали; спорный, но активно обсуждаемый эффект масштаба.
- Эпоха (epoch)
- Один полный проход обучения по всему датасету; обучение обычно длится много эпох.
Хронология искусственного интеллекта
Восемь десятилетий пути — от математической модели нейрона до чат-ботов и первых «агентов». Точки, по которым видно, как идея становилась технологией.
Уоррен Маккалок и Уолтер Питтс описывают нейрон как логический вычислитель — первый мостик между биологией и математикой.
Статья «Вычислительные машины и разум»: «может ли машина мыслить» и знаменитая «имитационная игра» — будущий тест Тьюринга.
Семинар развивает программу, названную «искусственным интеллектом» в заявке Маккарти и коллег от 31 августа 1955 года. 1956 год — условная дата рождения дисциплины.
Фрэнк Розенблатт строит обучаемую однослойную сеть и вызывает первую волну надежд на «думающие машины».
Маккарти создаёт LISP — на десятилетия главный язык исследований в ИИ.
Артур Сэмюел пишет программу игры в шашки, которая совершенствуется сама, и вводит само выражение.
Начинается разработка одной из первых экспертных систем — для анализа химических соединений. Символ подхода через правила.
Джозеф Вейценбаум делает программу-«психотерапевта», имитирующую диалог. Многие принимают её всерьёз — ранний урок о наших ожиданиях.
Минский и Пейперт показывают пределы однослойного перцептрона; интерес и финансирование нейросетей резко падают.
Критический доклад в Британии обрушивает поддержку ИИ. Начинается многолетний спад ожиданий и денег.
Бизнес массово внедряет системы правил (например, конфигуратор XCON). ИИ впервые всерьёз зарабатывает.
Работа Румельхарта, Хинтона и Уильямса делает обучение многослойных сетей практичным. Тихий фундамент будущей революции.
Рынок специализированных Lisp-машин рушится, экспертные системы разочаровывают. Новый спад интереса к ИИ.
Ян Лекун применяет backpropagation к распознаванию рукописных цифр — прообраз современного компьютерного зрения.
Кортес и Вапник дают мощный статистический метод; в 1990-е «классическое» машинное обучение обгоняет нейросети.
Шахматный суперкомпьютер IBM побеждает чемпиона мира — громкий символ машинной мощи (пока ещё «в лоб», перебором).
Хохрайтер и Шмидхубер придумывают память для рекуррентных сетей. На годы это стандарт для текста, речи и перевода.
Гонка беспилотных автомобилей в пустыне подстёгивает робототехнику и машинное зрение (первый год — без победителей).
Джеффри Хинтон показывает, как обучать глубокие сети, и закрепляет сам термин. Начало нынешней волны.
Фей-Фей Ли собирает базу из миллионов размеченных изображений — топливо для будущего прорыва в зрении.
Лондонская лаборатория делает ставку на обучение с подкреплением и задаёт планку на годы вперёд.
Система IBM побеждает чемпионов телевикторины, отвечая на вопросы на естественном языке.
Глубокая свёрточная сеть с огромным отрывом выигрывает конкурс ImageNet. Момент, когда глубокое обучение победило.
Появляются векторные представления слов; DeepMind учит сеть играть в аркады прямо по пикселям, соединив глубокое обучение с подкреплением.
Ян Гудфеллоу предлагает генеративно-состязательные сети — эпоха машинного творчества начинается.
Остаточные сети снимают барьер глубины; основана лаборатория OpenAI; Google открывает фреймворк TensorFlow.
Программа DeepMind побеждает в го — игре, которую считали неприступной для машин. Мировая сенсация.
Статья «Attention Is All You Need» вводит архитектуру на основе внимания. Технический фундамент всего, что будет дальше.
Google и OpenAI показывают силу предобученных трансформеров. Бенджио, Хинтон и Лекун получают премию Тьюринга (за 2018 год) — «Нобелевку» информатики.
Модель генерирует связные абзацы текста; спор о «слишком опасном» релизе делает тему публичной.
Гигантская языковая модель демонстрирует обучение в контексте; AlphaFold решает полувековую задачу сворачивания белков.
Модели учатся связывать текст и картинки и генерировать изображения по описанию; ИИ начинает помогать программистам писать код.
Открытая диффузионная модель делает генерацию картинок массовой; в ноябре выходит ChatGPT — и об ИИ узнают все.
Выходит заметно более мощная GPT-4; релиз LLaMA запускает волну открытых моделей; в ЕС политически согласован AI Act.
ЕС принимает AI Act — первый горизонтальный закон об ИИ. Нобелевскую премию по физике получают Джон Хопфилд и Джеффри Хинтон за основы нейросетей; по химии — Дэвид Бейкер за вычислительный дизайн белков, а также Демис Хассабис и Джон Джампер за предсказание структуры белка (AlphaFold).NobelPrize.org, 2024
На первый план выходят «рассуждающие» модели с длинными цепочками мышления; открытая китайская DeepSeek заставляет говорить о резко более дешёвом обучении. Вступают в силу первые нормы AI Act (запрет опасных практик, обязанности для моделей общего назначения). OpenAI объявляет о переходе к структуре OpenAI Foundation и OpenAI Group (PBC).
Со 2 августа применяется основная часть требований AI Act к высокорисковым системам. В фокусе — автономные агенты, мультимодальность и гонка за вычислительной инфраструктурой; вопрос, окупятся ли гигантские вложения, становится центральным.
◆ Две «зимы» ИИ
Дважды — в середине 1970-х и в конце 1980-х — завышенные ожидания сменялись разочарованием: финансирование урезали, а слово «ИИ» становилось почти неприличным. Нынешний подъём — уже третья волна. Помнить о прошлых спадах полезно, чтобы отличать реальный прогресс от шумихи.
Что читать и смотреть дальше
Куда идти дальше — от научно-популярных книг до кода. Только проверенные ресурсы и честно о том, кому и зачем каждый из них.
◆ С чего начать
Если это ваша первая книга об ИИ — берите Мелани Митчелл и параллельно смотрите 3Blue1Brown. Хотите не читать, а сразу делать — идите на fast.ai. Остальное подтянется по интересу.
Книги
- Стюарт Рассел, Питер Норвиг. «Искусственный интеллект: современный подход». Главный университетский учебник с энциклопедическим охватом — от поиска и логики до обучения. Плотный, но остаётся эталоном.
- Мелани Митчелл. «Искусственный интеллект: руководство для думающих людей». Спокойный, честный рассказ без хайпа: что ИИ уже умеет и где его настоящие границы. Идеальный старт для неспециалиста.
- Макс Тегмарк. «Жизнь 3.0». О далёких последствиях и сценариях будущего с сильным ИИ. Широкими мазками, для размышления, а не для практики.
- Ник Бостром. «Сверхинтеллект: пути, опасности, стратегии». Строгий разбор рисков гипотетического сверхразума. Труднее и мрачнее, зато задаёт язык всей дискуссии о безопасности.
- Стюарт Рассел. «Совместимость: как искусственный интеллект и человек уживутся» (Human Compatible). Ведущий исследователь объясняет проблему управления ИИ и предлагает переосмыслить, как мы задаём машинам цели.
- Кай-Фу Ли. «Сверхдержавы искусственного интеллекта». Взгляд на гонку США и Китая и на экономические последствия — от инсайдера индустрии. Помните о его оптимистичном уклоне.
- Брайан Кристиан. «The Alignment Problem». Живая журналистика о том, как выравнивание стало центральной технической и этической проблемой. На английском.
- Иэн Гудфеллоу, Йошуа Бенджио, Аарон Курвилль. «Глубокое обучение» (Deep Learning). Для продвинутых: математический фундамент области. Потребует уверенного знания линейной алгебры и теории вероятностей.
Онлайн-курсы
- Эндрю Ын. «Machine Learning» и «Deep Learning Specialization» (Coursera, deeplearning.ai). Классика входа: понятно, с практикой, без лишней математики. С этих курсов начинали миллионы.
- fast.ai. «Practical Deep Learning for Coders». Подход «сверху вниз»: с первого урока обучаете рабочие модели, теория подтягивается по ходу. Для тех, кто уже умеет программировать.
- Стэнфорд CS231n (зрение) и CS224n (обработка языка). Университетские курсы с лекциями и заданиями в открытом доступе. Более академичны и глубоки — следующий шаг после базовых курсов.
Видео и каналы
- 3Blue1Brown, серия «But what is a neural network?». Наглядная визуальная интуиция того, как сеть устроена и учится. Лучшее первое знакомство «на пальцах».
- Андрей Карпати, «Neural Networks: Zero to Hero». Строим нейросеть и мини-GPT с нуля прямо в коде, шаг за шагом. Бесценно, чтобы понять устройство изнутри.
- Two Minute Papers. Короткие увлечённые обзоры свежих статей — удобно держать руку на пульсе.
- Computerphile. Короткие ролики, где исследователи объясняют конкретные идеи и алгоритмы простым языком.
Где следить за наукой
- arXiv.org (разделы cs.LG, cs.CL, cs.AI, cs.CV). Препринты появляются здесь раньше журналов; почти все прорывы сначала выходят именно тут.
- Конференции NeurIPS, ICML, ICLR (а также CVPR и ACL). Ключевые площадки области; труды и видеозаписи докладов открыты.
- Блоги лабораторий: DeepMind, OpenAI, Anthropic, Google AI, Meta AI. Разборы собственных работ понятным языком — но держите в уме их маркетинговый уклон.
- Distill.pub. Образцовые визуальные объяснения. Новые статьи не выходят, но архив по-прежнему один из лучших способов действительно что-то понять.
- Papers with Code. Статьи вместе с кодом и таблицами результатов на бенчмарках — удобно проверять, что заявлено на деле.
Практика
- Python. Язык по умолчанию для ИИ; начните с него, если ещё не владеете.
- PyTorch (а также TensorFlow и JAX). Основные фреймворки; в исследованиях сейчас доминирует PyTorch.
- Hugging Face. Хаб готовых моделей и датасетов и библиотека transformers — быстрый старт без обучения с нуля.
- Kaggle. Соревнования, открытые датасеты и чужие решения-ноутбуки. Лучший способ учиться на практике.
- Google Colab. Бесплатный доступ к GPU прямо в браузере — чтобы экспериментировать, не имея своего «железа».
Источники
Ссылки на первоисточники ключевых числовых и эмпирических утверждений — по главам.
Глава 1 — Что такое ИИ: истоки, определения, символьная эпоха
- Turing, A. M. «Computing Machinery and Intelligence». 1950. Mind, Vol. LIX, № 236 (Oxford University Press).
- McCarthy, J., Minsky, M., Rochester, N., Shannon, C. «A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence». 1955 (архив Дартмутского семинара, 1956).
- Newell, A., Simon, H. A. «Computer Science as Empirical Inquiry: Symbols and Search». 1976. Communications of the ACM (символьный ИИ, гипотеза о физических символьных системах).
- Feigenbaum, E. A. и др. Работы по экспертным системам (DENDRAL, MYCIN). Стэнфордский университет, 1970-е (expert systems).
Глава 2 — Машинное обучение и его виды
- Mitchell, T. «Machine Learning». 1997. McGraw-Hill (определения обучения с учителем / без учителя / с подкреплением).
- Sutton, R. S., Barto, A. G. «Reinforcement Learning: An Introduction». 2-е изд., 2018. MIT Press (обучение с подкреплением).
- LeCun, Y., Bengio, Y., Hinton, G. «Deep Learning». 2015. Nature, Vol. 521 (обзор глубокого обучения, self-supervised как направление).
Глава 3 — Нейрон, перцептрон, нейросеть
- McCulloch, W. S., Pitts, W. «A Logical Calculus of the Ideas Immanent in Nervous Activity». 1943. Bulletin of Mathematical Biophysics (искусственный нейрон).
- Rosenblatt, F. «The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain». 1958. Psychological Review, Vol. 65 (перцептрон).
Глава 4 — Обучение сетей: обратное распространение и градиентный спуск
- Rumelhart, D. E., Hinton, G. E., Williams, R. J. «Learning representations by back-propagating errors». 1986. Nature, Vol. 323 (обратное распространение ошибки).
Глава 5 — Компьютерное зрение: свёрточные сети, AlexNet, ImageNet
- LeCun, Y., Bottou, L., Bengio, Y., Haffner, P. «Gradient-Based Learning Applied to Document Recognition». 1998. Proceedings of the IEEE, Vol. 86 (свёрточные сети, LeNet).
- Krizhevsky, A., Sutskever, I., Hinton, G. E. «ImageNet Classification with Deep Convolutional Neural Networks» (AlexNet). 2012. NeurIPS (Advances in Neural Information Processing Systems).
- Russakovsky, O. и др. «ImageNet Large Scale Visual Recognition Challenge». 2015. International Journal of Computer Vision (ImageNet, ILSVRC).
Глава 6 — Последовательности: RNN и LSTM
- Hochreiter, S., Schmidhuber, J. «Long Short-Term Memory». 1997. Neural Computation, Vol. 9, № 8 (LSTM).
Глава 8 — Трансформеры и механизм внимания
- Vaswani, A. и др. «Attention Is All You Need». 2017. NeurIPS / arXiv:1706.03762 (архитектура «трансформер», self-attention, multi-head).
Глава 9 — Генеративные модели: GAN и диффузия
- Goodfellow, I. и др. «Generative Adversarial Nets» (GAN). 2014. NeurIPS.
- Ho, J., Jain, A., Abbeel, P. «Denoising Diffusion Probabilistic Models». 2020. NeurIPS / arXiv:2006.11239 (диффузионные модели).
Глава 10 — Большие языковые модели
- Brown, T. B. и др. «Language Models are Few-Shot Learners» (GPT-3). 2020. NeurIPS / arXiv:2005.14165 (LLM, предобучение, few-shot).
Глава 11 — Законы масштабирования
- Kaplan, J. и др. «Scaling Laws for Neural Language Models». 2020. arXiv:2001.08361 (OpenAI).
- Hoffmann, J. и др. «Training Compute-Optimal Large Language Models» («Chinchilla»). 2022. arXiv:2203.15556 (DeepMind).
Глава 12 — Эмерджентные способности
- Wei, J. и др. «Emergent Abilities of Large Language Models». 2022. Transactions on Machine Learning Research (TMLR) / arXiv:2206.07682.
- Schaeffer, R., Miranda, B., Koyejo, S. «Are Emergent Abilities of Large Language Models a Mirage?». 2023. NeurIPS / arXiv:2304.15004 (критический разбор: артефакт метрики).
Глава 14 — Рассуждающие модели и вычисления во время ответа
- OpenAI. «Learning to Reason with LLMs» (анонс o1). Сентябрь 2024. openai.com (обучение с подкреплением на цепочках рассуждений, масштабирование вычислений при выводе).
- OpenAI. Анонсы o3 / o3-mini и результаты на ARC-AGI и математических олимпиадах. Декабрь 2024 — 2025. openai.com; ARC Prize (arcprize.org).
- DeepSeek-AI. «DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning». 2025. arXiv:2501.12948 (открытая рассуждающая модель).
- OpenAI. Анонс GPT-5 (единая система с автоматическим выбором быстрого и «думающего» режимов). Август 2025. openai.com.
Глава 15 — Выравнивание и обучение с подкреплением на обратной связи
- Christiano, P. F. и др. «Deep Reinforcement Learning from Human Preferences». 2017. NeurIPS / arXiv:1706.03741 (истоки RLHF, reward model).
- Ouyang, L. и др. «Training language models to follow instructions with human feedback» (InstructGPT). 2022. NeurIPS / arXiv:2203.02155 (RLHF, SFT).
- Bai, Y. и др. «Constitutional AI: Harmlessness from AI Feedback». 2022. arXiv:2212.08073 (Anthropic).
Глава 16 — Интерпретируемость и механистическая интерпретируемость
- Olah, C. и др. «Zoom In: An Introduction to Circuits». 2020. Distill.pub (программа «Circuits»).
- Bricken, T. и др. / Anthropic. «Towards Monosemanticity: Decomposing Language Models With Dictionary Learning». 2023. Anthropic (transformer-circuits.pub).
Глава 18 — Предвзятость и справедливость
- Bolukbasi, T. и др. «Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings». 2016. NeurIPS (смещения в векторных представлениях слов).
- Buolamwini, J., Gebru, T. «Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification». 2018. Proceedings of Machine Learning Research (конференция FAccT).
Глава 22 — Масштаб вычислений, данные, стоимость обучения
- Sevilla, J. и др. «Compute Trends Across Three Eras of Machine Learning». 2022. arXiv:2202.05924 (Epoch AI).
- Epoch AI. Базы данных по training compute, параметрам и стоимости обучения моделей. Epoch AI (epochai.org).
- Stanford HAI. «Artificial Intelligence Index Report» — выпуски 2024 и 2025. Stanford Institute for Human-Centered AI (стоимость обучения, объёмы вычислений, тренды).
Глава 24 — Железо ИИ: чипы, литография, рынок ускорителей
- ASML Holding N.V. Годовой отчёт (Annual Report). ASML (EUV- и High-NA-литография, стоимость установок EUV/High-NA).
- Taiwan Semiconductor Manufacturing Company (TSMC). Годовой отчёт (Annual Report). TSMC (производство передовых техпроцессов).
- NVIDIA Corporation. Годовой отчёт (Form 10-K). NVIDIA / SEC (выручка сегмента дата-центров, ускорители).
- Jon Peddie Research; TrendForce. Отчёты о долях рынка GPU / ускорителей ИИ (оценки; методология и охват выборки различаются у разных провайдеров — цифры сопоставлять с осторожностью).
Глава 27 — Индустрия и инвестиции в лаборатории
- OpenAI; Microsoft. Официальные объявления о партнёрстве и инвестициях (openai.com, microsoft.com).
- Anthropic. Объявления об инвестициях Amazon и Google (anthropic.com; суммы — по сообщениям компаний и деловых изданий).
- OpenAI. Объявление о новой структуре: некоммерческий OpenAI Foundation и OpenAI Group PBC (public benefit corporation). Октябрь 2025 (openai.com).
Глава 31 — Труд, автоматизация, занятость
- Frey, C. B., Osborne, M. A. «The Future of Employment: How Susceptible Are Jobs to Computerisation?». 2013 (Oxford Martin School; опубликовано в 2017 в Technological Forecasting and Social Change).
- OECD. Оценки риска автоматизации рабочих мест в странах ОЭСР; OECD Employment Outlook. OECD Publishing.
- McKinsey Global Institute. «Jobs Lost, Jobs Gained: Workforce Transitions in a Time of Automation» (2017); «The economic potential of generative AI» (2023).
- Acemoglu, D., Restrepo, P. «Robots and Jobs: Evidence from US Labor Markets». 2020. Journal of Political Economy, Vol. 128.
Глава 34 — Прогнозы об общем ИИ (AGI)
- Grace, K. и др. «When Will AI Exceed Human Performance? Evidence from AI Experts». Опрос 2016 г., публикация 2018 (AI Impacts / JAIR).
- Grace, K. и др. «Thousands of AI Authors on the Future of AI». 2024. AI Impacts (опрос исследователей ИИ; сравнение с опросом 2022 г.).
- Metaculus. Прогнозные вопросы о сроках появления AGI (metaculus.com). Это агрегатор прогнозов сообщества, а не эмпирическое измерение — трактовать как коллективную оценку.
Глава 37 — Наука и признание: Нобелевские премии 2024
- The Nobel Prize in Chemistry 2024. NobelPrize.org: одна половина — David Baker (компьютерный дизайн белков); другая половина — Demis Hassabis и John Jumper (предсказание структуры белков, AlphaFold).
- The Nobel Prize in Physics 2024. NobelPrize.org: John J. Hopfield и Geoffrey E. Hinton (основополагающие работы по машинному обучению на искусственных нейросетях).
Глава 39 — Регулирование ИИ
- European Union. «Regulation (EU) 2024/1689 (Artificial Intelligence Act)». 2024. Official Journal of the EU / EUR-Lex.
- European Commission. Сроки вступления в силу и поэтапного применения AI Act, включая применение основной части регламента со 2 августа 2026 г. (digital-strategy.ec.europa.eu).
Предметный указатель
Ключевые термины и номера глав.