ВЕДЫ

ВЕДЫ

Как устроена нейросеть: что происходит от запроса до ответа

Генеративный искусственный интеллект стал одним из главных технологических прорывов последних лет. Компании активно внедряют нейросети в свои продукты — от клиентских сервисов до разработки.


Создание большой языковой модели проходит несколько этапов: сбор и очистка данных, предобучение, дополнительная настройка под конкретные задачи и проверка качества ответов.


«ВЕДЫ» поговорили с Фёдором Минькиным, техническим директором фундаментальных моделей GigaChat, о том, как устроены большие языковые модели.


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Что внутри?


— Если объяснять человеку без технического образования: из каких частей состоит ИИ-модель?


— Сначала текст режут на кусочки — токены, этим занимается специальный элемент нейросети — токенизатор. Каждый кусочек превращают в эмбеддинг — набор чисел, который несёт смысл слова и его место в тексте.


Дальше эмбеддинги проходят через десятки одинаковых блоков подряд: в каждом из них токены обмениваются информацией, улавливая связи между словами даже на большом расстоянии друг от друга.


Затем данные попадают в MoE (Mixture of Experts. Дословно: «смесь экспертов» прим. ред.): механизм внутри модели подбирает для каждого кусочка подходящих экспертов из большого пула, а остальные в это время бездействуют. Так модель остаётся большой, умной и быстрой.


На финальном этапе выходной слой оценивает все слова, которые знает модель, и выбирает то, что вероятнее всего должно идти в тексте следующим. Это слово добавляется к тексту, и весь процесс запускается заново, пока ответ не будет готов целиком.


— Что происходит внутри модели, когда пользователь отправляет ей запрос?


— Модель получает не только сам текст, но и весь контекст диалога.


На основе всего этого она формирует своё «понимание» задачи — на практике это выглядит как предсказание наиболее вероятного и уместного продолжения разговора: модель не хранит готовые ответы в базе данных, а каждый раз заново генерирует текст слово за словом, опираясь на закономерности, которые усвоила во время обучения.


Если задача требует что-то сделать, – найти актуальную информацию в интернете, написать и выполнить код, то современные модели могут сами вызвать нужный инструмент, дождаться результата и уже с учётом него сформулировать финальный ответ.


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Чем большая языковая модель отличается от обычной программы


— Чем большая языковая модель отличается от обычной программы с заранее прописанными правилами?


— Классическая программа — это набор чётких правил, которые заранее прописал разработчик: если на входе такое условие — программа должна сделать определенное действие. Для ситуации, которая не описана в коде, программа просто не знает, что делать, и выдаёт ошибку.


Языковая модель работает иначе: правила её поведения не прописаны вручную — она выводит закономерности статистически, предсказывая наиболее вероятный ответ на основе миллиардов примеров текста, которые видела при обучении.


Из этого вытекает и главное практическое отличие: модель способна реагировать на вопросы и формулировки, которые никто заранее не предусмотрел, — улавливать смысл, а не только точное совпадение с шаблоном.


При этом её ответы менее предсказуемы, чем у классической программы: она может ошибаться, придумывать детали или по-разному отвечать на одинаковые вопросы.


— Что сильнее всего влияет на качество модели?


Первое — качество и состав обучающих данных: чем чище, разнообразнее и ближе к реальным задачам корпус текстов, тем лучше модель рассуждает.


Второе — механизм внимания: то, как модель сопоставляет между собой удалённые друг от друга части текста. Архитектура этого механизма определяет скорость: чем быстрее модель считает такие связи, тем быстрее она обрабатывает длинные документы и диалоги и выдаёт ответ, даже когда контекст разрастается до десятков тысяч токенов.


Третье — архитектура распределения вычислений внутри модели. Она позволяет наращивать общий объём «знаний» модели, не раздувая пропорционально расходы на каждый конкретный ответ. Это влияет не только на скорость, но и на то, сколько разных экспертных областей модель может закрыть одновременно.


Наконец, играет роль качество дополнительного обучения: как модель учили следовать инструкциям, работать с инструментами и агентными сценариями (многошаговые процессы, в которых ИИ-агент самостоятельно планирует последовательность действий – прим. ред.).


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Как «воспитывают» нейросеть


— Почему после базового обучения модель нужно дополнительно настраивать?


— После базового обучения модель ещё не умеет отвечать на вопросы — она умеет только продолжать текст. На «Привет» она с высокой вероятностью ответит так, как это бывает в интернете: репликой персонажа или похожим диалогом с форума, потому что на этом этапе её единственная задача — предсказывать наиболее вероятное продолжение текста.


Дополнительное обучение решает эту проблему в два шага. Сначала модели показывают десятки тысяч примеров диалогов «вопрос — ответ помощника», чтобы она освоила саму форму общения. А затем калибруют на человеческих предпочтениях — показывают, какие из правдоподобных ответов люди считают полезными и безопасными.


Без этого этапа модель осталась бы начитанным, но неуправляемым генератором текста, не умеющим направить свои способности на решение конкретной задачи пользователя.


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Почему нейросеть ошибается


— Бывали ли случаи, когда модель отвечала слишком неожиданно и её приходилось переобучать?


— В одной из ранних версий GigaChat Ultra 3.1 модель, запомнив, что человеку нравятся собаки, начинала добавлять этот факт вообще ко всем запросам на генерацию картинок. Независимо от того, что просил сгенерировать пользователь, на изображениях неизменно появлялись собаки.


Это пример того, как полезная функция может сработать слишком буквально и создать неожиданный побочный эффект. Проблему поправили в ближайшем обновлении.


Заранее предусмотреть все комбинации почти невозможно. Поэтому у разработчиков моделей есть постоянный цикл мониторинга и обратной связи: неожиданные паттерны в ответах отслеживают, а затем корректируют либо через дообучение модели, либо через точечные технические исправления.


— Можно ли сказать, что у модели появляется определённый «характер»?


— Смотря что вкладывать в слово «характер». Если иметь в виду устойчивый, узнаваемый стиль общения — да, он формируется: манера объяснять, уровень формальности, склонность уточнять вопрос или сразу давать развёрнутый ответ. Это результат обучения — какие диалоги показывали модели, как её калибровали через обратную связь асессоров, какие формулировки закладывали редакторы.


Эти паттерны воспроизводятся стабильно от диалога к диалогу, поэтому со стороны это читается как «характер». Так что правильнее говорить об устойчивом стиле ответов с гибкой адаптацией, а не о характере в человеческом смысле. У модели нет ни переживаний, ни убеждений, ни намерения понравиться человеку.


Конец

#Тренды

Как мусор становится роскошью?

Как мусор становится роскошью?

Как отходы становятся высокой модой, зачем это нужно и при чем здесь алюминий?


Рената Бабанина

Рената Бабанина

#ИИ

«Бросать вызов своим идеям»: data science-инженер из исследовательского центра "Авито" рассказал о главных навыках в 2026 г.

«Бросать вызов своим идеям»: data science-инженер из исследовательского центра "Авито" рассказал о главных навыках в 2026 г.

Как академический бэкграунд помогает расти и развиваться в бигтехе? Какой навык можно считать главным для DS-специалиста в 2026?


Екатерина Скляренко

Екатерина Скляренко

#Тренды

Экономика доверия: почему аудитории нужен человек

Экономика доверия: почему аудитории нужен человек

Что такое «экономика доверия» применительно к медиа


Рената Бабанина

Рената Бабанина

#Политика

Битва за Конгресс: что изменят промежуточные выборы в США?

Битва за Конгресс: что изменят промежуточные выборы в США?

3 ноября американцы будут определять «границы власти» Трампа. В США пройдут выборы в Конгресс


Анастасия Букреева

Анастасия Букреева

#ИИ

Все успеть: 5 промптов для нейросетей, которые облегчат учебу, работу и повседневные задачи

Все успеть: 5 промптов для нейросетей, которые облегчат учебу, работу и повседневные задачи

Нейросети уже давно перестали быть развлечением. Сегодня они помогают экономить время, структурировать информацию.


Рената Бабанина

Рената Бабанина

#Технологии

ИТЭР - лучик света в царстве санкций

ИТЭР - лучик света в царстве санкций

Разбираемся, что это такое, почему его не остановили ни санкции, ни распад СССР, и почему он навсегда может изменить всю мировую энергетику


Варвара Котова

Варвара Котова