Skip to main content

Катастрофическое забывание (Catastrophic Forgetting)

ДЛЯ АГЕНТАChatGPTClaude

Фундаментальная проблема искусственных нейронных сетей, когда при обучении новой задаче или на другом языке обновленные весовые коэффициенты перезаписывают предыдущие связи, приводя к внезапной и полной утрате ранее приобретенных навыков.

1. Обзор концепции и системная проблема

Представьте шахматиста-гроссмейстера, который решил научиться играть в теннис. Он берет ракетку, тренируется месяц, выходит на корт... но когда возвращается к шахматной доске, вдруг обнаруживает, что вообще не помнит, как ходит конь или пешка.

Для человека это звучит абсурдно. Но для искусственных нейросетей это суровая инженерная реальность.

Катастрофическое забывание (Catastrophic Forgetting) — это явление, когда новые знания буквально вытесняют и стирают старые:

  • Все знания модели — это единое полотно взаимосвязанных чисел (весов).
  • Когда вы обучаете модель новой задаче, алгоритм корректирует эти числа.
  • Обновление под новую задачу может разрушить тонкие настройки, которые отвечали за другую навык.

Суть концепции проста: напоминание: нельзя просто «докинуть файл» в веса модели без риска сломать ее предыдущий разум.

2. Как новые знания стирают старые

┌─────────────────────────────────────────────────────────────┐
│                 КАТАСТРОФИЧЕСКОЕ ЗАБУВАНИЕ В ВЕСАХ          │
├─────────────────────────────────────────────────────────────┤
│ 1. СОСТОЯНИЕ МОДЕЛИ ПОСЛЕ PRE-TRAINING:                     │
│    Умеет писать на Python, знает историю, владеет английским │
├─────────────────────────────────────────────────────────────┤
│ 2. АГРЕССИВНОЕ ДОУЧЕНИЕ (Fine-Tuning без предохранителей):  │
│    Модели кормят только медицинскими выводами на французском │
│    ➔ Миллиарды весов перенастраиваются под новые слова      │
├─────────────────────────────────────────────────────────────┤
│ 3. РЕЗУЛЬТАТ ЧЕРЕЗ 5 ЧАСОВ:                                │
│    ✅ Блестяще разбирается во французской медицине          │
│    ❌ ПОЛНОСТЬЮ СЛОМАЛОСЬ программирование на Python!       │
└─────────────────────────────────────────────────────────────┘

3. Как современные лаборатории спасают модели от амнезии

  1. Замораживание весов (LoRA / PEFT): базовая модель вообще не изменяется. Новые знания записываются в отдельный крошечный файл-адаптер сбоку.
  2. Смешивание датасетов (Replay Buffer): к новым урокам постоянно подмешивают старые задания, чтобы модель «повторяла пройденный материал».
  3. Штрафы за изменение важных нейронов (Elastic Weight Consolidation): математика блокирует изменение тех коэффициентов, которые критически важны для базовой логики.

4. Практические инженерные сценарии в продакшене

01. Обучение модели на медицинских текстах

02. Использование метода LoRA для дообучения

03. Применение смешивания данных для предотвращения забывания

5. Подводные камни, типовые ошибки и безопасность

При работе с катастрофическим забыванием важно помнить о рисках, связанных с изменением весов. Неправильное применение методов Fine-Tuning может привести к полной утрате функциональности модели в других областях.

/ Частые вопросыSchema.org FAQPage

FAQ: Катастрофическое забывание (Catastrophic Forgetting)

Мозг человека обладает сложной многоуровневой пластичностью: у нас есть гиппокамп для быстрого временного запоминания и кора головного мозга для долговременной памяти. Изучая испанский язык, вы не забываете внезапно родной язык или умение кататься на велосипеде.
/ Внутренняя перелинковка
Все термины
Модели и Инференс

Тонкое дообучение (Fine-Tuning)

Процесс адаптации уже обученной большой модели к узкоспециализированной задаче или стилю с помощью небольшого качественного датасета (Supervised Fine-Tuning, SFT). Позволяет обучить ИИ медицинской терминологии, корпоративному тону или форматированию специфического кода за несколько часов.

Читать термин
Модели и Инференс

Переобучение (Overfitting)

Фундаментальная проблема машинного обучения: модель чрезмерно подстраивается под тренировочный датасет вместе с его специфическим шумом, теряя способность к генерализации (Generalization) на новых данных. Анализ дивергенции функций потерь, техник регуляризации и Early Stopping в коде.

Читать термин
Модели и Инференс

Предварительное обучение (Pre-training)

Начальный этап создания базовой большой языковой модели (Foundation Model). Процесс подачи нейросети триллионов слов из интернета, книг и кода на кластерах с тысячами видеокарт в течение месяцев за десятки и сотни миллионов долларов.

Читать термин