Компьютерное зрение для ВКР: декодирование палимпсестов на примере Архимеда

Факт из статьи: в 1906 году рукопись Архимеда сфотографировали, в 1918 — потеряли, в 1998 — продали за миллионы, а в 2025 — нашли в каталоге провинциального музея. Для выпускника ИТ это не исторический курьёз, а готовая рамка для ВКР: как современные ML-методы (компьютерное зрение, сегментация, OCR) позволяют «увидеть» текст там, где человеческий глаз бессилен. Вы получаете защищаемый кейс с реальными данными, метриками и архитектурой — без абстрактных «умных домов».

Две темы ВКР, которые вырастают из истории с Архимедом

Статья даёт не просто сюжет, а три слоя актуальности: (1) реставрация повреждённых документов с помощью ML; (2) автоматизация каталогизации музейных фондов с NLP; (3) безопасность оцифровки (верификация подлинности). Ниже — две конкретные темы, которые легко пробивают нормоконтроль и имеют вычислимую эффективность.

Тема 1. Система реставрации утраченного текста на основе энкодер-декодер архитектуры

Цель: разработать модель сегментации и распознавания текста на изображениях палимпсестов (рукописей, где верхний слой частично скрывает нижний).

  • Задачи: 1) Собрать датасет синтетических палимпсестов (наложение шума, деформации, выцветание); 2) Реализовать U-Net с Attention для сегментации верхнего и нижнего слоёв; 3) Обучить CRNN (свёрточная рекуррентная сеть) для распознавания древнегреческого/латинского текста; 4) Оценить IoU (Intersection over Union) ≥ 0,85 и CER (Character Error Rate) ≤ 5 %.
  • Структура глав: Глава 1 — обзор методов реставрации (от фотографий 1906 года до современных ML-подходов). Глава 2 — архитектура системы: предобработка (OpenCV, CLAHE), модель сегментации, пайплайн распознавания. Глава 3 — результаты на тестовом наборе, сравнение с Tesseract и Google Vision.

Тема 2. Автоматическая каталогизация музейных рукописей с семантическим поиском (NLP + векторные БД)

Цель: разработать сервис, который по фотографии фрагмента рукописи находит ближайшие по содержанию тексты в каталоге (на примере эллинистических манускриптов).

  • Задачи: 1) Парсинг открытых каталогов (Digital Vatican Library, Oxyrhynchus Online); 2) Распознавание фрагментов (OCR + дообучение BERT на древнегреческом); 3) Построение эмбеддингов через Sentence-BERT и FAISS для поиска; 4) Визуализация похожести через t-SNE и интерфейс на Streamlit.
  • Структура глав: Глава 1 — проблема «утраченных рукописей»: как ML снижает время поиска с недель до секунд. Глава 2 — проектирование: ETL-конвейер, индексация, REST API. Глава 3 — метрики: Recall@10, MRR (Mean Reciprocal Rank).

Техническая глубина: что добавить в Главу 2 и Главу 3

Статья даёт исторический контекст, который можно вынести в Главу 1: «Палимпсест Архимеда — это классическая задача восстановления сигнала из шума. Решение 1906 года (фотография) и 2025 года (ML) — два полюса, между которыми — ваша работа». Конкретная архитектура для темы 1:

# псевдокод пайплайна для диплома
from tensorflow.keras import layers, Model

def unet_with_attention(input_shape=(256,256,3)):
    inputs = layers.Input(input_shape)
    # Encoder
    conv1 = layers.Conv2D(64, 3, activation='relu', padding='same')(inputs)
    pool1 = layers.MaxPooling2D(pool_size=(2,2))(conv1)
    # ... глубже
    # Attention gate между skip-connection
    gating = conv4
    skip = conv2
    attention = layers.multiply([skip, layers.Dense(...)])
    # Decoder
    up6 = layers.UpSampling2D(size=(2,2))(conv4)
    merge6 = layers.concatenate([up6, attention])
    # ... выход + softmax
    return Model(inputs, outputs)

Метрики для защиты: IoU (Jaccard index) для сегментации, CER/WER для распознавания. Обязательно табличное сравнение с базовыми моделями — это сразу закрывает вопрос «а почему не Tesseract?».

МодельIoU (верхний слой)CER (греческий)Время инференса
Tesseract 50.6221.7%0.4 сек
Google Vision0.7114.2%0.8 сек
Предложенная (U-Net+CRNN)0.884.9%1.2 сек

Для диаграмм используйте BPMN (пайплайн обработки изображения) и C4 (контейнеры ML-сервиса: data ingestion → preproc → inference → result store).

Чему вы научитесь в процессе работы

  • Проектировать ML-пайплайн от сбора данных до оценки качества (с пониманием bias-variance tradeoff);
  • Настраивать аугментацию для исторических документов (выцветание, сгибы, пятна);
  • Валидировать модели по метрикам IoU и CER — это закрывает вопросы ГОСТ 34 и ISO/IEC 25010 (эффективность, точность);
  • Оформлять ТЗ на исследовательскую ВКР с ясными критериями приёмки (Acceptance Criteria);
  • Упаковывать решение в Docker-контейнер для воспроизводимости — без этого работу могут завернуть на рецензии.

Часто задаваемые вопросы от студентов

Где взять датасет для такой ВКР? Ведь у меня нет рукописи Архимеда.

Используйте открытые коллекции: Digital Vatican Library, Gallica (BNF), Small Historical Manuscripts dataset (Kaggle). Для синтеза палимпсестов — накладывайте текст на текст через OpenCV с разными альфа-каналами и шумами. Это легитимно и описывается в Главе 2 как «метод аугментации».

В вузе требуют «программный продукт». Что считать продуктом — модель или сервис?

Рекомендую сделать REST API (Flask/FastAPI) для загрузки фото и получения размеченного текста. Это твёрдый артефакт. Приложите скриншоты Swagger-документации и Postman-тесты — защита пройдёт легче.

Мне говорят, что нейросеть — это «чёрный ящик». Как обойти нормоконтроль?

Добавьте в Главу 3 интерпретацию: Grad-CAM для сегментации, анализ ошибок (confusion matrix для символов), сравнение с эталоном. Это превращает модель из «чёрного ящика» в обоснованное решение.

Нужно ли считать экономическую эффективность?

Достаточно оценки TCO (Total Cost of Ownership): стоимость GPU-часов на обучение vs. стоимость ручной разметки папирусов экспертами. Разницу показываете в главе «Эффективность» — обычно 30–50 % экономии.

✅ Чек-лист: что проверить перед сдачей ВКР

  • ✔ В Главе 1 есть ссылка на статью 2025 года (палимпсест Архимеда) как мотивацию задачи;
  • ✔ Присутствует описание архитектуры в нотации C4 или UML (диаграмма компонентов);
  • ✔ Метрики (IoU, CER) посчитаны на тестовой выборке и занесены в таблицу;
  • ✔ Код опубликован в GitHub/GitLab с лицензией MIT и README (рецензент может скачать);
  • ✔ Оформление соответствует ГОСТ 7.32-2017 (список литературы, ссылки на стандарты);
  • ✔ Есть скриншоты работы интерфейса (даже если это консоль — вывод метрик и изображения);
  • ✔ Уникальность текста ≥ 75% (антиплагиат вуза) — перефразируйте обзоры, цитируйте только методы.

⚠️ Типичные ошибки студентов в ML-ВКР

1. Игнорирование предобработки. Подают «сырые» фото палимпсестов в модель и получают шум. Решение: описать в Главе 2 цепочку CLAHE → размытие → пороговая бинаризация → удаление фона.

2. Переобучение на маленьком датасете. Студенты используют 50 изображений и гордятся точностью 99 %. На защите это разваливается. Решение: аугментация (минимум x10 от размера датасета) и кросс-валидация.

3. Отсутствие бейзлайна. Нет сравнения с существующими OCR-движками. Решение: включите в Главу 3 таблицу Tesseract, EasyOCR, Google Vision — и только потом свою модель.

Если у вас нет 120 часов на отладку пайплайна или вы не уверены в формулировках для нормоконтроля — наши специалисты готовы провести бесплатную консультацию по вашей теме. Поможем с доработкой любой ВКР — от выбора стека до финальной защиты.

Материал подготовлен экспертами компании DiplomHelper. Мы помогаем студентам ИТ-специальностей с 2010 года. Если вам нужна помощь в разработке темы или оформлении работы — наши специалисты готовы подсказать.

Последнее обновление: 2026-07-24

Источник: Утраченная рукопись Архимеда. Мировая охота. Столетие поисков. А она чиллила в каталоге провинциального музея (опубликовано 2026-03-15)