Компьютерное зрение для ВКР: декодирование палимпсестов на примере Архимеда
Факт из статьи: в 1906 году рукопись Архимеда сфотографировали, в 1918 — потеряли, в 1998 — продали за миллионы, а в 2025 — нашли в каталоге провинциального музея. Для выпускника ИТ это не исторический курьёз, а готовая рамка для ВКР: как современные ML-методы (компьютерное зрение, сегментация, OCR) позволяют «увидеть» текст там, где человеческий глаз бессилен. Вы получаете защищаемый кейс с реальными данными, метриками и архитектурой — без абстрактных «умных домов».
Две темы ВКР, которые вырастают из истории с Архимедом
Статья даёт не просто сюжет, а три слоя актуальности: (1) реставрация повреждённых документов с помощью ML; (2) автоматизация каталогизации музейных фондов с NLP; (3) безопасность оцифровки (верификация подлинности). Ниже — две конкретные темы, которые легко пробивают нормоконтроль и имеют вычислимую эффективность.
Тема 1. Система реставрации утраченного текста на основе энкодер-декодер архитектуры
Цель: разработать модель сегментации и распознавания текста на изображениях палимпсестов (рукописей, где верхний слой частично скрывает нижний).
- Задачи: 1) Собрать датасет синтетических палимпсестов (наложение шума, деформации, выцветание); 2) Реализовать U-Net с Attention для сегментации верхнего и нижнего слоёв; 3) Обучить CRNN (свёрточная рекуррентная сеть) для распознавания древнегреческого/латинского текста; 4) Оценить IoU (Intersection over Union) ≥ 0,85 и CER (Character Error Rate) ≤ 5 %.
- Структура глав: Глава 1 — обзор методов реставрации (от фотографий 1906 года до современных ML-подходов). Глава 2 — архитектура системы: предобработка (OpenCV, CLAHE), модель сегментации, пайплайн распознавания. Глава 3 — результаты на тестовом наборе, сравнение с Tesseract и Google Vision.
Тема 2. Автоматическая каталогизация музейных рукописей с семантическим поиском (NLP + векторные БД)
Цель: разработать сервис, который по фотографии фрагмента рукописи находит ближайшие по содержанию тексты в каталоге (на примере эллинистических манускриптов).
- Задачи: 1) Парсинг открытых каталогов (Digital Vatican Library, Oxyrhynchus Online); 2) Распознавание фрагментов (OCR + дообучение BERT на древнегреческом); 3) Построение эмбеддингов через Sentence-BERT и FAISS для поиска; 4) Визуализация похожести через t-SNE и интерфейс на Streamlit.
- Структура глав: Глава 1 — проблема «утраченных рукописей»: как ML снижает время поиска с недель до секунд. Глава 2 — проектирование: ETL-конвейер, индексация, REST API. Глава 3 — метрики: Recall@10, MRR (Mean Reciprocal Rank).
Техническая глубина: что добавить в Главу 2 и Главу 3
Статья даёт исторический контекст, который можно вынести в Главу 1: «Палимпсест Архимеда — это классическая задача восстановления сигнала из шума. Решение 1906 года (фотография) и 2025 года (ML) — два полюса, между которыми — ваша работа». Конкретная архитектура для темы 1:
# псевдокод пайплайна для диплома
from tensorflow.keras import layers, Model
def unet_with_attention(input_shape=(256,256,3)):
inputs = layers.Input(input_shape)
# Encoder
conv1 = layers.Conv2D(64, 3, activation='relu', padding='same')(inputs)
pool1 = layers.MaxPooling2D(pool_size=(2,2))(conv1)
# ... глубже
# Attention gate между skip-connection
gating = conv4
skip = conv2
attention = layers.multiply([skip, layers.Dense(...)])
# Decoder
up6 = layers.UpSampling2D(size=(2,2))(conv4)
merge6 = layers.concatenate([up6, attention])
# ... выход + softmax
return Model(inputs, outputs)
Метрики для защиты: IoU (Jaccard index) для сегментации, CER/WER для распознавания. Обязательно табличное сравнение с базовыми моделями — это сразу закрывает вопрос «а почему не Tesseract?».
| Модель | IoU (верхний слой) | CER (греческий) | Время инференса |
|---|---|---|---|
| Tesseract 5 | 0.62 | 21.7% | 0.4 сек |
| Google Vision | 0.71 | 14.2% | 0.8 сек |
| Предложенная (U-Net+CRNN) | 0.88 | 4.9% | 1.2 сек |
Для диаграмм используйте BPMN (пайплайн обработки изображения) и C4 (контейнеры ML-сервиса: data ingestion → preproc → inference → result store).
Чему вы научитесь в процессе работы
- Проектировать ML-пайплайн от сбора данных до оценки качества (с пониманием bias-variance tradeoff);
- Настраивать аугментацию для исторических документов (выцветание, сгибы, пятна);
- Валидировать модели по метрикам IoU и CER — это закрывает вопросы ГОСТ 34 и ISO/IEC 25010 (эффективность, точность);
- Оформлять ТЗ на исследовательскую ВКР с ясными критериями приёмки (Acceptance Criteria);
- Упаковывать решение в Docker-контейнер для воспроизводимости — без этого работу могут завернуть на рецензии.
Часто задаваемые вопросы от студентов
Где взять датасет для такой ВКР? Ведь у меня нет рукописи Архимеда.
Используйте открытые коллекции: Digital Vatican Library, Gallica (BNF), Small Historical Manuscripts dataset (Kaggle). Для синтеза палимпсестов — накладывайте текст на текст через OpenCV с разными альфа-каналами и шумами. Это легитимно и описывается в Главе 2 как «метод аугментации».
В вузе требуют «программный продукт». Что считать продуктом — модель или сервис?
Рекомендую сделать REST API (Flask/FastAPI) для загрузки фото и получения размеченного текста. Это твёрдый артефакт. Приложите скриншоты Swagger-документации и Postman-тесты — защита пройдёт легче.
Мне говорят, что нейросеть — это «чёрный ящик». Как обойти нормоконтроль?
Добавьте в Главу 3 интерпретацию: Grad-CAM для сегментации, анализ ошибок (confusion matrix для символов), сравнение с эталоном. Это превращает модель из «чёрного ящика» в обоснованное решение.
Нужно ли считать экономическую эффективность?
Достаточно оценки TCO (Total Cost of Ownership): стоимость GPU-часов на обучение vs. стоимость ручной разметки папирусов экспертами. Разницу показываете в главе «Эффективность» — обычно 30–50 % экономии.
✅ Чек-лист: что проверить перед сдачей ВКР
- ✔ В Главе 1 есть ссылка на статью 2025 года (палимпсест Архимеда) как мотивацию задачи;
- ✔ Присутствует описание архитектуры в нотации C4 или UML (диаграмма компонентов);
- ✔ Метрики (IoU, CER) посчитаны на тестовой выборке и занесены в таблицу;
- ✔ Код опубликован в GitHub/GitLab с лицензией MIT и README (рецензент может скачать);
- ✔ Оформление соответствует ГОСТ 7.32-2017 (список литературы, ссылки на стандарты);
- ✔ Есть скриншоты работы интерфейса (даже если это консоль — вывод метрик и изображения);
- ✔ Уникальность текста ≥ 75% (антиплагиат вуза) — перефразируйте обзоры, цитируйте только методы.
⚠️ Типичные ошибки студентов в ML-ВКР
1. Игнорирование предобработки. Подают «сырые» фото палимпсестов в модель и получают шум. Решение: описать в Главе 2 цепочку CLAHE → размытие → пороговая бинаризация → удаление фона.
2. Переобучение на маленьком датасете. Студенты используют 50 изображений и гордятся точностью 99 %. На защите это разваливается. Решение: аугментация (минимум x10 от размера датасета) и кросс-валидация.
3. Отсутствие бейзлайна. Нет сравнения с существующими OCR-движками. Решение: включите в Главу 3 таблицу Tesseract, EasyOCR, Google Vision — и только потом свою модель.
Если у вас нет 120 часов на отладку пайплайна или вы не уверены в формулировках для нормоконтроля — наши специалисты готовы провести бесплатную консультацию по вашей теме. Поможем с доработкой любой ВКР — от выбора стека до финальной защиты.
Источник: Утраченная рукопись Архимеда. Мировая охота. Столетие поисков. А она чиллила в каталоге провинциального музея (опубликовано 2026-03-15)