Разработчик представила Yet Another English — PWA-сервис для изучения английского языка, который позволяет превращать видео с YouTube, статьи или файлы в готовые карточки для тренировки. Проект был создан за два месяца вечерней работы и использует гибридный подход: вместо того чтобы полагаться исключительно на возможности больших языковых моделей, сервис комбинирует классические алгоритмы и нейросети для минимизации затрат и повышения точности.

Воронка обработки данных вместо дорогих промптов

Основная идея сервиса заключается в использовании «воронки» обработки текста. Вместо того чтобы отправлять весь транскрипт видео в LLM (что дорого и нестабильно), система работает поэтапно. Сначала из субтитров извлекается текст, который проходит через бесплатные этапы очистки, лемматизации и фильтрации по частотности. Сначала сервис ищет переводы в собственной базе из 48 000 лексем, и только на финальном этапе, когда нужно обработать идиомы и фразовые глаголы, происходит один платный вызов LLM.

Такой подход позволяет избежать типичных проблем нейросетей: галлюцинаций в фактах и нестабильного формата JSON. В Yet Another English LLM не является источником фактов — формы слов, транскрипции и частотные ранги берутся из открытых датасетов, а нейросеть используется только для генерации контекстных примеров и пояснений, которых нет в базе.

Технологический стек и алгоритмы

Сервис работает полностью в браузере пользователя: данные, прогресс и интервалы повторений хранятся в IndexedDB. Для обучения используется алгоритм SM-2 (1987 года), который управляет интервальными повторениями. Чтобы избежать монотонности, система ротирует шесть типов упражнений: от классических карточек до подстановки слов в предложения и сборки слов из букв.

Техническая часть реализована на React (для PWA) и Node.js со SQLite на бэкенде. Для синхронизации данных между устройствами используется Яндекс ID. Также доступна версия приложения в RuStore.

Адаптивный тест и стоимость разработки

Для определения уровня пользователя (CEFR) в сервисе реализован адаптивный тест. Он не просто спрашивает уровень, а подмешивает слова разной сложности: правильные ответы усложняют задачу, а ошибки на «сложных полосах» снижают уровень через систему слов-ловушек. Это позволяет за две минуты подобрать оптимальную сложность обучения.

Благодаря тому, что основную нагрузку несут алгоритмы и готовые базы, стоимость генерации словаря составила всего около 10 долларов. При этом вся сгенерированная информация проходит ручную модерацию в админ-панели перед попаданием в общий доступ.