Обо мне
Как 13 лет инженерного опыта привели к LLM-продуктам в продакшене — и почему AI-часть держится именно на этом фундаменте.
Я строю LLM-продукты, которые доходят до продакшена. С 2024 года это в основном BookahTranslate — AI-сервис перевода документов, который я сделал и веду в одиночку, с платящими подписчиками. Пайплайн работает на GPT-4 и Claude, обрабатывает PDF, EPUB и DOCX до 300+ страниц с сохранением вёрстки: парсинг, чанкинг, сборка контекста, перевод, пересборка документа.
Самое интересное в этой работе — никогда не промпт. Это автоматический фолбэк между провайдерами и моделями, когда один таймаутит или упирается в рейт-лимит; кэширование ответов и роутинг между моделями, чтобы держать стоимость инференса под контролем; и evaluation-набор, через который проходит каждое изменение промпта или модели — 80+ тестов на точность, релевантность, уровень галлюцинаций, задержку и стоимость, с автоматической регрессией.
Параллельно занимаюсь AI-внедрением для команд в финтехе, legal-tech и B2B SaaS: RAG над корпоративными базами знаний — чанкинг по границам предложений (~3 500 символов), гибридный поиск (векторный + лексический), откалиброванные пороги уверенности, которые держат долю неподтверждённых ответов ниже 10% на eval-наборе, — агентные архитектуры поверх кастомных MCP-серверов со строгими схемами вызова инструментов и многошаговыми циклами, и внедрение Claude Code, Codex и Cursor в командах клиентов с гейтами качества перед релизом.
Второй продукт, Digital Psychologist, — место, где я сравнил fine-tuning и retrieval напрямую: LangChain и FAISS для слоя поиска с локальными sentence-transformer эмбеддингами и три взаимозаменяемых режима — только поиск, дообученная модель и гибрид — переключаемые конфигурацией, чтобы компромисс можно было измерить на одном продукте, а не обсуждать теоретически.
Из этой работы выросли два open-source инструмента. pr-witness запускает тесты базовой ветки на коде pull request'а и сверяет заявления из описания PR с реальным прогоном — комбинация, которую CI не делает никогда, и способ проверять «все тесты проходят» от AI-агента, а не верить на слово. ftgate проверяет, получает ли дообученная малая модель те байты, на которых её учили; за первую неделю он измерил цену известной ошибки Ollama — схема инструмента доходит до модели в виде дампа Go-структуры — и нашёл, что в официальных GGUF Qwen зашит шаблон до фикса — оба случая отправлены авторам с замерами. Рядом — три отдельных демо: eval-харнесс с релизным гейтом в CI, MCP-сервер и RAG-пайплайн, который отказывается отвечать вместо того, чтобы выдумывать. Всё офлайн, с тестами и зелёным CI.
В основе всего этого — 13 лет инженерного опыта. Начинал в QA: ручное тестирование, потом руководство командой и автотесты на Python + Selenium — поэтому я думаю про edge-кейсы заранее и пишу тесты параллельно с кодом. Затем backend в Smart Trade (Германия), 3.5 года в Bequant (институциональная криптобиржа: торговый терминал на 10K событий/мин, GraphQL-слой, снизивший нагрузку на backend на 45%) и Coperniq, американский solar-SaaS, где я вёл команду из 4 инженеров, провёл миграцию монолита в микросервисы и снизил p50 API с 1.2с до 180мс.
Именно этот фундамент — причина, по которой AI-часть выдерживает нагрузку. Вызвать LLM API может кто угодно; сложность в том, чтобы это пережило встречу с реальными пользователями, реальными сбоями и реальным счётом за инференс.
Образование
- 2024 — Russian State Social University, Jurisprudence / Social services
- 2020 — RUDN University, Jurisprudence / Corporate Law
- 2015 — RUDN University, Mathematics and Computer Science
Языки
- Русский — родной
- Английский — C1, ежедневная работа
- Французский — A2