Middle ML/LLM-Engineer / Data Scientist

Москва, Россия
Джуниор
Аналитика, Data Science, Big Data • Data scientist • Разработчик • Data Science • Machine Learning • Python • SQL
Удаленная работа • Частичная занятость
Опыт работы от 3 до 5 лет
260 000 ₽
Есть файл резюме (защищен)
О себе

На данный момент ML/LLM-Engineer / Data Scientist.

Мои компетенции и опыт

Обо мне

  • Имею более 3 лет коммерческого опыта разработки ML/DL-решений на Python в области классического машинного обучения и LLM/NLP.
  • Работал с LLM/NLP-задачами: проектирование и оптимизация RAG-систем — гибридный поиск (плотный + BM25 с объединением через RRF), chunking, reranking и суммаризация длинных документов; дообучение LLM методом LoRA/QLoRA; разработка и сопровождение баз знаний (эмбеддинги, векторные БД — Qdrant, ChromaDB); оптимизация качества ответов через prompt engineering, A/B-тестирование и LLM-as-a-judge.
  • Имею опыт полного цикла разработки ML-систем на табличных данных и временных рядах: анализ и подготовка данных (pandas, NumPy, SQL), feature engineering, обучение и валидация моделей (CatBoost, scikit-learn, PyTorch), оценка качества и вывод в продакшн — контейнеризация в Docker, оркестрация пайплайнов в Airflow, сервисный (API, FastAPI) и пакетный (batch) инференс.
  • Нацелен на разработку production-ready ML/LLM-решений и их внедрение в реальные продукты.

Мои основные достижения на прошлом месте работы (АО "Гринатом", 3 года 1 мес)

  • Разрабатывал модели оценки инвестиционной привлекательности компаний на основе финансовых показателей с использованием CatBoost, что позволило увеличить долю прибыльных сделок с 68% до 80% и повысить годовой ROI с 21% до 29%.
  • Построил полный ML-пайплайн подготовки данных: очистка, обработка пропусков, feature engineering, отбор признаков, удаление выбросов и подготовка данных для обучения моделей.
  • Вывел модель инвест-скоринга в продакшн: пакетный (batch) скоринг по расписанию через Airflow — DAG подготовки данных, расчёта признаков, предсказания и записи результатов для аналитиков; контейнеризация в Docker.
  • Разработал и сопровождал корпоративного LLM-чат-бота на базе LLaMA 3.3 70B (RAG) для автоматизации обработки внутренних запросов, включая собственный пайплайн формирования базы знаний RAG на основе кластеризации исторических диалогов операторов и пользователей (BERTopic) с ежемесячным обновлением через Airflow DAG; сервисы бота (API, retrieval, векторная БД) контейнеризованы в Docker. Реализовал методы улучшения retrieval — semantic chunking документации, parent-child retrieval, contextual retrieval и reranking, — что позволило повысить Recall#5 с 0,73 до 0,91, а MRR — с 0,57 до 0,78. Внедрение подняло уровень автоматизации до 80%.
  • Разработал RAG-ассистента по финансовым и инвестиционным отчётам: поверх тех же методов retrieval добавил гибридный поиск (плотный по Qdrant + BM25 по Elasticsearch) с объединением через RRF, grounded-суммаризацию длинных отчётов (map-reduce-refine) и LLM-маршрутизацию сценариев (вопрос-ответ / сводка по разделу / справка) — для точных ответов по длинным документам с указанием источника.
  • Дообучил LLaMA 3.3 70B методом QLoRA (Hugging Face Transformers, PEFT) на исторических диалогах операторов для корректной обработки доменного жаргона, аббревиатур и стабилизации формата ответов; оптимизировал качество ответов LLM посредством настройки промптов и параметров генерации, оценивая эффективность изменений через A/B-тестирование и LLM-as-a-judge (автоматическая оценка релевантности и качества диалога).
  • Стек: Python, SQL, PostgreSQL, PyTorch, scikit-learn, CatBoost (LightGBM/XGBoost), pandas, NumPy, RAG, LangChain, Qdrant, ChromaDB, Elasticsearch/BM25, RRF, reranking, semantic/parent-child/contextual retrieval, QLoRA, PEFT, BERTopic, Hugging Face/Transformers, vLLM, prompt engineering, FastAPI, Docker, Airflow, Git, Linux, Bash, A/B (permutation-тест, bootstrap), LLM-as-a-judge, математическая статистика.

telegram для связи: "d1mare"


Специализация
Аналитика, Data Science, Big DataData scientistРазработчикData ScienceMachine LearningPythonSQL
Отрасль и сфера применения

Уровень
Джуниор

Есть файл резюме (защищен)


Интересные кандидаты