> DOU
middle
Центр Масштабування Технологічних Рішень700 USDAI Engineer
pythonpytorchhugging facelangchainllamaindexfaissdockermlops
kubernetescudavllmqlora
> full description
Шукаємо талановитого та мотивованого AI-спеціаліста, який зосередиться на розробці високопродуктивних та інтелектуальних агентних систем з ключовим фокусом на роботі з локально розгорнутими (on-premise) моделями з відкритими вагами. Ваша робота матиме вирішальне значення у впровадженні передових рішень, забезпечуючи максимальну безпеку, контроль даних та ефективне використання власних обчислювальних ресурсів.
🎯 Ключові обов’язки
- Розробка AI-агентів: Проектування, розробка та розгортання складних агентних систем на базі Open-Weight LLMs (наприклад, Gemma, Llama, Mistral, Falcon), здатних виконувати багатоетапні завдання.
- Впровадження RAG: Побудова та оптимізація систем Retrieval-Augmented Generation (RAG) для покращення точності та обґрунтованості відповідей, інтегрованих із локальною інфраструктурою даних.
- Дотренування (Fine-Tuning) Open-Weight моделей: Експериментування та застосування методів дотренування (наприклад, LoRA, QLoRA) для підвищення їхньої продуктивності у специфічних доменах.
- On-Premise Розгортання та Оптимізація: Управління життєвим циклом моделей, включаючи розгортання та оптимізацію роботи моделей з відкритими вагами.
- Дослідження та інновації: Відстеження актуальних трендів та новітніх архітектур в області Open-Source LLMs та локального розгортання.
🛠️ Вимоги до кандидата
- Досвід роботи: Мінімум 2+ роки досвіду в області Data Science, Machine Learning або AI/NLP.
- Програмування: Відмінне знання Python та бібліотек (PyTorch, Hugging Face, Transformers).
- Open-Weight LLMs: Глибоке розуміння архітектур та практичний досвід роботи з моделями з відкритими вагами (Llama, Mistral, Gemma).
- On-Premise MLOps: досвід роботи з MLOps інструментами для локального розгортання. Вільне володіння Docker та бажано знання Kubernetes або аналогічних систем оркестрації.
- Технології RAG: Практичний досвід роботи з фреймворками для RAG (LangChain/LlamaIndex) та Vector Stores (Faiss, ChromaDB) для локального розміщення.
- Оптимізація ресурсів: Розуміння оптимізації продуктивності та ефективності використання GPU для інференсу та дотренування (наприклад, знання CUDA, Triton, vLLM буде великим плюсом).
- Базові знання: Тверде розуміння основних концепцій ML та NLP.
✨ Буде плюсом
- Досвід роботи з алгоритмами квантування та дистиляції для оптимізації розміру моделі.
- Досвід налаштування та адміністрування локальних обчислювальних кластерів.