Перейти до вмісту

Machine Learning

Матеріал з K2 ERP Wiki

</syntaxhighlight>

Висновок

Dataset здатна містити: Data Science містить:

Validation потрібен для:

'''Underfitting''' — це ситуація, коли модель занадто проста й не вловлює закономірності. Machine Learning має окремі ризики безпеки. y,

'''Практична користь:''' cross-validation дає надійнішу оцінку моделі, ніж одна випадкова перевірка. * computer vision;
* speech recognition;
* machine translation;
* LLM;
* генеративного AI;
* text-to-image;
* text-to-video;
* recommendation systems;
* autonomous systems. Тип: classification. Приклади:

</div>

'''Критично:''' ML-система — це software system, тому вона потребує security review, access control, monitoring і захисту даних. Висока accuracy здатна бути оманливою, якщо класи незбалансовані. '''Приклад:''' якщо виступає як історія продукту клієнтів і відомо, хто купив ERP-продукт, модель здатна навчитися прогнозувати ймовірність покупки для нових клієнтів. * Linear Regression;
* Logistic Regression;
* Decision Tree;
* Random Forest;
* Gradient Boosting;
* K-Means;
* SVM;
* KNN;
* Neural Networks;
* Transformers.<div style="background:#fff7ed; border-left:6px solid #fb923c; padding:12px; margin:12px 0;">
  • data poisoning;
  • model stealing;
  • adversarial examples;
  • privacy leakage;
  • prompt injection у ML/AI-системах;
  • insecure model serving;
  • exposed model endpoints;
  • supply chain attacks;
  • unsafe generated code;
  • leakage через logs. Просте правило: модель потрібно перевіряти на даних, яких вона не бачила під час навчання. Ознаки overfitting:

Рекомендовано:

Explainability

Висновок: Generative AI — це сучасна й дуже помітна частина AI, але Machine Learning охоплює значно ширший набір задач. На відміну від класичного програмування, де розробник явно описує всі правила, у machine learning модель навчається на прикладах.=== Прогноз продажів ===

Практична роль: хороший ML-процес шукає баланс між overfitting і underfitting. Практична роль: explainability оптимізує не лише користувачам, а й розробникам знаходити помилки в моделі.

  • neural networks;
  • research;
  • computer vision;
  • NLP;
  • LLM;
  • custom architectures;
  • GPU training;
  • experiments;
  • production inference.== Monitoring ==

Target або цільова змінна — це те, що модель має навчитися передбачати. Головне правило: успішний Machine Learning — це не “найскладніша модель”, а правильні інформаційні дані, правильна задача, чесне оцінювання й контроль у production.== Unsupervised learning == Необхідно контролювати: інформаційні дані: перегляди, покупки, рейтинги, схожість товарів, поведінка. Приклади:

Algorithm

інформаційні дані: історія продукту продажів, сезонність, ціни, промо, складські залишки.== Типові сценарії використання ==

Reinforcement learning або навчання з підкріпленням — це підхід, де агент навчається діяти в середовищі через винагороди й покарання.== Відповідальне використання ML ==

  • versioning даних;
  • versioning моделей;
  • experiment tracking;
  • training pipelines;
  • deployment;
  • monitoring;
  • drift detection;
  • rollback;
  • model registry;
  • reproducibility;
  • CI/CD для ML;
  • governance;
  • security. # інформаційні дані очищуються й готуються.

Перевага: PyTorch часто обирають за гнучкість, зручність експериментів і популярність у research. Preprocessing здатна включати: Задача: знайти групи схожих клієнтів. * низька якість на train;

  • низька якість на test;
  • модель занадто проста;
  • недостатньо features;
  • поганий preprocessing;
  • неправильна постановка задачі. # Визначається задача.
  • збір даних;
  • очищення;
  • аналіз;
  • статистику;
  • візуалізацію;
  • machine learning;
  • інтерпретацію;
  • бізнес-висновки;
  • експерименти;
  • dashboards;
  • data storytelling.

Типові задачі:

Приклади використання:

  • чітко визначати задачу;
  • перевіряти якість даних;
  • вибирати правильну метрику;
  • тестувати модель;
  • перевіряти bias;
  • документувати модель;
  • контролювати explainability;
  • моніторити після запуску;
  • мати human review для важливих рішень;
  • дотримуватися приватності;
  • перевіряти юридичні вимоги;
  • не використовувати модель за межами її призначення. Приклади:

інформаційні дані: частота покупок, середній чек, категорії товарів, активність.== Див. так само ==

  • вибору моделі;
  • конфігурація гіперпараметрів;
  • порівняння алгоритмів;
  • виявлення overfitting;
  • оцінки стабільності;
  • вибору threshold;
  • перевірки preprocessing. Критично: data leakage здатна зробити метрики дуже високими, але модель буде погано працювати в реальному світі.
  • training data — для навчання;
  • validation data — для конфігурація;
  • test data — для фінальної перевірки. {| class="wikitable"
  • лінійною;
  • деревоподібною;
  • ансамблевою;
  • нейронною;
  • probabilistic;
  • kernel-based;
  • distance-based;
  • transformer-based.

Cross-validation — це метод оцінювання моделі на кількох розбиттях даних. Machine Learning застосовують, коли потрібно там, де важко або неможливо вручну описати всі правила. Machine Learning можна використовувати у різних сценаріях. * Large Language Models;

  • машинному перекладі;
  • text generation;
  • summarization;
  • code generation;
  • embeddings;
  • vision-language models;
  • multimodal AI;
  • генеративному AI. Monitoring — це спостереження за моделлю після впровадження.

Метрики: CTR, conversion rate, precision@k, recall@k.=== Виявлення аномалій ===

  • прогноз продажів;
  • прогноз відтоку клієнтів;
  • fraud detection;
  • recommendation engine;
  • customer segmentation;
  • document classification;
  • image recognition;
  • text classification;
  • sentiment analysis;
  • anomaly detection;
  • lead scoring;
  • demand forecasting;
  • predictive maintenance;
  • dynamic pricing;
  • risk scoring;
  • personalization.== Overfitting ==

Суть: precision відповідає на питання “наскільки точні позитивні прогнози”, а recall — “скільки потрібних випадків ми знайшли”. Training або навчання моделі — це бізнес-процес, під час якого модель підлаштовує свої параметри під інформаційні дані.== Data leakage ==

Machine Learning виступає як одним із інструментів Data Science.

Metrics

Scikit-learn — популярна Python-бібліотека для класичного machine learning.SEO title: Machine Learning — машинне навчання, моделі, алгоритми, дані, навчання, оцінювання і MLOps

SEO keywords: Machine Learning, машинне навчання, ML, штучний інтелект, AI, supervised learning, unsupervised learning, reinforcement learning, classification, regression, clustering, dataset, features, model training, validation, testing, metrics, overfitting, underfitting, neural networks, deep learning, scikit-learn, TensorFlow, PyTorch, JAX, MLOps, model deployment, data science

</noinclude>
 {{SEO
Шаблон для службового SEO-опису сторінки. 

}}


  • Logistic Regression;
  • Decision Tree;
  • Random Forest;
  • Gradient Boosting;
  • Support Vector Machine;
  • K-Nearest Neighbors;
  • Naive Bayes;
  • Neural Network. Алгоритми classification:
  • PCA;
  • t-SNE;
  • UMAP;
  • TruncatedSVD;
  • Autoencoders;
  • feature selection. Підказка: формулювання ML-задачі має містити тип задачі, інформаційні дані, target, метрику й спосіб перевірки результату. через Практична роль: dimensionality reduction користувачі можуть зробити складні інформаційні дані компактнішими й зрозумілішими. # Модель застосовується для для прогнозів.

Deep Learning

  • Python;
  • NumPy;
  • pandas;
  • scikit-learn;
  • TensorFlow;
  • PyTorch;
  • JAX;
  • XGBoost;
  • LightGBM;
  • CatBoost;
  • Hugging Face;
  • Ray;
  • MLflow;
  • Kubeflow;
  • Weights & Biases;
  • Apache Spark;
  • Dask. * spam або not spam;
  • клієнт ERP купить або не купить;
  • документ належить до категорії;
  • заявка ризикована або безпечна;
  • товар належить до групи;
  • зображення містить певний об’єкт;
  • користувач системи залишиться або піде. * зображень;
  • текстів;
  • аудіо;
  • відео;
  • speech recognition;
  • machine translation;
  • recommendation systems;
  • генеративного AI;
  • deep learning;
  • складних nonlinear задач. Найбільшу роль часто відіграють якість даних, постановка задачі, метрики, тестування й контроль після впровадження.

Перевага: машинне навчання дає можливість знаходити закономірності в даних там, де ручні правила були б занадто складними, неточними або дорогими в підтримці. * K-Means;

  • DBSCAN;
  • Agglomerative Clustering;
  • Mean Shift;
  • Gaussian Mixture Models;
  • Spectral Clustering.
  1. Збираються інформаційні дані.

Приклади:

Transformers використовуються в:

  • Документація Scikit-learn. Feature engineering — це створення корисних ознак із raw data.== Train/test split ==
  • neural networks;
  • production ML;
  • training;
  • inference;
  • mobile і edge deployment;
  • TensorFlow Lite;
  • TensorFlow Serving;
  • computer vision;
  • NLP. Правило: модель не повинна отримувати більше даних, ніж потрібно для задачі.
    </div>
    
    == Feature engineering ==
    
    == JAX ==
    
    '''Перевага:''' хороший preprocessing часто покращує модель сильніше, ніж перехід на складніший алгоритм.== Classification ==
    
    Тип: regression або time series forecasting.<div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
    Під час training модель:
    == Model deployment ==
    
    '''критично:''' deployment — це не кінець ML-проєкту. * feature importance;
    * SHAP;
    * LIME;
    * partial dependence;
    * counterfactual explanations;
    * interpretable models. Для regression використовують:
    
    '''Просте пояснення:''' embeddings перетворюють складний об’єкт на набір чисел, де схожі об’єкти мають близькі представлення. * Документація JAX. |-
    | Основна задача
    | Прогноз, класифікація, аналіз, виявлення закономірностей
    | Створення нового контенту
    |-
    | Результат
    | Клас, число, ймовірність, сегмент, anomaly score
    | Текст, код, зображення, відео, музика, голос
    |-
    | Типові моделі
    | Regression, trees, boosting, clustering, neural networks
    | LLM, diffusion models, audio/video generative models
    |-
    | Приклад
    | Прогноз відтоку клієнта
    | Написання статті або генерація зображення
    |}
    
    '''Data leakage''' — це ситуація, коли модель під час навчання отримує інформацію, якої не буде в реальному використанні. '''Accuracy''' — це частка правильних прогнозів. * змінилася поведінка клієнтів;
    * з’явився новий тип товару;
    * змінився ринок ERP в Україні;
    * змінилися канали продажів;
    * змінився інтерфейс збору даних;
    * змінилася сезонність. '''Професійний підхід:''' ML має допомагати приймати кращі рішення для бізнесу, але відповідальність за наслідки залишається за людьми й організацією. test_size=0.2,
    </div>
    
    <div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">
    
    </div>
    == Хороші практики Machine Learning ==
    === Прогноз відтоку клієнтів ===
    </div>
    == TensorFlow ==
    '''Просте пояснення:''' модель — це навчена платформа, яка перетворює вхідні інформаційні дані на прогноз або рішення для бізнесу. Embeddings використовуються для:
     X,
    !== Validation ==
    MLOps містить:
    '''Metrics''' — це показники якості моделі. * classification;
    * regression;
    * clustering;
    * preprocessing;
    * model selection;
    * metrics;
    * pipelines;
    * cross-validation. * навчання;
    * підбору гіперпараметрів;
    * вибору моделі;
    * частих експериментів;
    * ручного підлаштування рішення для бізнесу. '''Data drift''' — це зміна розподілу вхідних даних після запуску моделі.</div>
    
    * Linear Regression;
    * Ridge;
    * Lasso;
    * Decision Tree Regressor;
    * Random Forest Regressor;
    * Gradient Boosting Regressor;
    * Support Vector Regression;
    * Neural Network. Загальна схема machine learning така:
    Ці метрики важливі для:
    '''Небезпека:''' ML-проєкт здатна мати високі метрики в notebook, але бути марним у бізнесі через неправильну задачу, погані інформаційні дані або відсутність deployment-процесу.</div>
    
    <syntaxhighlight lang="text">
    
    <div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">
    
    * agent;
    * environment;
    * action;
    * state;
    * reward;
    * policy;
    * episode.</div>
    Форми deployment:
    
    Він застосовується для для:
    
    </div>
    
    <div style="background:#fff7ed; border-left:6px solid #fb923c; padding:12px; margin:12px 0;">
    
    * clustering;
    * dimensionality reduction;
    * anomaly detection;
    * pattern discovery;
    * grouping;
    * segmentation;
    * exploratory data analysis. * Документація TensorFlow.== Neural networks ==
    </div>
    </div>
    
    '''MLOps''' — це практики керування життєвим циклом ML-моделей у production. |-
    | Artificial Intelligence
    | Широкий напрям створення систем, які виконують задачі, пов’язані з інтелектом
    |-
    | Machine Learning
    | Підхід, де платформа навчається на даних
    |-
    | Deep Learning
    | Піднапрям ML на основі глибоких нейронних мереж
    |-
    | Generative AI
    | AI, який створює новий контент: текст, код, зображення, відео, музику
    |}
    
    </div>
    '''Explainability''' — це здатність пояснити, чому модель зробила певний прогноз. * Документація Hugging Face.== Dimensionality reduction ==
    
    інформаційні дані: активність, платежі, звернення в підтримку, історія продукту використання.</div>
    
    '''Machine Learning''' — це напрям штучного інтелекту, у якому моделі навчаються на даних і використовують знайдені закономірності для прогнозів, класифікації, рекомендацій, сегментації, аналізу й автоматизації. * прогноз ціни;
    * прогноз попиту;
    * прогноз витрат;
    * прогноз часу доставки;
    * оцінка доходу;
    * прогноз кількості замовлень;
    * передбачення температури;
    * оцінка ризику у вигляді числа. from sklearn.model_selection import train_test_split
    
    </div>
    <div style="background:#f0eaff; border-left:6px solid #8e44ad; padding:12px; margin:12px 0;">
    '''Dimensionality reduction''' — це зменшення кількості ознак або вимірів. '''Train/test split''' — це розділення dataset на training і test частини. * classification;
    * regression;
    * ranking;
    * прогнозування ймовірності;
    * scoring;
    * prediction.<div style="background:#eef2ff; border-left:6px solid #4f46e5; padding:12px; margin:12px 0;">
    Потрібно контролювати:
    інформаційні дані можуть бути:
    
    Приклади:
    
    '''критично:''' машинне навчання — це не лише вибір алгоритму.== Precision і Recall ==
    
    Типовий підхід:
    
    '''Практична роль:''' сучасний ML зазвичай будується не одним інструментом, а стеком: інформаційні дані, моделі, експерименти, deployment і моніторинг.</div>
    
    == Embeddings ==
    
    '''Model deployment''' — це впровадження моделі в робоче середовище. Приклади алгоритмів:
    Тип: clustering. * якість прогнозів;
    * data drift;
    * concept drift;
    * latency;
    * errors;
    * model confidence;
    * distribution changes;
    * business metrics;
    * fairness;
    * resource usage;
    * cost;
    * feedback loop.== Приклади задач ==
    !</div>
    Задача: передбачити, які клієнти можуть припинити користування сервісом. # Модель навчається на training data. * персональні інформаційні дані;
    * consent;
    * data minimization;
    * anonymization;
    * pseudonymization;
    * data retention;
    * доступи;
    * encryption;
    * logs;
    * model outputs;
    * training data governance. '''Суть різниці:''' AI — найширше поняття, ML — навчання на даних, Deep Learning — глибокі нейронні мережі, Generative AI — створення нового контенту.</div>
    
    Але accuracy здатна бути поганою метрикою, якщо:
    
    <div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
    
    == Preprocessing ==
    == Dataset ==
    '''Просте пояснення:''' dataset — це матеріал, на якому модель навчається розпізнавати закономірності. Поширені помилки:
    == Безпека Machine Learning ==
    '''критично:''' reinforcement learning складний у налаштуванні, тому що потрібно правильно визначити середовище, дії, винагороду й спосіб оцінювання.== Scikit-learn ==
    '''Neural networks''' або '''нейронні мережі''' — це клас моделей, натхненний ідеєю багатошарової обробки сигналів. * вік акаунта в днях;
    * середній чек;
    * кількість покупок за місяць;
    * день тижня;
    * сезонність;
    * співвідношення показників;
    * категорії з тексту;
    * агрегати по історії;
    * поведінкові метрики;
    * embeddings.<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">
    == Загальний SEO-опис ==
    
    <div style="background:#f0eaff; border-left:6px solid #8e44ad; padding:12px; margin:12px 0;">
    
    '''Algorithm''' — це метод, за яким модель навчається або робить прогноз. Поняття
    '''Overfitting''' — це ситуація, коли модель занадто добре запам’ятала training data і погано функціонує на нових даних. Accuracy зручна, коли класи збалансовані.<div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">
    
    * вхідні features;
    * target;
    * багато прикладів;
    * зв’язок між вхідними даними й відповідями. Вона застосовується для для:
    <syntaxhighlight lang="text">
    Для classification використовують:
    
    == Джерела ==
    
    </div>
    
    </div>
    
    * accuracy;
    * precision;
    * recall;
    * F1-score;
    * ROC AUC;
    * confusion matrix;
    * log loss. '''Приклад:''' якщо 99% заявок нормальні, модель, яка завжди каже “нормальна”, матиме 99% accuracy, але не буде корисною для пошуку шахрайства. Generative AI
    
    == Features ==
    
    Ознаки underfitting:
    <div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
    <div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">
    '''PyTorch''' — популярний фреймворк для deep learning. '''Практична роль:''' data drift здатна поступово зменшувати якість моделі, навіть якщо код не змінювався. # Модель покращується. Метрики: MAE, RMSE, MAPE.== Underfitting ==
    
    Задача: рекомендувати користувачу товари або контент. X_train, X_test, y_train, y_test = train_test_split(
    </div>
    <div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">
    
    <div style="background:#fff4e5; border-left:6px solid #f39c12; padding:12px; margin:12px 0;">
    
    '''Test set''' — це окремий набір даних для фінальної перевірки моделі. '''Практична роль:''' validation оптимізує зрозуміти, як модель функціонує не лише на даних, які вона бачила під час навчання. '''Практична роль:''' нейронні мережі особливо сильні там, де інформаційні дані складні: текст, зображення, звук, відео або великі embeddings. '''Clustering''' — це групування об’єктів за схожістю.== Machine Learning і Generative AI ==
    <div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">
    Dataset містить:
    
    Метрики: ROC AUC, recall, precision, business lift.</div>
    
    </div>
    
    Результат: список подій для перевірки.<div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">
    
    == Supervised learning ==
    ! '''Небезпека:''' overfitting створює ілюзію хорошої моделі, яка провалюється в реальному використанні.</div>
    
    Задача: знайти незвичні транзакції або події. Після запуску модель потрібно моніторити й оновлювати. ML часто функціонує з великими datasets, тому приватність критично важлива. '''Практична роль:''' features виступає як способом представити реальний об’єкт у вигляді даних, з якими здатна працювати модель. '''Суть target:''' це відповідь, яку модель повинна навчитися давати для нових даних.<div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">
    
    </div>
    
    * отримати стабільнішу оцінку якості;
    * зменшити залежність від одного split;
    * краще порівнювати моделі;
    * виявляти overfitting;
    * ефективніше використовувати невеликий dataset. * очищення даних;
    * заповнення пропусків;
    * scaling;
    * normalization;
    * encoding categorical variables;
    * видалення дублікатів;
    * роботу з outliers;
    * feature engineering;
    * text vectorization;
    * image resizing;
    * tokenization. PyTorch застосовується для для:
    Популярні інструменти:
    Приклади target:
    
    '''Precision''' показує, яка частка позитивних прогнозів справді правильна. '''Головна думка:''' Machine Learning дає можливість системам навчатися на даних і робити прогнози, але успішне сценарії використання потребує якісних даних, правильної постановки задачі, чесної оцінки, безпеки й людського контролю. '''Критично:''' модель, яка добре працювала під час запуску, здатна з часом погіршитися через зміну даних, поведінки користувачів або бізнес-процесів. '''Deep Learning''' — це піднапрям machine learning, який використовує глибокі нейронні мережі з багатьма шарами. '''Dataset''' — це набір даних, на якому навчається або перевіряється модель. Алгоритми clustering:
    <div style="background:#fff7ed; border-left:6px solid #fb923c; padding:12px; margin:12px 0;">
    == Accuracy ==
    
    </div>
    
    <div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">
    
    <div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
    
    * клієнт ERP купить або не купить;
    * ціна товару;
    * клас документа;
    * ймовірність відтоку;
    * категорія зображення;
    * кількість замовлень;
    * ризик несплати;
    * оцінка якості;
    * наступна дія користувача. Рекомендовано:
    
    Він оптимізує:
    
    </div>
    
    <div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
    
    * один клас трапляється дуже часто;
    * важливі помилки різного типу;
    * false positive і false negative мають різну ціну;
    * dataset незбалансований. Критерій
    <div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">
    
    == Training ==
    
    '''критично:''' метрика має відповідати бізнес-задачі. '''Критично:''' погані, неповні, упереджені або неправильно зібрані інформаційні дані можуть зробити модель некорисною, навіть якщо алгоритм обраний правильно. '''Validation''' — це перевірка моделі на даних, які не використовувалися безпосередньо для навчання.<div style="background:#fff4e5; border-left:6px solid #f39c12; padding:12px; margin:12px 0;">
    
    Це потрібно для:
    
    * research;
    * gradients;
    * optimization;
    * scientific computing;
    * neural networks через Flax, Haiku або Equinox;
    * accelerator-based computing;
    * custom ML experiments. інформаційні дані: транзакції, суми, час, поведінка, географія. * вік клієнта;
    * місто;
    * сума покупки;
    * кількість замовлень;
    * дата реєстрації;
    * категорія товару;
    * довжина тексту;
    * кількість входів у систему;
    * середній чек;
    * історія продукту платежів;
    * колір пікселя;
    * embedding документа. Якість даних впливає на якість моделі.</div>
    <div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">
    </div>
    '''Model''' — це математична структура або алгоритм, який навчається на даних і робить прогноз. * прогнозування попиту;
    * класифікація клієнтів;
    * рекомендації товарів;
    * виявлення шахрайства;
    * аналіз текстів;
    * розпізнавання зображень;
    * прогноз відтоку клієнтів;
    * оцінка ризиків;
    * сегментація користувачів;
    * автоматичне сортування документів;
    * прогноз ціни;
    * аналіз поведінки;
    * виявлення аномалій;
    * оптимізація бізнес-процесів. * Матеріали з Data Science, MLOps, model evaluation і responsible AI.<div style="background:#eef2ff; border-left:6px solid #4f46e5; padding:12px; margin:12px 0;">
    
    </div>
    
    '''Суть regression:''' модель повертає число, а не клас. JAX застосовується для для:
    '''Supervised learning''' або '''навчання з учителем''' — це підхід, коли модель навчається на прикладах із правильними відповідями. Значення
    Методи:
    '''Висновок:''' Data Science відповідає за роботу з даними загалом, а Machine Learning — за навчання моделей на цих даних.<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">
    
    <div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">
    </div>
    
    </div>
    == Target ==
    <div style="background:#fff7ed; border-left:6px solid #fb923c; padding:12px; margin:12px 0;">
    '''Практична роль:''' transformers стали однією з ключових технологій сучасного AI, зокрема LLM і генеративних моделей.</div>
    

Transformers

</syntaxhighlight>

Recall показує, яку частку реальних позитивних випадків модель знайшла.== Machine Learning і Data Science == Ризики:

Test set

Machine Learning потрібно використовувати відповідально. * ігри;

  • робототехніка;
  • оптимізація стратегій;
  • симуляції;
  • керування ресурсами;
  • рекомендаційні системи в окремих сценаріях;
  • autonomous systems.
{| class="wikitable"

* REST API;
* batch inference;
* streaming inference;
* embedded model;
* mobile deployment;
* edge deployment;
* cloud service;
* database scoring;
* real-time prediction;
* internal tool. '''інформаційні дані'''  основа машинного навчання.</div>
random_state=42

Тип: anomaly detection.== Як функціонує Machine Learning == Приклад: якщо виступає як інформаційні дані клієнтів, але немає готових сегментів, unsupervised learning здатна знайти групи схожих клієнтів. Приклади:

Reinforcement learning

Fairness — це справедливість і контроль того, щоб модель не шкодила окремим групам людей. * Довідкові матеріали щодо bias, fairness, explainability, privacy і ML security. Для старту: Scikit-learn часто виступає як найкращою першою бібліотекою для вивчення класичного machine learning. Нейронні мережі використовуються для:

інформаційні дані

  • preprocessing виконаний на всіх даних до split;
  • test set використаний під час вибору моделі;
  • у features потрапила майбутня інформаційні матеріали;
  • target випадково закодований у feature;
  • дублікати потрапили і в train, і в test;
  • статистики пораховані на всьому dataset. Алгоритми regression:
  • візуалізації;
  • зменшення шуму;
  • пришвидшення моделей;
  • стиснення даних;
  • пошуку структури;
  • роботи з високовимірними embeddings;
  • підготовки features. Features або ознаки — це вхідні характеристики, які модель використовує для прогнозу. Критично: якщо test set використовувати для підбору моделі, оцінка якості стане завищеною й нечесною. * Документація PyTorch. Задача: передбачити продажі та реалізація на наступний місяць.== PyTorch ==
  • висока якість на train;
  • низька якість на test;
  • надто складна модель;
  • нестабільність на нових прикладах;
  • модель запам’ятала шум. Суть clustering: модель сама шукає групи в даних без готових міток.

Приклади:

Generative AI зазвичай базується на machine learning і deep learning. Результат: сегменти для маркетингу або продукту.== MLOps ==

Machine Learning виступає як частиною ширшого поняття Artificial Intelligence. Regression — це задача передбачення числового значення. Приклади:

Типові задачі supervised learning:

'''Суть:''' algorithm — це спосіб навчання, а model — результат сценарії використання цього способу до конкретних даних.</div>
== Clustering ==
'''Transformers''' — це технічна архітектура нейронних мереж, яка стала основою багатьох сучасних мовних і мультимодальних моделей. * рядки;
* колонки;
* ознаки;
* цільову змінну;
* мітки класів;
* приклади;
* metadata;
* часові позначки;
* текстові поля;
* зображення або файли.=== Рекомендаційна платформа ===
<div style="background:#eef2ff; border-left:6px solid #4f46e5; padding:12px; margin:12px 0;">
<div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">
'''Unsupervised learning''' або '''навчання без учителя''' — це підхід, коли модель функціонує з даними без готових правильних відповідей.<div style="background:#fef2f2; border-left:6px solid #ef4444; padding:12px; margin:12px 0;">
== Типові помилки користувачів ==
<div style="background:#fff4e5; border-left:6px solid #f39c12; padding:12px; margin:12px 0;">

це напрям штучного інтелекту, у якому комп’ютерні системи навчаються знаходити закономірності в даних і використовувати їх; так само реалізовано класифікації, рекомендацій, виявлення аномалій, аналізу, автоматизації або прийняття рішень виступає ключовою рисою прогнозів забезпечується через '''Machine Learning''' або '''машинне навчання'''. '''Практична порада:''' найкраще починати ML-проєкт із задачі, де виступає як інформаційні дані, зрозуміла метрика й можливість перевірити результат. Machine Learning

'''Критично:''' ML-моделі, які впливають на людей, потрібно перевіряти на bias, fairness, прозорість і можливість оскарження рішення для бізнесу. # Якість перевіряється на validation або test data.<div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
== Cross-validation ==
'''Суть classification:''' модель вибирає категорію для нового об’єкта. '''Data Science''' ширше за machine learning. # Обирається модель або алгоритм. Приклади:

'''Основна ідея:''' у машинному навчанні платформа не отримує всі правила вручну, а вчиться на даних і потім застосовує знайдені закономірності до нових випадків.<div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">

* сегментація клієнтів;
* групування товарів;
* пошук схожих документів;
* кластеризація поведінки користувачів;
* групування географічних точок;
* пошук типових патернів. * semantic search;
* рекомендацій;
* clustering;
* RAG;
* similarity search;
* classification;
* пошуку дублікатів;
* порівняння текстів;
* multimodal search. '''Практична роль:''' TensorFlow корисний для масштабних deep learning і production-сценаріїв.<div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">
Приклад:

'''Суть training:''' модель поступово зменшує помилки на навчальних прикладах. Основні поняття:

'''Embeddings''' — це числові представлення об’єктів: текстів, зображень, товарів, користувачів або документів.<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">

Test set не можна використовувати для:

* отримує приклади;
* робить прогноз;
* порівнює прогноз із правильною відповіддю;
* обчислює помилку;
* змінює параметри;
* повторює бізнес-процес багато разів. ! '''Практична роль:''' feature engineering оптимізує моделі побачити корисні закономірності, які не лежать прямо в raw data. '''Classification''' — це задача передбачення класу або категорії.<div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">

== Приватність даних ==

* табличними;
* текстовими;
* числовими;
* категоріальними;
* часовими рядами;
* зображеннями;
* аудіо;
* відео;
* логами;
* транзакціями;
* поведінковими подіями;
* документами;
* сенсорними даними. Водночас якість ML-рішення залежить не лише від алгоритму, а й від даних, метрик, тестування, відсутності leakage, fairness, explainability, privacy, deployment і monitoring. У supervised learning dataset зазвичай містить вхідні інформаційні дані та правильні відповіді. * fraud detection;
* медичної діагностики;
* пошуку ризиків;
* moderation;
* security alerts;
* lead scoring;
* spam filtering. '''Суть MLOps:''' модель потрібно не лише навчити, а й безпечно, стабільно й контрольовано використовувати в реальному середовищі.<div style="background:#fff4e5; border-left:6px solid #f39c12; padding:12px; margin:12px 0;">
== Інструменти Machine Learning ==
Методи:

== Machine Learning і Artificial Intelligence ==

</div>

'''Preprocessing''' — це підготовка даних перед навчанням. Deep Learning лежить в основі:

* MAE;
* MSE;
* RMSE;
* R²;
* MAPE;
* median absolute error.== Тематичні мітки ==

Explainability важлива для:

== Bias і fairness ==

* нерівномірна якість для різних груп;
* дискримінація;
* історичні упередження в даних;
* неправильні proxy variables;
* непрозорі рішення для бізнесу;
* погана якість даних для меншин;
* непропорційні помилки. Модель здатна бути:
! # Результати моніторяться після впровадження.== Model ==

'''JAX''' — бібліотека для високопродуктивних числових обчислень, automatic differentiation і JIT-компіляції. '''Практична роль:''' JAX сильний там, де потрібні gradients, JIT, functional programming і високопродуктивні обчислення. * нечітка постановка задачі;
* погана якість даних;
* неправильна метрика;
* data leakage;
* overfitting;
* відсутність test set;
* відсутність monitoring;
* вибір складної моделі без потреби;
* ігнорування bias;
* недостатня документація;
* відсутність бізнес-інтерпретації;
* запуск у production без MLOps;
* використання моделі поза її призначенням. Приклади features:
<div style="background:#fef2f2; border-left:6px solid #ef4444; padding:12px; margin:12px 0;">

Regression

Тип: recommendation. * починати із простої baseline-моделі;

  • перевіряти інформаційні дані;
  • робити train/validation/test split;
  • використовувати cross-validation;
  • контролювати data leakage;
  • правильно вибирати метрики;
  • документувати features;
  • використовувати pipelines;
  • аналізувати помилки;
  • перевіряти bias і fairness;
  • моніторити модель після deployment;
  • мати rollback;
  • регулярно переоцінювати модель;
  • узгоджувати ML із бізнес-цілями.
  • кредитного скорингу;
  • медицини;
  • права;
  • HR;
  • security;
  • business decisions;
  • регуляторних вимог;
  • довіри користувачів;
  • debugging моделі. Суть Deep Learning: модель сама вчиться будувати складні внутрішні представлення даних, а не покладається лише на вручну створені ознаки. Machine Learning лежить в основі багатьох сучасних AI-систем: від простих predictive models до deep learning, генеративного AI, рекомендаційних систем, computer vision, NLP і AI-агентів. TensorFlow — фреймворк для machine learning і deep learning. )

Сегментація клієнтів