No history yet

Фінтех та виявлення аномалій

Архітектура моніторингу в реальному часі

Системи виявлення шахрайства у фінансовій сфері працюють під величезним тиском. Вони повинні аналізувати мільйони транзакцій майже миттєво, адже кожна секунда затримки може коштувати значних грошей. Архітектура такої системи є багатоетапним конвеєром, де дані проходять через кілька ключових стадій.

  1. Збір даних: Все починається з потоку транзакцій. Кожна операція — купівля, переказ, зняття готівки — генерує дані: сума, час, місце, тип продавця, IP-адреса тощо.
  2. Інжиніринг ознак: Сирі дані перетворюються на значущі характеристики (ознаки), які модель може зрозуміти. Наприклад, система може розрахувати, як часто користувач здійснює покупки в певній країні або наскільки поточна транзакція відрізняється від його середнього чека.
  3. Застосування моделі: Ознаки подаються на вхід до моделі машинного навчання, яка оцінює ймовірність шахрайства для кожної транзакції.
  4. Прийняття рішень: На основі оцінки моделі система приймає рішення. Це може бути автоматичне блокування операції, надсилання запиту на додаткову верифікацію (наприклад, SMS-код) або просто позначка транзакції як підозрілої для подальшого аналізу людиною.

Головний виклик тут — баланс між точністю та швидкістю. Надто складна модель може бути точною, але повільною, пропускаючи шахрайські операції в реальному часі. Тому фінтех-компанії часто використовують ансамбль моделей, де простіші й швидші алгоритми відсіюють очевидні випадки, а складніші аналізують лише невелику частку підозрілих транзакцій.

Пошук невідомого за допомогою Isolation Forest

Шахраї постійно вигадують нові схеми. Навчання з учителем, яке покладається на історичні дані з відомими прикладами шахрайства, може не впоратися з абсолютно новими видами атак. Тут на допомогу приходять методи навчання без учителя, призначені для виявлення аномалій. Одним з найефективніших є (ізолюючий ліс).

Його ідея напрочуд проста: аномальні точки даних легше «ізолювати» від решти вибірки, ніж звичайні. Уявіть, що ви маєте натовп людей, і серед них є одна людина зростом 2,5 метри. Щоб знайти її, вам не потрібно детально вивчати кожного. Достатньо провести кілька випадкових розділень натовпу, і гігант дуже швидко опиниться сам.

Алгоритм працює схожим чином. Він будує безліч випадкових дерев рішень. У кожному вузлі дерево випадково обирає ознаку (наприклад, суму транзакції) і випадкове значення для розділення. Аномалії, що сильно відрізняються від норми, вимагатимуть значно менше таких розділень, щоб опинитися в окремій гілці. Вимірявши середню довжину шляху до ізоляції для кожної транзакції, модель може визначити, наскільки вона є аномальною.

Перевага Isolation Forest у тому, що він не потребує припущень щодо розподілу даних і ефективно працює з багатовимірними просторами ознак.

LSTM і пам'ять про минулі транзакції

Аналіз окремих транзакцій — це добре, але часто шахрайство є послідовністю дій. Наприклад, зловмисник може спочатку зробити кілька невеликих тестових покупок, щоб перевірити, чи картка активна, а потім здійснити велику крадіжку. Моделі, що аналізують транзакції ізольовано, можуть пропустити таку підготовку.

Для аналізу послідовностей і часових рядів чудово підходять рекурентні нейронні мережі, зокрема архітектура (Long Short-Term Memory). На відміну від стандартних нейронних мереж, LSTM мають внутрішню «пам'ять». Вони можуть зберігати інформацію про попередні події в послідовності та використовувати її для прийняття рішень щодо поточної.

У контексті виявлення шахрайства LSTM-мережа аналізує історію транзакцій користувача. Якщо поточна операція різко вибивається із засвоєного патерну поведінки (наприклад, серія покупок у нетипових місцях за короткий проміжок часу), модель позначить її як високоризикову. Це дозволяє виявляти складніші схеми, які неможливо побачити, дивлячись лише на одну транзакцію.

Lesson image

Незбалансовані дані: головний біль фінтеху

Однією з найбільших практичних проблем у виявленні шахрайства є сильна незбалансованість даних. Шахрайські транзакції — це дуже рідкісне явище. На мільйон звичайних операцій може припадати лише кілька десятків фродових. Для моделі машинного навчання це створює велику проблему.

Якщо модель просто навчиться завжди прогнозувати «не шахрайство», її точність (accuracy) буде надзвичайно високою, наприклад, 99.99%. Але така модель абсолютно марна, бо вона пропустить усі реальні загрози. Тому у фінтеху ніколи не покладаються на метрику точності. Натомість використовують інші показники.

МетрикаОпис
Precision (Точність)Яка частка транзакцій, позначених як шахрайські, є такими насправді? Висока точність означає мало хибних спрацьовувань.
Recall (Повнота)Яку частку реальних шахрайських транзакцій модель змогла виявити? Висока повнота означає, що модель пропускає мало фроду.

Між цими двома метриками існує компроміс. Підвищуючи повноту (намагаючись зловити більше шахраїв), ми зазвичай знижуємо точність (отримуємо більше помилкових блокувань звичайних клієнтів). Задача фінтех-інженерів — знайти оптимальний баланс.

Для боротьби з незбалансованістю класів застосовують спеціальні техніки. Наприклад, можна штучно збільшити кількість прикладів шахрайства у навчальній вибірці (oversampling), використовуючи такі алгоритми, як , або зменшити кількість звичайних транзакцій (undersampling). Це допомагає моделі приділяти більше уваги рідкісному, але важливому класу.

Quiz Questions 1/6

Який етап є першим у типовому конвеєрі системи виявлення шахрайства?

Quiz Questions 2/6

Яка основна ідея лежить в основі алгоритму Isolation Forest для виявлення аномалій?