CData представила підхід до прискорення реплікації великих таблиць

CData представила підхід до прискорення реплікації великих таблиць

CData описала паралельне читання, оптимізацію запису та хмарне масове завантаження для реплікації великих таблиць.

Компанія CData у спонсорованому білому документі представила підхід до скорочення часу реплікації великих таблиць даних. Матеріал, який поширює IEEE Spectrum, описує використання паралельного читання розділених на частини даних, оптимізацію запису та хмарне масове завантаження до сховищ даних.

У документі зазначається, що зі зростанням корпоративних обсягів даних процеси реплікації, розраховані на менші навантаження, можуть не вкладатися в нічні пакетні вікна. Це збільшує розриви в актуальності даних і витрати на обчислення, а обмеження зміщується від самого обсягу даних до архітектури їх читання та запису.

 

Паралельне читання даних

 

Запропонований підхід передбачає поділ великої вихідної таблиці на секції за діапазонами рядків. Їх можна зчитувати одночасно в кількох потоках, використовуючи доступні ядра процесора. За описом авторів, це має скорочувати час читання великих наборів даних.

Окрему увагу приділено налаштуванню кількості та розміру секцій. Документ також розглядає повторювану конфігурацію для масштабних навантажень і застосування масового завантаження через нативні інтерфейси хмарних сховищ даних.

 

Оптимізація запису до сховищ

 

Оптимізація шляху запису має зменшувати витрати на обробку метаданих результатів і створення файлів на стороні цільової системи. Найбільший ефект, за твердженням у документі, очікується для широких таблиць із сотнями стовпців, адже операції для кожного стовпця повторюються під час роботи з файлами.

Технологія хмарного масового завантаження передбачає попереднє формування оптимізованих файлів і їх імпорт через власний механізм завантаження сховища, а не построковий запис. У матеріалі йдеться, що білий документ містить опис методології тестування та результати вимірювань для поширених хмарних цільових платформ.