У white paper описали способи прискорення реплікації великих таблиць

У white paper описали способи прискорення реплікації великих таблиць

White paper описує паралельне читання, оптимізацію запису та масове завантаження для прискорення реплікації великих таблиць.

IEEE Spectrum у партнерстві з Wiley представив white paper про прискорення реплікації великих таблиць даних. Матеріал, спонсорований CData, розглядає паралельне зчитування розділених на частини даних, оптимізацію запису та хмарне масове завантаження як способи скоротити час перенесення великих масивів між системами.

За матеріалами IEEE Spectrum, у документі пояснюється, що процеси реплікації, розраховані на менші обсяги, зі зростанням даних можуть перестати вкладатися в нічні пакетні вікна. У такій ситуації завдання виконуються в робочий час, зростають затримки оновлення даних і витрати на обчислювальні ресурси.

 

Паралельне читання даних

 

Один із запропонованих підходів полягає у поділі великої вихідної таблиці на секції за діапазонами рядків. Їх можна зчитувати одночасно в кількох потоках із використанням доступних ядер центрального процесора. Автори white paper зазначають, що це зменшує час читання великих наборів даних.

Окремо описано налаштування кількості та розміру розділів. Документ також присвячено формуванню повторюваної конфігурації для масштабних робочих навантажень і застосуванню масового завантаження до поширених хмарних сховищ даних.

 

Оптимізація запису

 

На стороні цільової системи автори пропонують оптимізувати шлях запису, аби скоротити витрати на обробку метаданих результатів і створення файлів. Найбільший ефект, за описом white paper, може бути для широких таблиць із сотнями колонок: операції для кожного стовпця повторюються під час кожного файлового запису.

Ще одним компонентом названо хмарне масове завантаження. Дані для нього спершу розміщують в оптимізованих файлах, а потім імпортують через власний інтерфейс завантаження сховища даних, замість запису рядок за рядком. У назві документа заявлено про прискорення реплікації на 76% за використання тієї самої інфраструктури; сам white paper обіцяє подати методологію бенчмарків і виміряні результати для поширених хмарних цільових систем.