Вийшов white paper про прискорення реплікації великих таблиць
Новий white paper описує паралельне читання, оптимізацію запису та хмарне завантаження для прискорення реплікації великих таблиць.
IEEE Spectrum і Wiley оприлюднили white paper, присвячений скороченню часу реплікації великих таблиць даних. Матеріал, спонсорований компанією CData, описує застосування паралельного читання розділених на частини даних, оптимізації запису та хмарного масового завантаження до сховищ даних.
Паралельне читання даних
Як повідомляє IEEE Spectrum, зі збільшенням корпоративних обсягів даних процеси реплікації, розраховані на менші навантаження, можуть переставати вкладатися у нічні пакетні вікна. У результаті завдання виконуються в робочий час, зростають затримки в оновленні даних і витрати на обчислення.
Паралельне читання передбачає поділ великої вихідної таблиці на діапазони рядків, які зчитуються одночасно в кількох потоках із використанням доступних ядер процесора. У документі зазначено, що це дає змогу скоротити час читання великих наборів даних.
Оптимізація запису та завантаження
Окремо розглянуто оптимізацію шляху запису на стороні цільової системи. Вона зменшує витрати на оброблення метаданих результатів і запис файлів. Найбільший ефект такий підхід може дати для широких таблиць із сотнями стовпців, оскільки операції для кожного стовпця повторюються під час роботи з файлами.
Описані методи доповнює хмарне масове завантаження: дані спершу готують як оптимізовані файли, а потім передають через нативний інтерфейс завантаження конкретного сховища. White paper також охоплює налаштування кількості та розміру розділів, методологію бенчмарків і результати вимірювань для поширених хмарних систем призначення.