Я работаю с большим набором данных данных о тиках опционов (разрешение в 1 секунду) с 2019 года по настоящее время, и мне нужно руководство по созданию эффективной базы данных для приема и выполнения запросов.
Характеристики данных:
- Столбцы: Тикер, Дата, Время, LTP, BuyPrice, BuyQty, SellPrice, SellQty, LTQ, OpenInterest
- Я буду хранить только индексные данные (NIFTY, BANKNIFTY, SENSEX)
- Данные поступают ежедневно в виде файлов CSV (пакетный EOD) прием)
- Размер набора данных: уже миллионы строк в день и продолжает расти
- Загружать данные CSV ежедневно
- Сохранять отфильтрованные тиковые данные (только для выбранных предупреждений)
- Вычисление греков
- Создание цепочки опций для анализа
- Очень быстрый массовый прием
- Эффективность Запросы временного диапазона
- Быстрые агрегации (strike, option_type)
- Масштабируемость для больших наборов исторических данных
- Быстрая запросы обратного тестирования на больших данных
- Какова оптимальная структура схемы для этого типа данных опций временного ряда?
- Как следует структурировать:
- временную метку (отдельную или объединенную)
- секционирование (по дате/месяцу?)
- стратегия индексирования
- Какая база данных больше подходит для этой рабочей нагрузки?
- Есть ли рекомендации по эффективной обработке крупномасштабных финансовых тиковых данных?
Заранее спасибо!