Apache Flink FileSkection очень медленное со многими горячими ведрами/путямиJAVA

Программисты JAVA общаются здесь
Anonymous
Apache Flink FileSkection очень медленное со многими горячими ведрами/путями

Сообщение Anonymous »

У меня есть задание Flink ETL, которая считывает по ~ 13 темам Kafka и записывает данные в HDF с использованием файловой связи с включенным уплотнением. Когда система занята, для компактных файлов может потребоваться ~ 7 минут. Это вызывает значительные задержки вниз по течению. < /P>
Из того, что я понимаю, координатор компакт -файлов файлов работает с фиксированной параллелизмом 1, и, кажется, является узким местом при управлении многими активными путями. Реплики, чтобы максимизировать пропускную способность. Затем данные протекают через основной DAG, который выполняет фильтрацию, обработку и обогащение, и записывается в файловую кишку, также работая по количеству слотов задач - параллелизм реплик. После писателей стадия CompactorCoordinator появляется в DAG с фиксированной параллелизмом 1, ответственной за задачи оркестровки уплотнения. Наконец, CompactorOperator выполняет фактические файловые уплотнения параллельно, опять же, используя количество слотов задач × реплики для его параллелизма.
Есть ли способ параллелизировать или масштабировать координатор устройства в файлах Flink?

Подробнее здесь: https://stackoverflow.com/questions/797 ... kets-paths

Вернуться в «JAVA»