각 GroupedDataSet에 대한 csv 파일에 대한 Apache Flink 출력
Oct 25 2020
groupedDataSet마다 csv로 출력하고 싶습니다.
데이터의 예 :
A,123
B,200
A,400
B,400
그래서 내 원하는 출력은 다음과 같습니다.
파일 1 :
A,123
A,400
파일 2 :
B,200
B,400
기본적으로 다음과 같은 간단한 코드입니다 exampleData.
exampleData.groupBy(0).sortGroup(1, Order.ASCENDING)
이제 각 groupedDataSet을 다른 CSV로 출력하고 싶습니다. 이를 달성하기위한 모범 사례는 무엇입니까?
Scala 버전 2.11.12 및 Flink 버전 1.11.0을 사용하고 있습니다.
답변
kkrugler Nov 02 2020 at 19:51
필요한 것은 버킷 팅 싱크이지만 현재는 일괄 처리가 아닌 스트리밍 작업에 대해서만 지원됩니다. Flink 1.12에는 일괄 및 스트리밍이 통합되어 있으므로 이론적으로는 작동 할 수 있습니다. 일괄 작업을 위해 고유 한 버킷 팅 싱크를 구현했지만 디버깅해야하는 최신 버전의 Hadoop에 몇 가지 문제가있는 것 같습니다.