SQL을 사용하여 Parquet 파일이 있는 폴더를 쿼리합니다.
Parquet은 자체 스키마를 가지고 있으므로 추측할 필요가 없습니다. 폴더에 대한 쿼리 스트림을 지정하면 모든 파일이 파일에 이미 선언된 정확한 열 이름과 데이터 유형을 가진 하나의 SQL 테이블로 변환됩니다. Spark, Python, 파일 업로드가 필요하지 않습니다.
SUM(순금액)
주문부터
국가별로 그룹화하세요;
Query Streams는 안전한 실시간 데이터베이스 통합 플랫폼이며, Parquet Folder 커넥터를 사용하면 .parquet 파일이 있는 폴더를 Microsoft Excel, Google Sheets, Airtable 및 AI 비서에서 쿼리할 수 있는 하나의 실시간 SQL 테이블로 변환할 수 있습니다. QueryStreams.com에서 더 자세히 알아보세요. 그리고 무료로 가입하세요 몇 분 안에 첫 번째 Parquet 폴더를 조회할 수 있습니다.
누군가 당신에게 Parquet 파일이 담긴 폴더를 주었습니다.
몇 가지 잘 알려진 경로 중 하나를 통해 도착합니다. 데이터 레이크 내보내기는 수백 개의 주식으로 구성됩니다. 파트-00000.파케트 파일. dbt나 Spark 작업이 출력을 어딘가에 저장하는데, 그 어딘가가 네트워크 폴더인 경우가 있습니다. 분석 팀이 추출 파일을 넘겨줍니다. 라이선스 갱신 비용이 비싸 보여서 데이터 웨어하우스 테이블을 디스크에 아카이빙했는데, 18개월 후에 누군가가 그 안에 무엇이 있었는지 알고 싶어 합니다.
불편한 점은 Parquet 형식이 사람이 읽기 어렵다는 것입니다. 더블클릭하면 .쪽매 세공 이 파일은 아무런 유용한 기능도 하지 않습니다. 텍스트 편집기로 열어보면 화면 가득 바이너리 데이터만 나옵니다. 이 문제를 물어보면 "Spark를 실행해 보세요" 또는 "파이썬 코드를 좀 작성해 보세요"라는 답변밖에 듣지 못하는데, 목요일에 재무 이사에게 실적을 보여주는 게 본업인 사람에게는 전혀 도움이 되지 않는 답변입니다.
그만큼 파켓 폴더 커넥터 가장 빠른 방법은 쿼리 스트림 에이전트를 사용하여 폴더를 지정하는 것입니다. 그러면 일치하는 모든 파일이 단일 SQL 테이블에 추가됩니다. 아무것도 변환되지 않고, 새 파일로 병합되지 않으며, 업로드되지도 않습니다. 파일은 원래 위치에 그대로 유지되며, 해당 위치에서 쿼리할 수 있습니다.
스키마는 이미 파일 안에 있습니다.
이것이 바로 Parquet을 다른 모든 폴더 유형과 구별 짓는 한 가지 사실이며, 이 커넥터가 실행될 때 아무런 문제도 발생하지 않는 이유를 설명해 주기 때문에 이해할 가치가 있습니다.
모든 Parquet 파일은 푸터로 끝납니다. 푸터는 열 이름, 정확한 데이터 유형, 각 열에서 null 값을 허용하는지 여부, 파일의 행 수 등을 명시하는 메타데이터 블록입니다. 이 푸터는 파일을 생성한 주체가 작성하며, 그 내용이 절대적인 기준이 됩니다. 이는 힌트나 관례가 아니라, 파일 자체의 내용 선언입니다.
따라서 커넥터가 폴더를 샘플링할 때 데이터 값을 검사하고 그로부터 결론을 도출하는 것이 아닙니다. 샘플링된 각 파일에 자신을 설명하도록 요청하고, 답변을 읽어 테이블 정의로 고정합니다. 데이터 유형은 다음과 같습니다. 선언됨 오히려 추론된즉, 표본 크기에 대해 걱정할 필요가 없으며, 만 번째 행이 처음 백 개의 행이 암시하는 바와 모순될 가능성도 없다는 뜻입니다.
유형 또한 변경 없이 그대로 유지됩니다. A 십진수(18,2) 파일의 해당 열은 테이블에서 소수점 열이며, 부동 소수점 근사값이 아닙니다. 값이 입력되는 과정에서 문자열을 거치지 않기 때문입니다. 폴더 스캔, 파일 원장, 암호화된 로컬 캐시, 관리 테이블 등 이 제품군의 나머지 모든 기능은 설명된 대로 정확하게 작동합니다. 파일 세트 커넥터의 작동 방식다음은 파르케트와 다른 점만 간략하게 설명합니다.
절대 논쟁할 필요가 없는 것들
장점을 가장 명확하게 확인하는 방법은 바닥글이 없는 동일한 작업인 CSV와 비교하는 것입니다. 모든 것이 똑같습니다. CSV 폴더 커넥터 Parquet에서는 탐지하고, 동의하고, 방어해야 한다는 점이 간단하게 처음부터 명시되어 있습니다.
| 질문 | CSV 폴더 | 파케트 폴더 |
|---|---|---|
| 이 문자의 인코딩 방식은 무엇입니까? | 파일별로 감지되며, 혼합 인코딩은 허용되지 않습니다. | 해당 문제는 발생하지 않습니다. 텍스트는 포맷 자체에서 UTF-8로 저장됩니다. |
| 쉼표, 세미콜론, 탭 또는 파이프? | 냄새를 맡아봤고, 폴더 전체에서 동일해야 합니다. | 발생하지 않습니다. Parquet은 구분된 텍스트가 아닙니다. |
| 첫 번째 행이 헤더인가요? | 만약 그렇지 않다면 위치 열을 사용하는 옵션이 있습니다. | 열 이름은 바닥글에 있습니다. |
| 이 열은 숫자입니까, 아니면 텍스트입니까? | 샘플링된 값으로부터 추론되었습니다. | 파일에 의해 선언되었습니다. |
| 금액은 정확하게 유지될까요? | 네, 하지만 이는 커넥터가 소수점 열을 정확하게 식별하고 고정하기 위해 다소 복잡한 과정을 거치기 때문입니다. | 파일의 소수점은 표의 소수점과 같습니다. 따로 지적할 사항은 없습니다. |
~이다 03/04/2026 3월 아니면 4월? |
명시적인 설명이 필요할 수 있습니다. 날짜 형식. |
날짜는 텍스트가 아닌 날짜 형식으로 저장됩니다. |
| 이 파일에는 행이 몇 개 있습니까? | 읽어봐야만 알 수 있다. | 바닥글에 무료라고 적혀 있습니다. |
따라서 설정할 수 있는 옵션이 적습니다. CSV 폴더 커넥터는 구분 기호, 따옴표 문자, 헤더 전환, 인코딩, 빈 문자열, 날짜 형식 및 레이아웃 모드를 제공합니다. 이는 텍스트 파일의 경우 이러한 요소들이 불확실하기 때문입니다. 반면 Parquet 폴더 커넥터는 파일 자체가 이미 답을 제공하기 때문에 이러한 설정 옵션이 없습니다. Parquet 폴더 커넥터에 필요한 설정은 아래에 나열되어 있습니다.
일부 파일에만 있는 열
Parquet 파일 폴더는 한 번에 모두 기록되는 경우가 드뭅니다. 파이프라인에 3월에 새로운 필드가 추가되면 3월 이후 파일에는 1월 파일에는 없는 열이 생깁니다. 커넥터가 내려야 하는 유일한 판단 기준이 바로 이것이며, 커넥터는 특정한 방식으로 이를 수행합니다.
고정된 테이블은 다음과 같습니다. 노동 조합 샘플링된 파일 전체에서 발견되는 열을 기준으로 하며, 교집합을 기준으로 하지 않습니다. 일부 파일에만 나타나는 열도 테이블에 포함되지만, 단순히 null 허용으로 표시되며 다음과 같이 읽힙니다. NULL 그 이전 파일들의 경우, 나중에 추가된 열이 손실되는 대신 폴더의 모든 열이 유지됩니다.
칼럼이 없어진 허용됩니다. 열이 있는 경우 다른 유형 그렇지 않습니다. 만약 주문 ID 한 파일에는 64비트 정수가 있고 다른 파일에는 텍스트가 있는 경우, 커넥터는 전혀 고정을 거부하고 불일치를 정확하게 명시합니다. 즉, 어느 열, 어느 유형, 어느 두 파일에서 불일치가 발생하는지 알려줍니다. 커넥터는 어느 한쪽을 선택하지 않으며, 숫자를 맞추기 위해 한 유형을 다른 유형으로 조용히 변환하지도 않습니다.
.쪽매 세공 다른 항목에 대한 확장자 - 이 경우 사유가 기록되고 샘플은 나머지 파일로 계속 진행됩니다. 단, 다음과 같은 경우에만 해당됩니다. 없음 샘플링된 파일 중 읽을 수 있는 파일이 있으면 커넥터가 읽기를 거부하고, 각 파일에서 발견된 오류를 나열합니다.
코로 냄새 맡는 건 싸다. 왜냐하면 아무것도 읽지 않으니까.
쿼리 스트림 샘플 최대 64개 파일 폴더에 처음 연결할 때 발생하는 작업입니다. CSV 파일의 경우 64개의 파일을 열고 구문 분석해야 합니다. Parquet 파일의 경우 64개 파일의 끝으로 이동하여 메타데이터 블록을 읽으면 되는데, 각 파일의 크기가 수백 메가바이트에 달하더라도 이는 매우 간단한 작업입니다.
동기화 과정에서도 동일한 방식이 효과적입니다. 각 파일의 행 수는 데이터를 건드리지 않고 바닥글에 표시되므로, 커넥터는 파일이 파일별 행 제한을 초과할지, 그리고 전체 동기화가 행 예산을 초과할지 여부를 미리 알 수 있습니다. 따라서 커넥터는 동기화를 거부하고 제한 값을 지정할 수 있습니다. ~ 전에 문제가 있는 파일은 테이블에 기록되므로, 작업 도중에 문제를 발견하고 부분적으로만 로드되는 상황을 방지할 수 있습니다.
| 난간 | 기본 | 최고 |
|---|---|---|
| 커넥터당 파일 수 | 100,000 | 2,000,000 |
| 폴더 깊이 | 8개 레벨 | 64개 레벨 |
| 파일 하나의 크기 | 512MB | 4GB |
| 임의의 파일에서 가져온 행 | 2,000,000 | 50,000,000 |
| 동기화당 행 수 | 10,000,000 | 100,000,000 |
| 스캔 시간 예산 | 300초 | 3,600초 |
파일 크기는 단 한 바이트라도 이동하기 전에 가장 먼저 확인됩니다. 크기 제한을 초과하는 파일은 이름으로 인해 거부되고, 나머지 폴더의 파일들은 해당 파일을 제외하고 동기화됩니다.
모든 행은 파일 내에서 자신의 위치를 알고 있습니다.
다른 모든 파일 세트 커넥터와 마찬가지로 각 행에는 다음이 포함됩니다. _소스_파일 해당 파일이 속한 열의 이름과 a _row_id 테이블 전체에서 유일한 항목입니다. Parquet 폴더에서, _row_id 그것보다 낫다: 마루 바닥 독자들은 진정한 모습을 드러낸다 파일 행 번호따라서 식별자는 파일 이름과 파일 내 해당 행의 실제 순서 위치를 더하고 12자리 숫자로 0을 채워서 생성됩니다.
패딩이 핵심입니다. 정렬 기준 _row_id 행을 1, 10, 100, 2 순서가 아닌 파일 순서대로 정렬하며, 12자리 숫자만으로도 단일 파일에 수조 개의 행이 있더라도 이 순서를 유지할 수 있어 어떤 제한도 충분히 초과할 수 있습니다. CSV에는 이와 유사한 개념이 없으므로, 열 형식은 단순히 편의를 제공하는 것 이상의 추가적인 이점을 제공합니다.
SELECT _source_file, COUNT(*) AS row_count, SUM(net_amount) AS net_amount FROM orders GROUP BY _source_file ORDER BY net_amount DESC;
또한 행 식별자가 순서대로 되어 있기 때문에 전체 폴더를 읽지 않고도 특정 파일의 시작 부분을 볼 수 있습니다. 이는 파티션이 의심스러워 보일 때 그 안에 실제로 무엇이 있는지 확인하려는 경우에 유용합니다.
SELECT _row_id, order_id, order_date, net_amount FROM orders WHERE _source_file = 'part-00042.parquet' ORDER BY _row_id LIMIT 20;
파일이 핀과 더 이상 일치하지 않을 때
일단 모양이 고정되면, 들어오는 모든 파일은 그 모양과 일치하는지 검사됩니다. 이 검사는 데이터 읽기가 아닌 푸터 읽기이므로, 모든 파일에 대해 매번 수행할 수 있을 만큼 비용이 저렴합니다. 더 이상 일치하지 않는 파일은... 주차됨해당 행은 테이블에서 제외되고, 그 이유는 기록되며, 나머지 폴더는 정상적으로 동기화됩니다.
의견 불일치를 나타내는 네 가지 요소가 있는데, 그중 세 번째 요소는 사람들을 놀라게 하므로 각각 따로 알아두는 것이 좋습니다.
- 타입이 바뀌었습니다. 해당 열은 존재하지만, 바닥글에서 고정된 열과는 다른 이름으로 표시되고 있습니다.
- 필수 열이 사라졌습니다. 핀이 null 허용 안 함으로 표시한 열이 파일에 없습니다.
- 파일에서 이전에 있던 열이 삭제되었습니다. 고정된 열이 null 허용인 경우에도 파일은 했다 해당 폴더를 샘플링할 당시에는 해당 열이 존재했지만 이후에는 더 이상 존재하지 않게 된 경우, 해당 열의 값은 null로 읽히지 않고 그대로 유지됩니다. 만약 null로 읽히게 되면 해당 열을 기반으로 계산된 모든 합계가 조용히 잘못될 수 있으며, 잘못된 합계는 파일이 누락되는 것보다 더 심각한 문제를 야기할 수 있습니다.
- 새로운 칼럼이 추가되었습니다. 핀이 한 번도 본 적이 없고 제외하지도 않은 열은 파일을 조용히 삭제하는 대신 임시로 보관합니다.
파일을 다시 읽으면 행이 추가되는 것이 아니라 기존 행이 대체됩니다. 이전에 파일에 추가된 내용은 모두 제거되고 현재 내용이 하나의 트랜잭션으로 삽입되므로, 파티션을 다시 작성하는 과정에서 오류가 발생하더라도 중복 항목이 남거나 테이블이 부분적으로만 업데이트되는 문제가 발생하지 않습니다.
마루 바닥의 모든 설정과 변경 시점
이 카드에 대해 가장 유용한 점은 바로 이것이라는 것입니다. ~ 아니다 그 위에. Parquet 폴더 커넥터에는 형식별 설정이 전혀 없습니다. CSV 폴더에는 구분자, 따옴표, 인코딩, 빈 문자열, 날짜 형식이 있습니다. Excel 폴더에는 시트 목록이 있고, JSONL 폴더에는 평면화 깊이가 있습니다. 하지만 Parquet에는 이러한 구분자가 전혀 없는데, 그 이유는 푸터 때문입니다. 스키마가 모든 파일 내부에 선언되어 있으므로 커넥터에 알려줄 정보도 없고 커넥터가 추측할 필요도 없습니다. 따라서 "어떤 옵션을 잘못 선택했을까?"라는 문제가 발생하지 않습니다.
남은 것은 짧은 목록뿐입니다. 그 외의 모든 것은 다음과 같습니다. 연결 탭 — 루트 폴더, 하위 폴더 스캔 및 최대 깊이, 제외 패턴, 심볼릭 링크 따라가기, 파일 이름 구문 분석 패턴, 폴더 토큰 이름, 스캔 간격, 콘텐츠 해싱, 삭제 정책, 이벤트 로그 보존 및 스캔 가드 레일 — 모든 폴더 유형에서 동일하게 작동하며 한 번만 전체 내용이 문서화되어 있습니다. 파일 세트 커넥터 가이드이 섹션에서는 Parquet 파일 폴더에 특정한 내용만 다룹니다.
테이블 이름
필수의. Parquet은 단일 테이블 드라이버입니다. 포함된 모든 파일의 패턴이 하나의 테이블로 통합되며, SQL에서 해당 테이블의 이름이 바로 이것입니다. 주문, 이벤트, 여행폴더에 실제로 무엇이 들어 있든 상관없이 문자, 숫자 및 밑줄만 사용할 수 있으며 숫자로 시작할 수 없습니다. 이러한 형식을 벗어나는 문자는 동기화 시점이 아닌 저장 시점에 거부됩니다.
이름을 신중하게 선택하세요. 저장된 모든 쿼리, 모든 Nova 질문, 모든 스프레드시트 새로 고침에 사용될 이름이기 때문입니다. 나중에 이름을 바꾸더라도 데이터가 손실되지는 않지만, 이미 그 위에 구축한 모든 내용을 다시 검토해야 합니다. 파트 파일이 있는 폴더의 이름은 다음과 같습니다. 파트-00000.파케트 테이블 이름만으로는 각 행의 내용에 대한 정보를 전혀 알 수 없으므로, 일반적으로 테이블 이름만이 데이터에 부여되는 유일한 사람이 읽을 수 있는 레이블입니다.
패턴을 포함하세요
기본: **/*.쪽매 세공 — Parquet 폴더 카드를 선택하면 자동으로 설정됩니다. 각 줄마다 하나의 글로브 패턴이 루트 폴더 아래의 어떤 파일을 범위에 포함할지 결정합니다. 이 패턴을 그대로 두면 트리 구조 내의 모든 Parquet 파일을 포함하게 되는데, 이는 처음 내보내기를 지정할 때 원하는 결과입니다.
이 범위를 좁히는 것이 당신이 가진 주요 수단이며, 거의 항상 한도를 올리는 것보다 더 나은 선택입니다. 데이터 레이크 내보내기는 파티션으로 나뉘어 있으므로 폴더 구조에 이미 원하는 필터가 포함되어 있습니다. 공유 폴더에 허용된 파일 수보다 많은 파일이 있어 스캔이 거부되는 경우, 파일 제한에 도달하는 대신 실제로 쿼리하는 파티션으로 패턴 범위를 지정하세요. 예를 들어, 4천 개의 파일을 읽는 커넥터가 40만 개의 파일을 읽고 필터링하는 커넥터보다 스캔 속도와 동기화 속도가 훨씬 빠르고 이해하기 쉽습니다.
**/*.parquet 트리의 모든 Parquet 파일(기본값) year=2026/**/*.parquet Hive로 분할된 레이크의 1년치 데이터셋 **/part-*.parquet Spark 파트 파일(수동으로 추가된 추가 파일은 제외) orders/**/*.parquet 여러 데이터셋을 포함하는 공유 폴더에서 하나의 데이터셋
사람들이 잘 모르는 규칙이 하나 있는데, 마법사가 그 규칙을 게임판에 직접 적어 놓았습니다. 혼합 폴더는 동일한 루트에 있는 두 개의 커넥터(드라이버당 하나씩)를 의미합니다. 만약에 \\레이크\수출 CSV 파일과 Parquet 파일을 함께 지원하며, 이러한 패턴을 확장합니다. **/*.* 두 가지 형식을 모두 제공하지 않습니다. 두 형식은 고정된 도형을 공유할 수 없습니다. Parquet 폴더 커넥터를 생성하고... CSV 폴더 커넥터 각각 고유한 포함 패턴과 테이블 이름을 가지고 동일한 경로를 가리킵니다.
매니페스트 재정의(JSON)
뒤에 숨겨져 있습니다 고급 옵션 표시특히 Parquet 파일 시스템에서 다른 어떤 시스템보다 더 유용합니다. 이 제품군의 다른 모든 경우에서 오버라이드는 커넥터가 추측한 내용을 수정하는 방법입니다. 하지만 여기서는 아무것도 추측하지 않으므로 오버라이드는 커넥터가 예측한 내용을 수정하는 방법입니다. 관로 그랬습니다. 바로 그런 경우인데, 단순히 파일을 수정할 수 없는 경우입니다.
세 가지 시나리오가 거의 모든 실제 사용 사례를 포괄합니다. Spark 작업에서 열 이름을 지정합니다. 콜_14 또는 amt_net_x 누구도 그런 내용을 보고서에 쓰고 싶어하지 않습니다. 어떤 열에는 기밀 정보가 담겨 있어서 테이블에 아예 존재해서는 안 될 수도 있습니다. 또는 숫자 열에 파일에서 지정한 것보다 더 높은 정밀도가 필요할 수도 있습니다. 이 세 가지 모두 한 줄만 수정하면 되고, 도형을 고정할 때 적용되므로 모든 쿼리에서 다시 적용할 필요 없이 테이블 정의의 일부가 됩니다.
{ "renames": { "qty": "quantity" }, "retypes": { "price": "DECIMAL(18,4)" }, "exclude": [ "internal_notes" ] }
- 이름을 바꾸다 — 열에 더 나은 이름을 지정하세요. 다른 이름으로 변경할 수는 없습니다.
_소스_파일또는_row_id두 열의 이름을 같은 이름으로 변경할 수 없습니다. - 재입력 — 열의 형식을 강제로 지정합니다. 여기에 설정하는 형식은 의도적인 지침이므로, 그렇지 않을 경우 파일 실행을 중단시키는 엄격한 바닥글 검사 없이 적용됩니다. 선택적으로 정밀도를 사용할 수 있는 일반 형식 이름만 사용할 수 있습니다.
십진수(18,4),바르차르,빅인트,날짜. - 들어오지 못하게 하다 — 테이블에서 해당 열을 완전히 제외합니다. 제외된 열은 드리프트 검사에서 더 이상 고려하지 않는 열이기도 하므로, 파이프라인에서 계속 변경되는 필드를 무시하는 깔끔한 방법입니다.
해당 입력란에는 JSON 객체가 있거나 아무것도 없어야 합니다. 유효하지 않은 JSON은 저장 시 자동으로 거부되며, 오류 없이 무시되지 않습니다. 상자를 비우면 오버라이드 설정이 초기화됩니다. 그리고 테이블을 바닥글에서 선언한 형태로 되돌립니다. 이는 커넥터를 삭제하고 다시 만드는 대신 재정의를 취소하는 의도된 방법입니다.
테이블 레이아웃 옵션이 없는 이유는 무엇인가요?
CSV, Excel 및 JSONL 폴더는 다음을 제공합니다. 테이블 레이아웃 레이아웃을 고정하거나 레이아웃당 하나의 테이블을 사용하는 두 가지 선택지가 있는 이유는, 사람들이 직접 손으로 구성하는 형식이기 때문이며, 실제로 폴더에는 시간이 지남에 따라 다양한 열 구성이 누적되기 때문입니다. Parquet에는 이러한 설정이 없습니다. 의도적인 것입니다. Parquet은 본질적으로 기계적으로 작성됩니다. 어떤 프로그램이 해당 파일을 생성하고, 만약 그 프로그램이 하나의 폴더에 여러 가지 다른 형태의 파일을 생성한다면, 이를 별도의 테이블로 분리하는 것은 파이프라인 문제를 드러내는 것이 아니라 덮어버리는 결과를 초래할 것입니다.
따라서 Parquet 폴더에는 하나의 테이블이 포함되며, 불일치는 처리되기보다는 보고됩니다. 누락된 열은 합집합에 포함되고 null 허용으로 표시됩니다. 유형 이는 명명된 거부입니다. 만약 실제로 하나의 공유 폴더에 서로 관련 없는 여러 데이터 세트를 보유하고 있다면, 데이터 세트당 하나의 커넥터를 사용하고 범위를 지정하는 것이 해결책입니다. 패턴을 포함하세요 — 이렇게 하면 각각 고유한 테이블 이름을 갖게 되므로 훨씬 더 명확해집니다.
섭취량 제한 및 스캔 제한
네 가지 데이터 수집 제한(행 및 바이트, 파일별 및 동기화당)과 스캔 제한(스캔당 파일 수, 스캔 깊이, 시간 예산, 루트별 병렬 처리)은 모든 폴더 유형에서 공유되며, 라이브 서버 뒤에 있습니다. 고급 옵션 표시그리고 한 가지 중요한 규칙을 기억하세요. 기본값을 수락하려면 해당 칸을 비워 두세요. 0은 결코 무한대를 의미하지 않습니다. 그리고 단호하게 거부됩니다. 그들의 가치관과 각각의 가치관을 제기하는 이유는 다음과 같습니다. 파일 세트 커넥터 가이드Parquet 폴더에 가장 자주 영향을 미치는 요소는 위의 가이드라인 표에 나열되어 있습니다.
Parquet 형식은 앞서 설명한 것처럼 한 가지 장점이 있습니다. 행 수가 바닥글에 있기 때문에 파일 데이터를 읽기 전에 파일별 행 제한을 확인하므로, 제한 위반 시 로드 도중 오류가 발생하는 것이 아니라 명시적인 거부 응답이 발생합니다. 하지만 행 제한을 늘리는 것이 여전히 차선책입니다. 먼저 포함 패턴을 좁혀보세요.
Parquet 데이터를 Microsoft Excel로 가져오기
이 질문들의 대부분은 Parquet 파일을 Excel로 변환해 달라는 요청인데, 솔직히 말씀드리면 변환할 필요가 전혀 없습니다. 폴더가 커넥터로 설정되면 Microsoft Excel용 Query Streams 추가 기능이 저장된 쿼리를 실행하고 결과를 시트에 추가하며, 필요할 때마다 자동으로 새로 고쳐집니다. 변환 과정이나 Spark 클러스터 없이, 그리고 누군가의 다운로드 폴더에 데이터 복사본이 조용히 저장되는 일 없이도 Excel에서 Parquet 파일을 얻을 수 있습니다. 동일한 쿼리가 Google Sheets에서도 변경 없이 작동합니다.
Query Streams 계정과 폴더를 볼 수 있는 컴퓨터(서버, 공유 폴더가 매핑된 워크스테이션 또는 노트북)에서 실행 중인 네트워크 에이전트가 필요합니다. Parquet 폴더 커넥터에는 다음이 필요합니다. 네트워크 에이전트 2.6 이상 버전.
- 다음에서 에이전트를 설치하세요. 다운로드 페이지 이미 실행 중이 아니라면.
- 포털에서 데이터 커넥터를 추가하고 선택하세요. 마루 폴더.
- 에이전트 컴퓨터에서 인식하는 폴더 경로를 입력하고 테이블 이름을 지정하세요. 이 필드는 필수 항목입니다. 폴더 안의 모든 파일이 하나의 테이블로 통합되기 때문입니다.
- 포함 패턴을 그대로 두세요
**/*.쪽매 세공폴더에 표에 넣고 싶은 것보다 더 많은 내용이 들어 있다면, 그 경우에는 범위를 좁히세요.**/part-*.parquet또는 다음과 같은 단일 파티션년=2026/**/*.파케트. - 저장하세요. 에이전트는 최대 64개 파일의 바닥글을 읽고 스키마를 고정한 다음 발견된 열과 형식을 보고합니다.
- 쿼리 빌더를 열고 커넥터를 선택한 다음 SQL을 작성하거나 Nova AI에 SQL 작성을 요청할 수 있습니다.
- 쿼리를 저장한 다음 필요할 때마다 Microsoft Excel 또는 Google Sheets 추가 기능에서 실행하세요.
\\호수\수출\주문또는 에이전트 자체 컴퓨터의 로컬 경로를 지정하고 에이전트가 실행되는 계정에 해당 경로를 읽을 수 있는 권한이 있는지 확인하십시오. 데이터 레이크 내보내기는 종종 날짜 파티션의 폴더 트리 아래에 저장되므로 트리가 실제로 8단계보다 깊지 않은 한 깊이 설정을 변경하지 마십시오.
여기서부터 해당 폴더는 다른 데이터 소스와 마찬가지로 작동합니다. Microsoft SQL Server, PostgreSQL, MySQL, BigQuery 등과 조인할 수 있으며 Stripe 또는 Shopify와 같은 API 커넥터와도 연결됩니다. 따라서 파일 공유에 있는 아카이브된 웨어하우스 테이블을 웨어하우스에 먼저 로드하지 않고도 단일 읽기 전용 명령으로 실시간 프로덕션 데이터와 조인할 수 있습니다.
자주 묻는 질문
Spark 없이 Parquet 파일을 읽는 방법은 무엇인가요? +
Parquet 파일을 Microsoft Excel에서 열 수 있나요? +
Query Streams에 컬럼 유형을 알려줘야 하나요? +
십진수(18,2) 파일에 있는 값은 테이블에 정확한 소수점 값으로 전달되며, 절대 부동 소수점 값으로 전달되지 않습니다.
모든 Parquet 파일의 열 형식이 동일해야 하나요? +
NULL 해당 정보가 없는 파일의 경우, 파일마다 데이터 유형이 다른 열은 명명된 거부로 처리됩니다. 커넥터는 한 유형을 다른 유형으로 변환하는 대신 열 이름과 두 가지 데이터 유형을 모두 알려줍니다.
파이프라인에 열이 추가되었습니다. 폴더는 여전히 작동할까요? +
내 Parquet 파일 중 하나가 왜 파킹되었나요? +
파일_이벤트 파일 이름과 구체적인 불일치 내용만 표시되고, 나머지 파일은 모두 동기화가 유지됩니다.
커넥터 하나가 Parquet 파일을 몇 개까지 읽을 수 있나요? +
특정 행이 어느 파일에서 온 것인지 알 수 있나요? +
_소스_파일 파일 이름을 지정하고 _row_id 테이블 전체에서 해당 행을 고유하게 식별합니다. Parquet의 경우 식별자는 파일 내 행의 실제 순서 위치를 기반으로 생성되며, 정렬 시 0으로 채워집니다. _row_id 파일 순서대로 행을 정확하게 정렬합니다. 그룹화 기준 _소스_파일 일반적으로 이는 잘못된 수치를 발생시킨 원인이 되는 파티션을 찾는 가장 빠른 방법입니다.
파이프라인이 새로운 부품 파일을 작성할 때 어떤 일이 발생합니까? +
파일_이벤트.
내 Parquet 데이터가 업로드되었나요, 아니면 수정되었나요? +
선택, 와 함께, 프라그마, 설명하다 또는 설명하다 문장 — 쓰기 권한이 있는 모든 것은 실행되기 전에 거부됩니다.
시작하기
Parquet 파일이 있는 폴더 안을 살펴보세요.
에이전트를 해당 폴더로 지정하고 모든 파트 파일을 하나의 SQL 테이블처럼 쿼리하세요. 이때 파일에 이미 선언된 것과 동일한 열 이름과 데이터 유형을 사용합니다. Spark나 Python을 사용할 필요가 없으며, 네트워크를 통해 데이터가 전송되는 것도 없습니다.
관련 가이드: SQL을 사용하여 파일이 있는 폴더를 쿼리하는 방법 | 여러 CSV 파일을 하나의 표로 결합합니다. | 쿼리 스트림 에이전트를 다운로드하세요 | 모든 파일 세트 커넥터 가이드
범주: 파일 세트 커넥터
태그: Parquet을 Excel로 변환, Parquet 파일 쿼리, Spark 없이 Parquet 읽기, Parquet 폴더, Excel의 Parquet, Parquet 폴더 커넥터, Parquet에서 SQL 실행, 데이터 레이크 내보내기
메타 설명: Parquet 파일이 담긴 폴더를 하나의 SQL 테이블로 쿼리하여 Microsoft Excel로 가져옵니다. Spark나 파일 업로드 과정이 필요 없습니다.

