반응형
반응형
안녕하세요, 데이터 엔지니어 주형권입니다.이번 글에서는 Databricks 운영 환경의 안정성과 비용 효율을 개선하기 위해 구현한 연속 실패 Job 자동 일시중지(Pause) 파이프라인의 기술적인 구현 과정과 이를 통해 얻은 효과에 대해 공유하고자 합니다. 최근에 DRE적인 업무를 계속해서 고민하다 보니 솔직히 말해서 업무의 영역이라고 할 게 없다시피 할 정도로 너무나도 방대하고 코에 걸면 코걸이 귀에 걸면 귀걸이 느낌입니다. 챙기고자 한다면 얼마든지 챙길 수 있고, 신경 쓰지 않고자 한다면 아무런 신경도 쓰지 않아도 되는 것이 DRE의 업무가 아닐까? 생각이 듭니다. 오늘은 어쩌면 간단(?)하지만 어쩌면 굉장히 많이 도움이 될거 같은 기능을 개발한 내용에 대해서 적어보고자 합니다. 이 작업도 역시 G..
📌 이 글의 핵심 요약 (Key Takeaways)수동으로 수일씩 소요되던 월간 보안 점검(개인정보 접근 이력, 퇴사자 권한 미회수, 비인가 IP 접근 등) 업무를 코드로 정의하여 소요 시간을 0분으로 단축시킨 데이터 거버넌스 리포트 자동화 구축 실무 사례입니다. 본 글에서는 Databricks(Audit 로그)와 AWS(CloudTrail), Airflow를 연동하여 수집-가공-표현(Dashboard & Alerting)의 3계층(3-Layer) 데이터 모니터링 아키텍처를 설계하는 방법을 설명합니다. 담당자마다 달랐던 보안 판단 기준을 SQL 코드로 일원화하고, 단순 장애 알림(Monitoring)을 넘어 "누가 어떤 데이터에 어떻게 접근했는가"를 통합 추적하는 관측 가능성(Observability..
📌 이 글의 핵심 요약 (Key Takeaways)단순히 "작업이 실패했습니다"라고 통보하는 1차원적 모니터링을 넘어, 장애 발생 시 "어떤 후속 작업과 데이터 마트 테이블에 영향이 가는가?"를 예측하는 관측 가능성(Observability) 시스템 구축 실무 사례입니다. 본 글에서는 Databricks 파이프라인의 코드를 스캔하여 데이터 리니지(Lineage) 메타데이터를 자동화하는 방법, 다단계(A➡️B➡️C) 영향도 추적 로직, 그리고 알림 피로도(Alert Fatigue)를 방지하기 위해 MS Teams 채널을 세분화하여 공지하는 DRE(Data Reliability Engineering) 조직 문화 정착 노하우를 집중적으로 다룹니다. 안녕하세요. 주형권입니다. 어느덧 Data Reliabili..
📌 이 글의 핵심 요약 (Key Takeaways)매일 수억 건이 발생하는 대규모 데이터 파이프라인에서 단순 건수 체크를 넘어선 '다차원 로그 정합성 모니터링 시스템(Airflow + Databricks + MySQL + Teams)'을 구축한 실무 사례입니다. 본 글에서는 특정 로그 타입 및 국가별 유실을 감지하는 세분화된 집계 로직, 알림 피로도(False Positive)를 줄이기 위한 임계치 설정 노하우, 그리고 대용량 집계 시 발생하는 비용 최적화(Cost Optimization) 전략을 집중적으로 다룹니다. 안녕하세요. 주형권입니다.최근 방대한 로그들이 여기저기에서 들어오다 보니 로그가 정상적으로 들어오는지에 대해서 고민을 많이 하게 되었습니다. 그래서 데이터 엔지니어들의 영원한 숙제인 정..
📌 이 글의 핵심 요약무슨 문제인가: Databricks 글로벌/멀티 테넌트 환경을 운영하면서 비인가자의 접근, 불필요한 퍼스널 토큰 남용, 보안 취약점 노출을 수동으로 일일이 감시하기 어려웠음.어떻게 해결했나: Databricks가 생성하는 시스템 감사 로그(Audit Log)를 자동으로 수집·적재하고, Python API와 Teams 알림을 연동하여 비인가 접근 및 보안 위협을 실시간으로 감지하는 데이터 거버넌스 자동화 시스템을 구축함.무슨 효과를 얻었나: 보안 감사(Audit) 업무를 100% 자동화하여 리소스를 제로화하고, 개인정보(PII) 유출 및 비인가 토큰 사용 등 데이터 플랫폼의 보안 위협을 실시간으로 철통 방어함.안녕하세요, 주형권입니다. 정말 오랜만에 블로그로 인사 드립니다.그동안 밀..
📌 이 글의 핵심 요약무슨 문제인가: 기존 팀 단위의 단편적인 모니터링 방식으로는 본부 전체 사용자가 무작위로 생성하는 수많은 Databricks 워크플로우의 성공/실패/지연 상태를 체계적으로 관리하고 대응하기 어려웠음.어떻게 해결했나: Databricks Job/Task API를 주기적으로 호출하는 자동 탐지 백엔드를 개발하고, 메타데이터 저장을 위한 RDS 구축 및 비공개 Teams 채널 연동을 아우르는 전사적 워크플로우 관측 가능성(Observability) 알림 아키텍처를 수립함.무슨 효과를 얻었나: 본부 내 누구나 워크플로우를 생성해도 별도 설정 없이 실시간 장애 알림이 자동 적용(바이브코딩 배려)되었으며, 단순 감지를 넘어 장애 원인을 신속히 진단할 수 있는 데이터 신뢰성(DRE) 기반을 마..
해당 내용은 제가 생각한 부분과 외국 블로그, 사이트에서 있는 내용을 정리 한 개념이므로 정답은 아닙니다. 📌 이 글의 핵심 요약무슨 직군인가: 데이터 신뢰성 엔지니어(Data Reliability Engineer, DRE)는 소프트웨어 분야의 SRE(사이트 신뢰성 엔지니어링) 철학을 데이터 도메인에 이식하여, 대규모 데이터 파이프라인의 품질, 정합성, 안정성을 보장하고 자동화하는 차세대 직군입니다.왜 필요한가: 데이터 플랫폼이 대형화되면서 사후 모니터링만으로는 정합성 오류와 성능 저하를 방지하기 어려우며, 데이터 신뢰도를 엔지니어링 기법으로 '설계 단계'부터 강제하고 관리해야 하기 때문입니다.앞으로의 방향성: 국내에는 아직 매우 생소하지만 해외 및 선도 IT 기업들을 중심으로 급부상 중이며, 전통적인..