반응형
반응형
📌 이 글의 핵심 요약 (Key Takeaways)수동으로 수일씩 소요되던 월간 보안 점검(개인정보 접근 이력, 퇴사자 권한 미회수, 비인가 IP 접근 등) 업무를 코드로 정의하여 소요 시간을 0분으로 단축시킨 데이터 거버넌스 리포트 자동화 구축 실무 사례입니다. 본 글에서는 Databricks(Audit 로그)와 AWS(CloudTrail), Airflow를 연동하여 수집-가공-표현(Dashboard & Alerting)의 3계층(3-Layer) 데이터 모니터링 아키텍처를 설계하는 방법을 설명합니다. 담당자마다 달랐던 보안 판단 기준을 SQL 코드로 일원화하고, 단순 장애 알림(Monitoring)을 넘어 "누가 어떤 데이터에 어떻게 접근했는가"를 통합 추적하는 관측 가능성(Observability..
📌 이 글의 핵심 요약 (Key Takeaways)단순히 "작업이 실패했습니다"라고 통보하는 1차원적 모니터링을 넘어, 장애 발생 시 "어떤 후속 작업과 데이터 마트 테이블에 영향이 가는가?"를 예측하는 관측 가능성(Observability) 시스템 구축 실무 사례입니다. 본 글에서는 Databricks 파이프라인의 코드를 스캔하여 데이터 리니지(Lineage) 메타데이터를 자동화하는 방법, 다단계(A➡️B➡️C) 영향도 추적 로직, 그리고 알림 피로도(Alert Fatigue)를 방지하기 위해 MS Teams 채널을 세분화하여 공지하는 DRE(Data Reliability Engineering) 조직 문화 정착 노하우를 집중적으로 다룹니다. 안녕하세요. 주형권입니다. 어느덧 Data Reliabili..
📌 이 글의 핵심 요약 (Key Takeaways)매일 수억 건이 발생하는 대규모 데이터 파이프라인에서 단순 건수 체크를 넘어선 '다차원 로그 정합성 모니터링 시스템(Airflow + Databricks + MySQL + Teams)'을 구축한 실무 사례입니다. 본 글에서는 특정 로그 타입 및 국가별 유실을 감지하는 세분화된 집계 로직, 알림 피로도(False Positive)를 줄이기 위한 임계치 설정 노하우, 그리고 대용량 집계 시 발생하는 비용 최적화(Cost Optimization) 전략을 집중적으로 다룹니다. 안녕하세요. 주형권입니다.최근 방대한 로그들이 여기저기에서 들어오다 보니 로그가 정상적으로 들어오는지에 대해서 고민을 많이 하게 되었습니다. 그래서 데이터 엔지니어들의 영원한 숙제인 정..
📌 이 글의 핵심 요약무슨 문제인가: Databricks 글로벌/멀티 테넌트 환경을 운영하면서 비인가자의 접근, 불필요한 퍼스널 토큰 남용, 보안 취약점 노출을 수동으로 일일이 감시하기 어려웠음.어떻게 해결했나: Databricks가 생성하는 시스템 감사 로그(Audit Log)를 자동으로 수집·적재하고, Python API와 Teams 알림을 연동하여 비인가 접근 및 보안 위협을 실시간으로 감지하는 데이터 거버넌스 자동화 시스템을 구축함.무슨 효과를 얻었나: 보안 감사(Audit) 업무를 100% 자동화하여 리소스를 제로화하고, 개인정보(PII) 유출 및 비인가 토큰 사용 등 데이터 플랫폼의 보안 위협을 실시간으로 철통 방어함.안녕하세요, 주형권입니다. 정말 오랜만에 블로그로 인사 드립니다.그동안 밀..
📌 이 글의 핵심 요약무슨 문제인가: 기존 팀 단위의 단편적인 모니터링 방식으로는 본부 전체 사용자가 무작위로 생성하는 수많은 Databricks 워크플로우의 성공/실패/지연 상태를 체계적으로 관리하고 대응하기 어려웠음.어떻게 해결했나: Databricks Job/Task API를 주기적으로 호출하는 자동 탐지 백엔드를 개발하고, 메타데이터 저장을 위한 RDS 구축 및 비공개 Teams 채널 연동을 아우르는 전사적 워크플로우 관측 가능성(Observability) 알림 아키텍처를 수립함.무슨 효과를 얻었나: 본부 내 누구나 워크플로우를 생성해도 별도 설정 없이 실시간 장애 알림이 자동 적용(바이브코딩 배려)되었으며, 단순 감지를 넘어 장애 원인을 신속히 진단할 수 있는 데이터 신뢰성(DRE) 기반을 마..
해당 내용은 제가 생각한 부분과 외국 블로그, 사이트에서 있는 내용을 정리 한 개념이므로 정답은 아닙니다. 📌 이 글의 핵심 요약무슨 직군인가: 데이터 신뢰성 엔지니어(Data Reliability Engineer, DRE)는 소프트웨어 분야의 SRE(사이트 신뢰성 엔지니어링) 철학을 데이터 도메인에 이식하여, 대규모 데이터 파이프라인의 품질, 정합성, 안정성을 보장하고 자동화하는 차세대 직군입니다.왜 필요한가: 데이터 플랫폼이 대형화되면서 사후 모니터링만으로는 정합성 오류와 성능 저하를 방지하기 어려우며, 데이터 신뢰도를 엔지니어링 기법으로 '설계 단계'부터 강제하고 관리해야 하기 때문입니다.앞으로의 방향성: 국내에는 아직 매우 생소하지만 해외 및 선도 IT 기업들을 중심으로 급부상 중이며, 전통적인..