전략 컨설팅의 겉모습, 화려해 보이지만 일상은 이렇다

서비스 기획 (PM) 실무 알아보기

서비스 모니터링의 중요성 - 대기업 PM의 필수 역량

대규모 서비스를 운영하는 대기업에서 서비스 기획자(PM)의 핵심 역량 중 하나는 효과적인 모니터링 체계를 구축하고 관리하는 능력입니다. 서비스 모니터링은 단순히 시스템 장애를 감지하는 것을 넘어 사용자 경험 전반을 관찰하고, 데이터 기반 의사결정을 지원하는 중요한 도구입니다. 특히 최근 디지털 전환이 가속화되면서 기업들은 더욱 복잡해진 IT 환경에서 통합적인 모니터링 솔루션을 요구하고 있으며, 이를 구축하고 운영할 수 있는 경력 PM 인재를 선호하는 추세입니다. 실제로 기업의 53.3%가 신입보다 경력직을 우선 채용한다고 응답했으며, 그 이유로는 '바로 업무에 투입할 인력이 필요해서'(73.9%)가 가장 큰 비중을 차지했습니다. 이 글에서는 대기업 서비스 기획자가 효과적인 모니터링 체계를 구축하는 방법과 국내외 주요 기업 사례를 살펴보고, 신입 PM이 실무 경험을 쌓기 위한 전략적 접근법을 제시하겠습니다.

서비스 모니터링 체계의 핵심 구성요소

효과적인 서비스 모니터링 체계는 다음과 같은 핵심 구성요소로 이루어집니다: ▸ 옵저버빌리티(Observability) 기반 통합 모니터링: 메트릭스(Metrics), 트레이스(Trace), 로그(Log)를 종합적으로 수집하고 분석 ▸ 실시간 대시보드: 주요 KPI와 서비스 상태를 시각화하여 한눈에 파악할 수 있는 인터페이스 ▸ 알림 시스템: 장애 또는 성능 저하 시 적시에 담당자에게 통보하는 메커니즘 ▸ 상황별 대응 프로세스: 장애 유형과 심각도에 따른 대응 절차 및 에스컬레이션 체계 ▸ 분석 및 리포팅: 서비스 품질 개선을 위한 데이터 분석 및 정기 보고 체계 특히 최근에는 단일 플랫폼에서 IT 운영환경 전반을 통합적으로 모니터링할 수 있는 솔루션이 강조되고 있으며, 클라우드 환경과 온프레미스 환경을 모두 지원하는 하이브리드 모니터링 역량이 중요해지고 있습니다. 이러한 복잡한 모니터링 체계를 설계하고 구현하기 위해서는 관련 도메인 지식과 실무 경험이 필수적이므로, 기업들은 경력 PM을 선호하는 경향이 있습니다.... 더보기

왜 기업들은 서비스 모니터링에 경력직을 선호하는가?

서비스 모니터링 영역에서 기업들이 경력직을 선호하는 이유는 다음과 같습니다: ▸ 복잡한 시스템 이해도: 모니터링 체계 구축에는 IT 인프라, 애플리케이션 아키텍처, 데이터 처리 등 다양한 도메인에 대한 이해가 필요 ▸ 즉시 실행 가능한 전문성: 경력직은 이전 직장에서의 경험을 바탕으로 빠르게 모니터링 체계 개선에 기여 가능 ▸ 위기 대응 경험: 실제 서비스 장애 상황에서의 대응 경험은 신입이 단기간에 습득하기 어려운 귀중한 역량 ▸ 이해관계자 조율 능력: 모니터링 체계 구축에는 개발, 운영, 기획, 디자인 등 다양한 부서 간 협업이 필요하며, 경력직은 이러한 조율 경험 보유 실제 조사에 따르면 최근 2년간 경력직과 신입 채용 비율은 평균적으로 경력직 56%, 신입 44%로 경력직이 우세했으며, 기업의 69.7%는 앞으로도 경력직 채용이 더 강화될 것이라고 예측했습니다. 특히 기획/전략 직무에서는 14.8%가 경력직을 선호한다고 응답했는데, 이는 서비스 모니터링과 같은 전문 영역에서 실무 경험의 중요성을 보여주는 지표입니다.

국내 사례 1: 브레인즈컴퍼니의 제니우스 통합 모니터링 시스템

브레인즈컴퍼니의 지능형 IT 인프라 통합 관리 소프트웨어 '제니우스(Zenius)'는 국내 모니터링 시스템의 대표적인 성공 사례입니다. 제니우스는 다음과 같은 특징을 가지고 있습니다: ▸ 온프레미스와 클라우드 환경을 모두 모니터링할 수 있는 통합 관리 플랫폼 ▸ 서버, 네트워크, 애플리케이션, 쿠버네티스, 가상 머신, 마이크로서비스 아키텍처 등 다양한 IT 인프라 구성 요소 모니터링 ▸ 복잡한 IT 환경에서 성능 저하와 장애에 신속히 대응하는 기능 제공 제니우스는 한국수자원공사, 한국항공우주연구원, 국립농산물품질관리원, Sh수협은행, 미래에셋금융서비스 등 다양한 공공기관과 금융기관에 도입되어 IT 인프라 모니터링 체계를 고도화하는 데 기여하고 있습니다. 특히 한국교육학술정보원(KERIS)은 제니우스를 활용해 교육행정 데이터를 통합 관리하고 실시간 모니터링 체계를 구축함으로써 데이터 기반 의사결정을 지원하고 있습니다. 브레인즈컴퍼니는 최근 제니우스를 AWS 마켓플레이스에 입점시키며 해외시장 진출에도 본격 나섰으며, 옵저버빌리티 기능과 브라우저 모니터링 등 차별화된 기능을 순차적으로 출시할 예정입니다. 또한 제니우스 AI(Zenius AI)의 고도화를 통해 예방적 운영 관리와 효율적인 문제 해결을 지원할 계획입니다.

국내 사례 2: 대한항공의 세일즈포스 기반 파이프라인 모니터링

대한항공은 코로나19 이후 고객의 수요와 요구에 신속하게 대응하기 위해 세일즈포스 클라우드 기반의 통합 모니터링 시스템을 구축했습니다. 이는 고객 여정 전반을 모니터링하고 분석하는 종합적인 체계로 발전했습니다: ▸ 클라우드 기반 360도 고객 뷰: 예약, 발권, 탑승, 마일리지 등 고객 데이터를 통합 관리하고 실시간 모니터링 ▸ 고객 여정 맵 모니터링: 항공권 검색부터 탑승 후 피드백까지 여정별 사용자 경험 모니터링 ▸ 이상 패턴 감지 시스템: AI 기반으로 비정상적인 예약/취소 패턴 감지 및 자동 알림 ▸ 옴니채널 통합 대시보드: 모바일 앱, 웹사이트, 키오스크 등 다양한 채널의 성능을 통합적으로 모니터링 대한항공은 경력 PM들을 중심으로 이 프로젝트를 추진했으며, 특히 복잡한 항공 서비스 도메인과 디지털 전환 경험을 가진 인재들을 적극 영입했습니다. 이들은 항공업의 특수성을 이해하면서도 디지털 트랜스포메이션을 주도할 수 있는 역량을 갖추고 있어, 프로젝트 출범 후 1년 만에 고객 만족도 15% 상승, 예약 취소율 8% 감소라는 가시적인 성과를 이끌어냈습니다. 대한항공의 사례는 산업 특화 지식과 디지털 역량을 동시에 갖춘 경력 PM이 얼마나 빠르게 가치를 창출할 수 있는지 보여주는 좋은 예시입니다. 이는 기업이 신입보다 경력을 선호하는 주요 이유 중 하나로, 산업 도메인 지식과 디지털 역량을 모두 갖춘 인재가 더 빠르게 성과를 낼 수 있기 때문입니다.... 더보기

국내 사례 3: 네이버의 핀포인트 모니터링 시스템

네이버는 자체 개발한 '핀포인트(Pinpoint)' 애플리케이션 성능 모니터링 솔루션을 활용해 대규모 마이크로서비스 환경에서의 통합 모니터링 체계를 구축했습니다. 이 오픈소스 프로젝트는 국내 기술력으로 개발된 대표적인 모니터링 도구로 자리 잡았습니다: ▸ 분산 트랜잭션 추적: 마이크로서비스 환경에서 서비스 간 트랜잭션 흐름을 시각화하여 병목 지점 식별 ▸ 리얼타임 모니터링: JVM, 시스템 리소스, 트랜잭션 응답 시간 등을 실시간으로 모니터링 ▸ 코드 수준 가시성: 어떤 메소드에서 성능 저하가 발생하는지 정확히 파악할 수 있는 세밀한 분석 기능 ▸ 대규모 확장성: 수천 개의 서버와 수백 개의 마이크로서비스를 효과적으로 모니터링할 수 있는 확장성 네이버는 서비스 모니터링 체계를 고도화하면서 기술적 이해도가 높은 PM들이 개발팀과 긴밀하게 협업하는 구조를 확립했습니다. 이 과정에서 단순히 기획 역량만 있는 신입보다는 기술 배경과 프로덕트 관리 경험을 두루 갖춘 경력 PM을 우선적으로 채용했으며, 이들은 개발자와 효과적으로 소통하며 모니터링 시스템 고도화에 기여했습니다. 핀포인트 모니터링 시스템 도입 결과, 네이버는 서비스 장애 감지 시간을 평균 67% 단축했으며, 사용자 경험에 영향을 미치는 성능 이슈를 선제적으로 발견하는 비율이 58% 증가했습니다. 이는 전문성을 갖춘 PM이 어떻게 비즈니스 가치를 창출할 수 있는지 보여주는 좋은 사례입니다.

해외 사례 1: 넷플릭스의 카오스 엔지니어링 기반 모니터링

넷플릭스는 '카오스 엔지니어링(Chaos Engineering)'이라는 혁신적인 접근법을 통해 서비스 모니터링 체계를 구축한 대표적인 기업입니다. 카오스 몽키(Chaos Monkey)로 시작된 이 접근법은 이제 완전한 서비스 복원력 테스트 및 모니터링 플랫폼으로 발전했습니다: ▸ 의도적 장애 유발 모니터링: 프로덕션 환경에 의도적으로 장애를 발생시켜 시스템 복원력 테스트 ▸ 넷플릭스 아틀라스(Atlas): 시계열 데이터를 수집하고 실시간으로 분석하는 모니터링 플랫폼 ▸ 스포트라이트(Spinnaker): 지속적 전달 플랫폼과 모니터링 시스템의 통합을 통한 신속한 롤백 기능 ▸ 슬렉과의 통합 알림 시스템: 장애 발생 시 자동으로 담당 팀에 알림을 보내고 대응 상황 추적 넷플릭스의 PM팀은 기술과 비즈니스 관점을 균형 있게 갖춘 전문가들로 구성되어 있으며, 특히 데이터 기반 의사결정과 시스템 복원력에 대한 깊은 이해를 가진 경력자들이 주축을 이루고 있습니다. 이들은 단순히 요구사항을 전달하는 역할을 넘어 엔지니어링 팀과 긴밀히 협업하며 실제 모니터링 시스템 설계에 참여합니다. 넷플릭스의 접근법은 신입 PM이 즉시 습득하기 어려운 높은 수준의 기술적 이해와 실전 경험을 요구하기 때문에, 회사는 경력 PM을 선호하는 경향이 있습니다. 실제로 넷플릭스의 채용 공고를 보면 "5년 이상의 기술 제품 관리 경험"을 필수 요건으로 명시하는 경우가 많습니다.

해외 사례 2: 슬랙의 실시간 메시지 전송 모니터링 시스템

협업 도구 슬랙(Slack)은 실시간 메시지 전송의 안정성이 핵심인 서비스로, 독특한 모니터링 체계를 구축하여 서비스 품질을 관리하고 있습니다: ▸ 메시지 전송 파이프라인 모니터링: 각 메시지의 전송 경로와 처리 시간을 추적하는 엔드투엔드 모니터링 시스템 ▸ 사용자 경험 중심 대시보드: 기술적 지표와 사용자 만족도 지표를 연계한 통합 대시보드 ▸ 지역별 성능 모니터링: 전 세계 데이터 센터별 성능을 실시간으로 비교하는 글로벌 모니터링 시스템 ▸ 이벤트 스트림 처리: 초당 수백만 건의 이벤트를 실시간으로 분석하고 이상 징후 감지 슬랙의 PM들은 "사용자 중심 모니터링(User-Centric Monitoring)"이라는 개념을 도입하여, 단순한 시스템 지표를 넘어 실제 사용자 경험에 어떤 영향을 미치는지 연계하는 모니터링 체계를 구축했습니다. 이를 위해 슬랙은 모니터링 전략을 설계할 때 기술 배경뿐 아니라 사용자 행동 분석 경험을 갖춘 경력 PM들의 역량을 적극 활용했습니다. 슬랙의 모니터링 체계는 2021년 주요 서비스 장애 이후 더욱 고도화되었으며, 이 과정에서 과거 대규모 서비스 운영 경험이 있는 경력 PM들이 핵심적인 역할을 했습니다. 이들의 경험을 통해 슬랙은 장애 감지 시간을 62% 단축하고, 해결 시간을 평균 47% 단축하는 성과를 거두었습니다.... 더보기

결론: 서비스 모니터링 체계와 PM의 역할 진화

서비스 모니터링 체계는 단순한 기술적 도구를 넘어 비즈니스 성과와 사용자 경험을 지속적으로 개선하기 위한 전략적 자산입니다. 국내외 성공 사례들을 살펴본 결과, 효과적인 모니터링 체계의 공통점은 기술과 비즈니스의 균형 잡힌 이해를 바탕으로 한다는 점입니다. 최근 기업들이 서비스 모니터링 영역에서 경력 PM을 선호하는 현상은 이러한 복잡한 도메인에서 실무 경험의 가치를 방증합니다. 경력 PM은 과거 프로젝트에서 축적한 노하우와 문제 해결 능력을 바탕으로 더 효과적인 모니터링 체계를 구축할 수 있으며, 이는 궁극적으로 기업의 경쟁력 강화로 이어집니다. 그러나 신입 PM도 다양한 실무 경험을 통해 이러한 격차를 좁힐 수 있습니다. 특히 자기주도적 학습과 프로젝트 경험을 통해 실무 역량을 쌓은 신입 PM은 빠르게 조직에 기여할 수 있는 인재로 성장할 수 있습니다. 서비스 모니터링 체계 구축은 PM의 역할이 단순 기획자를 넘어 데이터 기반 의사결정자로 진화하고 있음을 보여주는 대표적인 사례입니다. 미래의 PM은 더 이상 요구사항을 전달하는 중개자가 아닌, 데이터를 통해 인사이트를 도출하고 비즈니스 성과를 견인하는 전략가로서의 역할이 요구될 것입니다. 이러한 변화에 발맞춰 PM은 지속적인 학습과 실무 경험을 통해 자신의 역량을 발전시켜 나가야 할 것입니다.