인사책 편집팀 · 발행 2026-09-15 · 12분 읽기 · 인사책 활용법

인사책 출퇴근 데이터는 어디까지 쌓였나 — 표본 현황을 공개하는 방법

인사책 데이터랩이 자체 데이터를 다루는 첫 회차로 평균이 아니라 표본 설명을 고른 이유와,
근태 데이터를 공개하기 전에 정해야 할 축·작은 셀·편중·결측 기준을 정리했습니다.

평균을 먼저 발표하면 아무도 표본을 묻지 않는다

근태 데이터를 쌓은 회사가 가장 먼저 발표하고 싶어 하는 숫자는 대개 평균입니다.
평균 출근 시각,
평균 근로시간,
평균 초과근로.
한 줄로 끝나기 때문에 인용하기 쉽고,
인용하기 쉬운 만큼 어디서 온 값인지 확인되지 않은 채 옮겨집니다.

문제는 인용이 원문을 떠나는 순간 범위가 떨어져 나간다는 데 있습니다.
원문에 「우리 서비스를 쓰는 회사 몇 곳의 관측값」이라고 적어 두어도,
두 번째 인용자는 「한국 중소기업의 평균」이라고 씁니다.
세 번째 인용자는 원문을 아예 보지 않습니다.
숫자만 살아남고 조건은 죽는 것이 인용의 기본 성질입니다.

인사책 데이터랩이 자체 데이터를 다루는 첫 회차를 평균이 아니라 표본 설명으로 잡은 이유가 여기에 있습니다.
표본을 먼저 공개하면 이후에 내는 모든 수치가 그 범위 안에서 읽힙니다.
반대 순서는 되돌릴 수 없습니다 — 평균이 먼저 퍼진 뒤에 표본을 설명하는 것은 공개가 아니라 정정이고,
정정은 원래 숫자만큼 멀리 가지 않습니다.

이 글에는 실제 관측 수치가 들어 있지 않습니다.
그리고 뒤에 수치를 채우더라도 그것은 인사책을 사용한 회사의 익명 집계일 뿐,
한국 전체 근로자의 행동 통계가 아닙니다.
수치는 아래 「숫자를 아직 채우지 않은 이유」에서 설명하는 게이트를 통과한 뒤 별도 회차에서 채웁니다.
여기서 정하는 것은 그 회차가 무엇을,
어떤 형태로 공개할지의 규격입니다.

표본을 먼저 공개하면 세 가지가 달라진다

인용하는 쪽이 범위를 함께 옮긴다

표본 문서가 먼저 있으면,
나중에 나올 평균은 「이 표본에서의 평균」이라는 이름을 달고 나옵니다.
인용자가 링크를 걸 곳이 숫자 페이지 하나가 아니라 방법론 페이지까지 두 개가 되고,
편집자·연구자처럼 조건을 확인하는 독자는 그 두 번째 링크를 실제로 누릅니다.
조건을 확인할 수 있게 만들어 두는 것 자체가 인용 가치입니다.

반박이 데이터 개선으로 돌아온다

평균을 발표하면 돌아오는 반응은 「그 숫자 틀린 것 같은데요」입니다.
표본을 발표하면 돌아오는 반응은 「업종 분류를 이렇게 나누면 우리 회사는 어디에 들어가나요」입니다.
앞의 것은 방어를 부르고 뒤의 것은 개선을 부릅니다.
데이터를 계속 낼 계획이라면 두 번째 대화가 훨씬 쌉니다.

나중에 낼 평균의 신뢰가 미리 적립된다

약점을 먼저 적어 둔 문서는 나중에 강점을 말할 때 힘을 얻습니다.
「이 축은 결측률이 높아 아직 공개하지 않습니다」라고 써 둔 곳이,
나중에 「이 축은 기준을 넘겼습니다」라고 쓸 때의 근거가 됩니다.
숨긴 것이 없다는 사실은 선언이 아니라 이력으로 증명됩니다.

공개할 축과 공개하지 않을 축 — 설계표

표본 공개는 「가진 것을 다 보여 주는 일」이 아닙니다.
축마다 공개 이유가 다르고,
작은 셀을 다루는 방식이 다르고,
재식별 위험의 크기도 다릅니다.
축을 정할 때는 네 칸을 동시에 채워야 하며,
한 칸이라도 비면 그 축은 아직 공개 대상이 아닙니다.

공개할 축왜 그 축인가작은 셀 처리재식별 위험
관측 기간 (시작일·종료일·시간대)모든 값의 유효기간을 정한다.
기간이 없으면 어떤 수치도 최신인지 판단할 수 없다
해당 없음 — 셀이 아니라 범위 표기다없음.
다만 개별 기록의 정확한 시각·날짜는 공개하지 않는다
회사 수표본의 모수.
「몇 명」보다 「몇 개 회사」가 대표성의 1차 상한이다
총계만 공개.
하위 축과 교차했을 때 회사 수가 기준 미만이면 그 행 자체를 숨긴다
낮음.
단 회사 수가 한 자리면 업종과 결합해 특정될 수 있다
근로자 수회사 수만으로는 규모를 알 수 없다.
회사당 인원 편차를 드러낸다
하위 셀이 근로자 기준에 미달하면 상위 구간에 합친다낮음.
개인 식별자와 소속은 어떤 형태로도 공개하지 않는다
기록(이벤트) 수활동 밀도.
회사 수와 근로자 수가 같아도 기록량은 크게 다르다
총계와 편중 지표만.
회사별 원시 건수를 나열하지 않는다
낮음~중간.
회사별 건수 나열은 사실상 고객사 이용량 공개다
회사별 기여 비중(편중)평균을 발행할 수 있는지 없는지를 가르는 축.
최대 기여 회사의 비중은 반드시 함께 공개한다
상위 1개사 비중만 표기하고 순위표는 만들지 않는다중간.
순위표는 익명 집계가 아니라 고객사 지목이 된다
업종「업체별로 다른가」라는 질문에 답할 수 있는 사실상 유일한 익명 축어휘를 먼저 정규화하고,
기준 미달 업종은 「기타」로 합친 뒤 합침 규칙을 함께 공개한다
중간.
지역·규모와 교차하면 회사가 특정된다
사업장 규모 구간법률 구간(5인 미만 등)과 통계조사 구간이 달라 오독이 가장 잦은 자리구간을 넓게 잡는다.
한 구간의 회사 수가 기준 미만이면 인접 구간과 합친다
중간
지역요구는 많지만 입력 완성도가 가장 낮은 축결측률이 상한을 넘으면 셀을 합치는 대신 축 자체를 공개하지 않는다높음.
지역·업종·규모 세 축이 겹치면 소수 회사가 특정된다
출퇴근 확인 방식제품을 통해서만 관측되는 고유 축.
다른 통계에서 얻기 어렵다
방식별 회사 수·근로자 수가 기준 미만이면 그 방식 행을 숨긴다중간.
특정 방식을 쓰는 회사가 소수면 방식 이름이 곧 지목이 된다
결측률위 축들을 얼마나 믿을 수 있는지의 척도.
숨기면 나머지 전부가 과장된다
해당 없음 — 결측 자체가 공개 대상이다없음

표를 이렇게 짜 두면 「이 축은 왜 없나요」라는 질문에 매번 같은 답을 할 수 있습니다.
축이 빠진 이유가 문서 안에 있는 것과,
물어봐야 알 수 있는 것은 신뢰에서 큰 차이를 만듭니다.

작은 셀을 어떻게 처리할 것인가

표를 잘게 쪼갤수록 각 칸에 들어가는 회사와 사람의 수는 줄어듭니다.
칸이 충분히 작아지면 그 칸은 통계가 아니라 특정 회사의 기록이 됩니다.
처리 방법은 네 가지뿐이고,
어느 것을 썼는지 표 아래에 적어야 합니다.

억제 — 칸을 비우고 비운 이유를 적는다

기준 미달 칸을 값 대신 표시 기호로 두고,
기호의 뜻을 표 아래에 정의합니다.
비운 칸이 몇 개인지도 함께 밝힙니다.
비운 칸의 개수를 숨기면 독자가 남은 칸을 전체로 오인합니다.

합침 — 인접 구간과 묶는다

규모 구간이나 업종처럼 순서나 유사성이 있는 축은 인접한 것끼리 묶습니다.
다만 합치는 규칙을 결과를 보고 정하면 안 됩니다.
어떤 값이 나오는지 본 뒤에 구간을 조정하는 것은 결론에 맞춘 설계이며,
방법론이 아니라 편집입니다.

구간화 — 값의 정밀도를 낮춘다

시각은 정확한 분 단위 대신 최소 1시간 구간으로,
인원은 정확한 수 대신 구간으로 냅니다.
정밀도를 낮추면 같은 데이터로도 공개 가능한 범위가 넓어집니다.

축 내리기 — 이번 회차에서 뺀다

앞의 셋으로도 안 되면 그 축은 이번에 공개하지 않습니다.
결측률이 상한을 넘은 축이 특히 그렇습니다.
결측을 빼고 계산한 비율은 「남은 것들 중의 비율」인데,
표에 적히는 순간 「전체 중의 비율」로 읽히기 때문입니다.

편중은 감추는 것이 아니라 같이 싣는 것

회사 동일가중과 기록 가중은 다른 답을 낸다

한 회사가 전체 기록의 상당 부분을 차지하는 표본에서 원시 기록을 그대로 평균 내면,
그 결과는 표본 전체의 성질이 아니라 그 한 회사의 성질에 가깝습니다.
회사마다 같은 가중치를 주면 값이 달라지고,
어느 쪽도 그 자체로 틀린 것은 아닙니다.
틀리는 것은 어느 쪽을 썼는지 밝히지 않는 경우입니다.

기여 상한은 사전에 선언한다

한 회사가 기여할 수 있는 최대 비중을 미리 정해 두고,
그 상한을 적용했는지 여부를 표마다 표기합니다.
상한을 결과를 본 뒤에 정하면 그것은 가중이 아니라 조정입니다.
사전에 선언한 규칙만이 방법론이 됩니다.

편중 지표는 본문 첫 화면에 둔다

최대 기여 회사의 비중은 부록이 아니라 요약 카드에 들어가야 합니다.
이 숫자가 뒤로 밀리는 순간,
표본 문서는 「약점을 적어 둔 문서」가 아니라 「약점을 적어 두기는 한 문서」가 됩니다.

표본과 행동 통계의 경계 — 문장 단위로 가른다

표본 공개는 「무엇을 말할 수 있는가」와 「무엇을 말할 수 없는가」를 같은 페이지에 나란히 두는 일입니다.
문장 예시로 가르면 검수하는 사람도 판단이 쉬워집니다.

표본 공개로 말할 수 있는 문장같은 데이터로 아직 말할 수 없는 문장
관측 기간 동안 몇 개 회사,
몇 명의 기록이 쌓였다
한국 중소기업 근로자는 평균 몇 시에 출근한다
기록의 상당 부분이 한 회사에서 나왔다업종별 출근 시각이 이만큼 다르다
이 축은 결측률이 높아 이번 회차에 공개하지 않는다결측을 제외하고 계산하면 이 비율이 된다
출근·퇴근이 한 쌍으로 남은 날의 비율은 이렇다따라서 실제 근로시간은 이렇다
특정 확인 방식의 기록이 관측됐다시장에서 그 방식의 점유율이 이렇다

오른쪽 문장들은 영원히 못 쓰는 것이 아니라 아직 못 쓰는 것입니다.
표본이 커지고 결측이 줄면 하나씩 왼쪽으로 옮겨 갑니다.
옮겨 갈 때는 무엇이 달라져서 옮겼는지를 함께 적습니다.

숫자를 아직 채우지 않은 이유

이 문서에 관측값이 없는 것은 데이터가 없어서가 아니라,
공개 전에 통과해야 할 게이트를 아직 다 통과하지 않았기 때문입니다.
게이트는 네 층이고 순서가 있습니다.

게이트통과 기준의 성격통과하지 못했을 때
처리 근거외부 공개 통계가 개인정보처리방침과 계약의 범위 안인지 책임자가 검토했는가공개 자체를 보류한다
표본전체·하위집단별 최소 회사 수·근로자 수·기록 수를 넘겼는가그 축을 내리고 총계만 공개한다
품질주장에 쓰는 축의 결측률이 상한 이하인가,
재계산이 독립 조회와 일치하는가
통계가 아니라 품질 보고서 형태로 바꿔 낸다
사람 검수최소 두 사람이 결과표와 방법론을 교차 검토했는가발행을 연기한다

네 층 모두 「통과하면 발행」이 아니라 「통과해야 발행」입니다.
통과하지 못한 회차는 실패가 아니라 설계대로 동작한 결과이며,
취소한 항목과 취소 사유도 공개 대상입니다.
취소 기록이 없는 데이터 공개는 취소한 적이 없다는 뜻이 아니라 기록하지 않았다는 뜻입니다.

또 하나.
이 시리즈는 인사책 사용 기록에서 나온 익명 집계와 정부·공공기관이 공표한 통계를 분리해 다룹니다.
두 종류를 한 표에 섞으면 출처가 흐려지고,
흐려진 출처는 인용되지 않습니다.
공공 통계 쪽 수치는 고용노동부·통계청 등 공표 기관의 원자료에서 직접 확인해 그 출처와 공표 시점을 함께 적습니다.

이 기준을 그대로 가져다 쓰려면

다른 서비스가 자사 데이터를 통계로 공개하려 할 때도 순서는 같습니다.
①공개 근거를 먼저 검토하고 ②축마다 위 네 칸(왜·작은 셀·재식별·결측)을 채우고 ③말할 수 있는 문장과 말할 수 없는 문장을 나란히 적고 ④편중 지표를 첫 화면에 두고 ⑤통과하지 못해 취소한 항목까지 함께 공개합니다.
이 다섯을 지키면 첫 발행물이 평균 하나짜리 보도자료보다 훨씬 오래 인용됩니다.

인사책 데이터랩의 후속 자료는 이 문서의 규격을 그대로 따릅니다.
축이 늘거나 기준이 바뀌면 이 문서를 고치고 수정 이력을 남깁니다.
값이 바뀐 수정과 설명이 바뀐 수정은 이력에서 구분해 적습니다.

수정 이력: 2026-09-22 최초 발행(방법론 편,
관측 수치 미포함).

권장 인용: 인사책 데이터랩, 「인사책 출퇴근 데이터는 어디까지 쌓였나 — 표본 현황을 공개하는 방법」,
2026-09-22 발행, https://insacheck.com/guides/playbook/출퇴근-데이터-표본-공개-기준

범위: 이 문서는 표본 공개의 방법론이며 관측 수치를 포함하지 않습니다. 수치를 담은 후속 자료는
인사책을 사용한 적격 회사의 익명 집계이며 대한민국 전체 사업체를 대표하지 않습니다.

자주 묻는 질문

왜 평균이 아니라 표본을 먼저 공개하나요?

인용은 숫자만 옮기고 조건은 남기기 때문입니다. 평균이 먼저 퍼지면 원문에 적어 둔 범위 표기와 무관하게 「한국 전체의 평균」으로 읽히고, 뒤늦은 설명은 정정이 되어 원래 숫자만큼 멀리 가지 못합니다. 표본 문서를 먼저 두면 이후에 내는 모든 수치가 그 범위 안에서 읽힙니다.

표에 숫자가 하나도 없는데 이게 자료인가요?

이 편은 방법론 편입니다. 관측 수치는 처리 근거·표본·품질·사람 검수 네 게이트를 모두 통과한 뒤 별도 회차에서 채웁니다. 어떤 축을 어떤 형태로 공개할지를 먼저 고정해 두면, 값이 채워질 때 설계를 결과에 맞춰 바꾸는 일을 막을 수 있습니다.

작은 셀은 구체적으로 어떻게 처리하나요?

억제(칸을 비우고 비운 이유와 비운 칸 수를 함께 표기), 합침(인접 구간과 묶고 합침 규칙 공개), 구간화(시각은 최소 1시간 구간처럼 정밀도를 낮춤), 축 내리기(그 회차에서 축 자체를 공개하지 않음) 네 가지입니다. 어느 방법을 썼는지 표 아래에 반드시 적고, 규칙은 결과를 보기 전에 정합니다.

회사별 이용량이나 업체명은 공개되나요?

공개하지 않습니다. 회사·근로자 식별자와 이름, 연락처, 정확한 위치와 기기 정보, 정확한 원시 시각은 공개 대상이 아닙니다. 「업체별」이라는 표현은 업종·규모·근무형태·출퇴근 확인 방식의 익명 집계를 뜻하며, 회사별 기록 건수를 나열한 순위표는 익명 집계가 아니라 고객사 지목이므로 만들지 않습니다.

게이트를 통과하지 못해 취소된 항목도 공개하나요?

공개합니다. 취소한 항목과 취소 사유를 남기지 않으면, 취소한 적이 없는 것과 기록하지 않은 것을 독자가 구분할 수 없습니다. 취소는 실패가 아니라 설계대로 동작한 결과이며, 취소 이력 자체가 이후 발행하는 수치의 신뢰 근거가 됩니다.
참고 안내

근거: 근로기준법 및 관련 법령 · 최근 업데이트: · 다음 검토: 분기별 검토

본 문서는 일반 정보 제공 목적이며,
개별 법률 자문이 아닙니다.
정확한 적용은 노무사/세무사 상담 권장.

관련 가이드

통장 입출금 원장 보기 — 월→일→거래 3단계 조회
통장별 장기 흐름에서 월, 일, 개별 거래 순으로 내려가 입출금과 원문에 포함된 잔액을 확인합니다.
법인 통장 등록하기 — 사용자·참조인·용도 설정
예금주명과 끝 6자리만 등록하고 OTP 사용자와 알림 참조인을 구분합니다.
무료 회사메일, 인사책에서 받고 보낸다
회사메일은 직원에게 이름@회사도메인 주소를 주고, 인사책 「나의 직장」 화면에서 메일을 받고 보내게 하는 기능입니다. 관리자가 회사 도메인을 연결하고 직원 명단에서 주소를 발급하며, 퇴사 처리하면 5분 안에 메일 접근이 막힙니다. 첨부 기준, 발송 상한, 메일 보관 위치까지 정리했습니다.
카페 출퇴근 NFC 스티커 도입 — 주문부터 태그까지 3일 플랜
직원이 교대로 일하는 카페에 NFC 출퇴근 스티커를 도입하는 3일 플랜. 스마트스토어 주문, 입구 부착, 직원 태그 안내까지 날짜별로 정리했습니다.
알바 주휴수당 걱정 끝 — 주 15시간 경계 자동 확인 세팅
알바 주휴수당의 기준인 주 15시간 경계를 출퇴근 기록으로 자동 확인하는 세팅. 주별 근로시간 자동 집계로 지급 대상 판단이 명확해집니다.
연차 엑셀 관리 졸업 — 입사일 기준 자동 발생·잔여 세팅
엑셀 연차 관리표를 졸업하고 입사일 기준 자동 발생·잔여 확인으로 넘어가는 세팅. 직원 스스로 잔여 연차를 확인해 문의가 사라집니다.