인사책 출퇴근 데이터는 어디까지 쌓였나 — 표본 현황을 공개하는 방법
인사책 데이터랩이 자체 데이터를 다루는 첫 회차로 평균이 아니라 표본 설명을 고른 이유와,
근태 데이터를 공개하기 전에 정해야 할 축·작은 셀·편중·결측 기준을 정리했습니다.
평균을 먼저 발표하면 아무도 표본을 묻지 않는다
근태 데이터를 쌓은 회사가 가장 먼저 발표하고 싶어 하는 숫자는 대개 평균입니다.
평균 출근 시각,
평균 근로시간,
평균 초과근로.
한 줄로 끝나기 때문에 인용하기 쉽고,
인용하기 쉬운 만큼 어디서 온 값인지 확인되지 않은 채 옮겨집니다.
문제는 인용이 원문을 떠나는 순간 범위가 떨어져 나간다는 데 있습니다.
원문에 「우리 서비스를 쓰는 회사 몇 곳의 관측값」이라고 적어 두어도,
두 번째 인용자는 「한국 중소기업의 평균」이라고 씁니다.
세 번째 인용자는 원문을 아예 보지 않습니다.
숫자만 살아남고 조건은 죽는 것이 인용의 기본 성질입니다.
인사책 데이터랩이 자체 데이터를 다루는 첫 회차를 평균이 아니라 표본 설명으로 잡은 이유가 여기에 있습니다.
표본을 먼저 공개하면 이후에 내는 모든 수치가 그 범위 안에서 읽힙니다.
반대 순서는 되돌릴 수 없습니다 — 평균이 먼저 퍼진 뒤에 표본을 설명하는 것은 공개가 아니라 정정이고,
정정은 원래 숫자만큼 멀리 가지 않습니다.
이 글에는 실제 관측 수치가 들어 있지 않습니다.
그리고 뒤에 수치를 채우더라도 그것은 인사책을 사용한 회사의 익명 집계일 뿐,
한국 전체 근로자의 행동 통계가 아닙니다.
수치는 아래 「숫자를 아직 채우지 않은 이유」에서 설명하는 게이트를 통과한 뒤 별도 회차에서 채웁니다.
여기서 정하는 것은 그 회차가 무엇을,
어떤 형태로 공개할지의 규격입니다.
표본을 먼저 공개하면 세 가지가 달라진다
인용하는 쪽이 범위를 함께 옮긴다
표본 문서가 먼저 있으면,
나중에 나올 평균은 「이 표본에서의 평균」이라는 이름을 달고 나옵니다.
인용자가 링크를 걸 곳이 숫자 페이지 하나가 아니라 방법론 페이지까지 두 개가 되고,
편집자·연구자처럼 조건을 확인하는 독자는 그 두 번째 링크를 실제로 누릅니다.
조건을 확인할 수 있게 만들어 두는 것 자체가 인용 가치입니다.
반박이 데이터 개선으로 돌아온다
평균을 발표하면 돌아오는 반응은 「그 숫자 틀린 것 같은데요」입니다.
표본을 발표하면 돌아오는 반응은 「업종 분류를 이렇게 나누면 우리 회사는 어디에 들어가나요」입니다.
앞의 것은 방어를 부르고 뒤의 것은 개선을 부릅니다.
데이터를 계속 낼 계획이라면 두 번째 대화가 훨씬 쌉니다.
나중에 낼 평균의 신뢰가 미리 적립된다
약점을 먼저 적어 둔 문서는 나중에 강점을 말할 때 힘을 얻습니다.
「이 축은 결측률이 높아 아직 공개하지 않습니다」라고 써 둔 곳이,
나중에 「이 축은 기준을 넘겼습니다」라고 쓸 때의 근거가 됩니다.
숨긴 것이 없다는 사실은 선언이 아니라 이력으로 증명됩니다.
공개할 축과 공개하지 않을 축 — 설계표
표본 공개는 「가진 것을 다 보여 주는 일」이 아닙니다.
축마다 공개 이유가 다르고,
작은 셀을 다루는 방식이 다르고,
재식별 위험의 크기도 다릅니다.
축을 정할 때는 네 칸을 동시에 채워야 하며,
한 칸이라도 비면 그 축은 아직 공개 대상이 아닙니다.
| 공개할 축 | 왜 그 축인가 | 작은 셀 처리 | 재식별 위험 |
|---|---|---|---|
| 관측 기간 (시작일·종료일·시간대) | 모든 값의 유효기간을 정한다. 기간이 없으면 어떤 수치도 최신인지 판단할 수 없다 | 해당 없음 — 셀이 아니라 범위 표기다 | 없음. 다만 개별 기록의 정확한 시각·날짜는 공개하지 않는다 |
| 회사 수 | 표본의 모수. 「몇 명」보다 「몇 개 회사」가 대표성의 1차 상한이다 | 총계만 공개. 하위 축과 교차했을 때 회사 수가 기준 미만이면 그 행 자체를 숨긴다 | 낮음. 단 회사 수가 한 자리면 업종과 결합해 특정될 수 있다 |
| 근로자 수 | 회사 수만으로는 규모를 알 수 없다. 회사당 인원 편차를 드러낸다 | 하위 셀이 근로자 기준에 미달하면 상위 구간에 합친다 | 낮음. 개인 식별자와 소속은 어떤 형태로도 공개하지 않는다 |
| 기록(이벤트) 수 | 활동 밀도. 회사 수와 근로자 수가 같아도 기록량은 크게 다르다 | 총계와 편중 지표만. 회사별 원시 건수를 나열하지 않는다 | 낮음~중간. 회사별 건수 나열은 사실상 고객사 이용량 공개다 |
| 회사별 기여 비중(편중) | 평균을 발행할 수 있는지 없는지를 가르는 축. 최대 기여 회사의 비중은 반드시 함께 공개한다 | 상위 1개사 비중만 표기하고 순위표는 만들지 않는다 | 중간. 순위표는 익명 집계가 아니라 고객사 지목이 된다 |
| 업종 | 「업체별로 다른가」라는 질문에 답할 수 있는 사실상 유일한 익명 축 | 어휘를 먼저 정규화하고, 기준 미달 업종은 「기타」로 합친 뒤 합침 규칙을 함께 공개한다 | 중간. 지역·규모와 교차하면 회사가 특정된다 |
| 사업장 규모 구간 | 법률 구간(5인 미만 등)과 통계조사 구간이 달라 오독이 가장 잦은 자리 | 구간을 넓게 잡는다. 한 구간의 회사 수가 기준 미만이면 인접 구간과 합친다 | 중간 |
| 지역 | 요구는 많지만 입력 완성도가 가장 낮은 축 | 결측률이 상한을 넘으면 셀을 합치는 대신 축 자체를 공개하지 않는다 | 높음. 지역·업종·규모 세 축이 겹치면 소수 회사가 특정된다 |
| 출퇴근 확인 방식 | 제품을 통해서만 관측되는 고유 축. 다른 통계에서 얻기 어렵다 | 방식별 회사 수·근로자 수가 기준 미만이면 그 방식 행을 숨긴다 | 중간. 특정 방식을 쓰는 회사가 소수면 방식 이름이 곧 지목이 된다 |
| 결측률 | 위 축들을 얼마나 믿을 수 있는지의 척도. 숨기면 나머지 전부가 과장된다 | 해당 없음 — 결측 자체가 공개 대상이다 | 없음 |
표를 이렇게 짜 두면 「이 축은 왜 없나요」라는 질문에 매번 같은 답을 할 수 있습니다.
축이 빠진 이유가 문서 안에 있는 것과,
물어봐야 알 수 있는 것은 신뢰에서 큰 차이를 만듭니다.
작은 셀을 어떻게 처리할 것인가
표를 잘게 쪼갤수록 각 칸에 들어가는 회사와 사람의 수는 줄어듭니다.
칸이 충분히 작아지면 그 칸은 통계가 아니라 특정 회사의 기록이 됩니다.
처리 방법은 네 가지뿐이고,
어느 것을 썼는지 표 아래에 적어야 합니다.
억제 — 칸을 비우고 비운 이유를 적는다
기준 미달 칸을 값 대신 표시 기호로 두고,
기호의 뜻을 표 아래에 정의합니다.
비운 칸이 몇 개인지도 함께 밝힙니다.
비운 칸의 개수를 숨기면 독자가 남은 칸을 전체로 오인합니다.
합침 — 인접 구간과 묶는다
규모 구간이나 업종처럼 순서나 유사성이 있는 축은 인접한 것끼리 묶습니다.
다만 합치는 규칙을 결과를 보고 정하면 안 됩니다.
어떤 값이 나오는지 본 뒤에 구간을 조정하는 것은 결론에 맞춘 설계이며,
방법론이 아니라 편집입니다.
구간화 — 값의 정밀도를 낮춘다
시각은 정확한 분 단위 대신 최소 1시간 구간으로,
인원은 정확한 수 대신 구간으로 냅니다.
정밀도를 낮추면 같은 데이터로도 공개 가능한 범위가 넓어집니다.
축 내리기 — 이번 회차에서 뺀다
앞의 셋으로도 안 되면 그 축은 이번에 공개하지 않습니다.
결측률이 상한을 넘은 축이 특히 그렇습니다.
결측을 빼고 계산한 비율은 「남은 것들 중의 비율」인데,
표에 적히는 순간 「전체 중의 비율」로 읽히기 때문입니다.
편중은 감추는 것이 아니라 같이 싣는 것
회사 동일가중과 기록 가중은 다른 답을 낸다
한 회사가 전체 기록의 상당 부분을 차지하는 표본에서 원시 기록을 그대로 평균 내면,
그 결과는 표본 전체의 성질이 아니라 그 한 회사의 성질에 가깝습니다.
회사마다 같은 가중치를 주면 값이 달라지고,
어느 쪽도 그 자체로 틀린 것은 아닙니다.
틀리는 것은 어느 쪽을 썼는지 밝히지 않는 경우입니다.
기여 상한은 사전에 선언한다
한 회사가 기여할 수 있는 최대 비중을 미리 정해 두고,
그 상한을 적용했는지 여부를 표마다 표기합니다.
상한을 결과를 본 뒤에 정하면 그것은 가중이 아니라 조정입니다.
사전에 선언한 규칙만이 방법론이 됩니다.
편중 지표는 본문 첫 화면에 둔다
최대 기여 회사의 비중은 부록이 아니라 요약 카드에 들어가야 합니다.
이 숫자가 뒤로 밀리는 순간,
표본 문서는 「약점을 적어 둔 문서」가 아니라 「약점을 적어 두기는 한 문서」가 됩니다.
표본과 행동 통계의 경계 — 문장 단위로 가른다
표본 공개는 「무엇을 말할 수 있는가」와 「무엇을 말할 수 없는가」를 같은 페이지에 나란히 두는 일입니다.
문장 예시로 가르면 검수하는 사람도 판단이 쉬워집니다.
| 표본 공개로 말할 수 있는 문장 | 같은 데이터로 아직 말할 수 없는 문장 |
|---|---|
| 관측 기간 동안 몇 개 회사, 몇 명의 기록이 쌓였다 | 한국 중소기업 근로자는 평균 몇 시에 출근한다 |
| 기록의 상당 부분이 한 회사에서 나왔다 | 업종별 출근 시각이 이만큼 다르다 |
| 이 축은 결측률이 높아 이번 회차에 공개하지 않는다 | 결측을 제외하고 계산하면 이 비율이 된다 |
| 출근·퇴근이 한 쌍으로 남은 날의 비율은 이렇다 | 따라서 실제 근로시간은 이렇다 |
| 특정 확인 방식의 기록이 관측됐다 | 시장에서 그 방식의 점유율이 이렇다 |
오른쪽 문장들은 영원히 못 쓰는 것이 아니라 아직 못 쓰는 것입니다.
표본이 커지고 결측이 줄면 하나씩 왼쪽으로 옮겨 갑니다.
옮겨 갈 때는 무엇이 달라져서 옮겼는지를 함께 적습니다.
숫자를 아직 채우지 않은 이유
이 문서에 관측값이 없는 것은 데이터가 없어서가 아니라,
공개 전에 통과해야 할 게이트를 아직 다 통과하지 않았기 때문입니다.
게이트는 네 층이고 순서가 있습니다.
| 게이트 | 통과 기준의 성격 | 통과하지 못했을 때 |
|---|---|---|
| 처리 근거 | 외부 공개 통계가 개인정보처리방침과 계약의 범위 안인지 책임자가 검토했는가 | 공개 자체를 보류한다 |
| 표본 | 전체·하위집단별 최소 회사 수·근로자 수·기록 수를 넘겼는가 | 그 축을 내리고 총계만 공개한다 |
| 품질 | 주장에 쓰는 축의 결측률이 상한 이하인가, 재계산이 독립 조회와 일치하는가 | 통계가 아니라 품질 보고서 형태로 바꿔 낸다 |
| 사람 검수 | 최소 두 사람이 결과표와 방법론을 교차 검토했는가 | 발행을 연기한다 |
네 층 모두 「통과하면 발행」이 아니라 「통과해야 발행」입니다.
통과하지 못한 회차는 실패가 아니라 설계대로 동작한 결과이며,
취소한 항목과 취소 사유도 공개 대상입니다.
취소 기록이 없는 데이터 공개는 취소한 적이 없다는 뜻이 아니라 기록하지 않았다는 뜻입니다.
또 하나.
이 시리즈는 인사책 사용 기록에서 나온 익명 집계와 정부·공공기관이 공표한 통계를 분리해 다룹니다.
두 종류를 한 표에 섞으면 출처가 흐려지고,
흐려진 출처는 인용되지 않습니다.
공공 통계 쪽 수치는 고용노동부·통계청 등 공표 기관의 원자료에서 직접 확인해 그 출처와 공표 시점을 함께 적습니다.
이 기준을 그대로 가져다 쓰려면
다른 서비스가 자사 데이터를 통계로 공개하려 할 때도 순서는 같습니다.
①공개 근거를 먼저 검토하고 ②축마다 위 네 칸(왜·작은 셀·재식별·결측)을 채우고 ③말할 수 있는 문장과 말할 수 없는 문장을 나란히 적고 ④편중 지표를 첫 화면에 두고 ⑤통과하지 못해 취소한 항목까지 함께 공개합니다.
이 다섯을 지키면 첫 발행물이 평균 하나짜리 보도자료보다 훨씬 오래 인용됩니다.
인사책 데이터랩의 후속 자료는 이 문서의 규격을 그대로 따릅니다.
축이 늘거나 기준이 바뀌면 이 문서를 고치고 수정 이력을 남깁니다.
값이 바뀐 수정과 설명이 바뀐 수정은 이력에서 구분해 적습니다.
수정 이력: 2026-09-22 최초 발행(방법론 편,
관측 수치 미포함).
권장 인용: 인사책 데이터랩, 「인사책 출퇴근 데이터는 어디까지 쌓였나 — 표본 현황을 공개하는 방법」,
2026-09-22 발행, https://insacheck.com/guides/playbook/출퇴근-데이터-표본-공개-기준
범위: 이 문서는 표본 공개의 방법론이며 관측 수치를 포함하지 않습니다. 수치를 담은 후속 자료는
인사책을 사용한 적격 회사의 익명 집계이며 대한민국 전체 사업체를 대표하지 않습니다.
자주 묻는 질문
왜 평균이 아니라 표본을 먼저 공개하나요?
표에 숫자가 하나도 없는데 이게 자료인가요?
작은 셀은 구체적으로 어떻게 처리하나요?
회사별 이용량이나 업체명은 공개되나요?
게이트를 통과하지 못해 취소된 항목도 공개하나요?
근거: 근로기준법 및 관련 법령 · 최근 업데이트: · 다음 검토: 분기별 검토
본 문서는 일반 정보 제공 목적이며,
개별 법률 자문이 아닙니다.
정확한 적용은 노무사/세무사 상담 권장.