정치한번 읽어볼까 · 서비스 안내
분석 방법
키워드는 어떻게 뽑고, 화면의 숫자는 무엇을 세는지 설명합니다.
01 · 분석 대상
화면마다 사용하는 자료가 다릅니다
- 시·도지사 · 시·군·구청장
- 중앙선거관리위원회 공개 API에서 수집한 공약 제목·요약·상세 텍스트를 사용합니다. 후보자 정보와 선거 결과를 연결해 조건별로 비교합니다.
- 교육감
- 수집한 5대공약 PDF에서 추출한 텍스트를 사용합니다. 저장된 분석 결과를 키워드·분야·반복 문구로 나누어 보여줍니다.
- 홈의 분석 미리보기
- 미리 생성해 저장한 단체장 분석을 사용합니다. 현재 검색 DB와 대상·시점이 다를 수 있습니다.
현재 저장 분석의 선거는 2026년 6월 3일 지방선거입니다. 실제 수록 현황과 생성일은 데이터 출처에서 확인할 수 있습니다.
02 · 처리 과정
자료에서 탐색 가능한 키워드로
- 공개 자료 수집
후보자와 선거를 기준으로 공약 텍스트, 선거 결과, 원문 자료를 연결합니다.
- 텍스트 정리
띄어쓰기와 문서 표기를 정리하고, 이름·지역명·문서 양식처럼 정책 내용을 찾는 데 도움이 적은 표현을 집계에서 제외합니다. 제외 규칙은 분석별로 다릅니다.
- 단어·반복 표현 집계
단체장 공약은 토큰과 연속 구문을, 교육감 공약은 정해진 키워드 사전과 반복 표현을 기준으로 집계합니다.
- 조건별 탐색과 원문 확인
집계값을 시각화하고 관련 공약을 연결합니다. 공약 상세의 원문 PDF에서 실제 표현을 확인할 수 있습니다.
03 · 지표 정의
후보 수, 공약 수, 등장 횟수
- 후보 수
- 해당 표현을 언급한 후보자 수입니다. 한 후보가 여러 공약에서 언급해도 후보는 한 명으로 셉니다.
- 공약 수
- 해당 표현을 포함하는 공약 수입니다. 같은 공약 안에서 반복해도 공약은 한 개로 셉니다.
- 등장 횟수
- 정리된 텍스트에서 표현이 집계된 횟수입니다. 단체장 대표 구문은 같은 공약 안의 중복 구문을 제거하므로 원문의 모든 반복 횟수와 다를 수 있습니다.
후보 수는 1명, 공약 수는 2개입니다. 단어 등장 횟수는 5회일 수 있습니다. 이 예시는 지표 차이를 설명하기 위한 가상 사례입니다.
04 · 단체장 분석
크기와 순위는 서로 다른 기준입니다
워드클라우드의 글자 크기는 해당 표현을 언급한 공약 수를 나타냅니다. 제곱근을 적용하고 크기 범위를 제한해 큰 값이 화면을 압도하지 않도록 했습니다. 색은 단어를 구분하기 위한 것으로, 정당·정책 분야·당선 여부를 뜻하지 않습니다.
키워드 선정과 TOP 10은 자체 관련도순입니다. 등장 빈도, 후보별 언급 비율, 전체 후보 중 희소성, 구문 길이를 함께 반영하고 겹치는 구문을 정리합니다. 따라서 공약 수가 많은 표현이 항상 먼저 나오지는 않습니다.
일반적인 표현과 단독으로 등장하는 구문 일부를 제외합니다. 지역·정당 등의 조건을 바꾸면 비교 대상과 결과가 바뀝니다. 키워드를 선택하면 해당 표현이 연결된 공약을 확인할 수 있습니다.
관련도 산식과 집계 규칙 자세히 보기
기본 점수 = log(1 + 집계 횟수) × 희소성 × 언급 비율 보정 × 구문 길이 가중치
- 희소성: log((전체 후보 수 + 1) / (언급 후보 수 + 1)) + 1
- 언급 비율 보정: 0.5 + min(언급 후보 수 / 전체 후보 수, 0.4)
- 구문 길이 가중치: 2단어 1.15, 3단어 1, 그 외 0.85. 일반 단어는 1을 적용합니다.
- 대상이 20명보다 많을 때 한 공약·한 후보에서만 등장하는 구문을 제외합니다. 이후 대표 구문 선정 과정에서 중복·유사 구문을 정리합니다.
이 점수는 탐색할 표현을 정렬하기 위한 값이며, 후보자나 정책의 평가 점수가 아닙니다.
05 · 교육감 및 분야 집계
정해진 표현과 반복 문구를 찾습니다
교육감 5대공약 PDF의 텍스트에서 미리 정한 교육 정책 표현을 찾습니다. 일부 띄어쓰기·기호 차이를 정리하고, ‘인공지능’과 ‘AI’는 합쳐 집계합니다. 분야별 값은 그 분야에 배정한 키워드의 집계값을 더합니다.
반복 문구는 정리한 단어의 2~3개 연속 조합을 찾는 방식입니다. 자동으로 문장의 의미를 이해하거나 같은 뜻의 모든 표현을 묶는 분석은 아닙니다. PDF의 텍스트 추출 상태도 결과에 영향을 줍니다.
홈 분야별 비중은 저장된 분야별 키워드 집계값의 합을 분모로 계산합니다. 후보자 비율이나 지지율이 아닙니다. 하나의 공약에 여러 분야의 키워드가 있거나 서로 겹치는 표현이 집계될 수 있습니다.
06 · 해석의 한계
숫자와 함께 살펴봐야 할 것
- 자료 미수집과 추출 실패로 분석에서 빠지는 후보·공약이 있을 수 있습니다.
- 공약의 길이와 작성량이 다르면 단순 등장 횟수에도 차이가 생깁니다.
- 토큰·규칙 기반 집계는 동의어, 문맥, 부정 표현을 완전히 구분하지 못합니다.
- 당선·낙선 집단의 차이는 관찰된 공약 텍스트의 차이입니다. 공약의 당선 효과나 투표 동기를 증명하지 않습니다.
- 검색 DB와 저장 분석의 갱신 시점은 다를 수 있습니다. 서로 다른 화면의 수치를 비교할 때 기준일과 대상을 확인하세요.
07 · 변경 이력
방법 안내 변경 이력
· 분석 방법 안내 페이지를 만들고, 단체장·교육감의 자료 차이와 워드클라우드의 크기·순위 기준을 구분했습니다.
안내문 수정일입니다. 데이터 수집일이나 분석 생성일과는 다릅니다.