정답 번호 분포는 「어느 번호가 조금 더 많고 적었나」로 끝내기 쉬운 소재다. 그런데 이번 집계에서 눈에 띈 건 전체의 작은 차이가 아니라 — 그 차이는 아래에서 보듯 균등분포와 통계적으로 구분되지 않는다 — 영역을 쪼개자 ①번의 방향이 뒤집혔다는 점이다. 저희 영어 기출 enriched DB로 20142025 시행연도(=20152026학년도) 공식 3대 시험(수능·6월모평·9월모평) 1,620문항의 정답 번호를 세어 보았다.
한눈에: 1,620문항 전체에서 ①303개(18.70%)·②326개(20.12%)·③330개(20.37%)·④330개(20.37%)·⑤331개(20.43%)로, ①번만 혼자 20%에 못 미친다(다만 이 차이는 균등분포와 유의하게 다르지 않다: χ²=1.75, p=0.78). 영역을 나누면 방향이 갈린다. 읽기 1,008문항은 ①17.2%(최저)·⑤21.3%(최고)인 반면, 듣기 612문항은 ①21.2%가 오히려 최고이고 ②·⑤가 19.0%로 최저다. 수능 본시험 12회(540문항)만 따로 봐도 ①18.5%가 최저, ④21.1%가 최고다. 다만 읽기를 연도별로 쪼개면 ①번이 그 해 최저였던 해는 12개년 중 7개년뿐이다 — ①번의 적음은 누적했을 때 보이는 것이지 매 회차에 반복되는 규칙이 아니다.
무엇을 어떻게 세었나
| 자료 | 실물 | 용도 |
|---|---|---|
| 영어 기출 enriched DB | nero_tools/enriched/gichul_e_db_enriched.csv — 2014~2025 시행연도, 6,615문항, BOM 있는 UTF-8(encoding='utf-8-sig') | 이 글의 모든 수치 |
| 위 파일의 공식 3대 시험 부분집합 | ’시행’ 컬럼이 수능·6월모평·9월모평인 1,620문항 | 전체·영역별·연도별 집계 |
| 위 부분집합의 수능 본시험 부분 | ’시행’ == 수능, 12개년 540문항 | 본시험 단독 집계 |
로컬 데이터 파일이라 공개 링크는 없다. 대신 각 수치를 재현하는 코드를 그대로 적는다.
df = pd.read_csv(path, encoding='utf-8-sig')
off = df[df['시행'].isin(['수능', '6월모평', '9월모평'])] # 1,620문항
off['정답'].value_counts() # 전체 분포
off.groupby('영역')['정답'].value_counts(normalize=True) # 읽기 / 듣기
df[df['시행'] == '수능']['정답'].value_counts(normalize=True) # 본시험 540문항
reading = off[off['영역'] == '읽기'] # 1,008문항
reading.groupby('연도')['정답'].value_counts(normalize=True) # 연도별
두 가지를 미리 못 박는다. 첫째, 이 글의 1,620문항은 공식 3대 시험 한정이다. 파일 전체는 학력평가(고1·고2·고3 모의고사)를 포함한 6,615문항이고, 그 기준으로는 세지 않았다. 둘째, 파일의 ‘연도’ 컬럼은 시행연도이며 학년도는 여기에 +1이다. 아래 연도별 표의 연도 값은 이 컬럼을 그대로 옮긴 것이다.
이 글에서 쓰는 말
- 공식 3대 시험 — 수능 본시험·6월 모의평가·9월 모의평가. 이 글의 집계 단위이며, 학력평가는 포함하지 않는다.
- 균등 대비 편차 — 선택지가 다섯이므로 완전 균등이면 각 20%, 1,620문항이면 각 324개다. 아래 표의 편차 열은 이 20%를 기준으로 뺀 계산값이다.
- 누적 집계 / 연도별 집계 — 12개년을 한 덩어리로 세는 것과, 해마다 따로 세는 것. 이 글의 결론이 갈리는 지점이다.
1,620문항 전체 — ①번만 혼자 20% 아래
| 선택지 | 문항 수 | 비율 | 균등(20%) 대비 |
|---|---|---|---|
| ① | 303 | 18.70% | −1.30%p |
| ② | 326 | 20.12% | +0.12%p |
| ③ | 330 | 20.37% | +0.37%p |
| ④ | 330 | 20.37% | +0.37%p |
| ⑤ | 331 | 20.43% | +0.43%p |
| 합계 | 1,620 | — | — |
②부터 ⑤까지는 20.12%~20.43% 사이에 촘촘히 모여 있다. 넷을 다 합쳐도 폭이 0.31%p다. 혼자 떨어져 있는 건 ①번 하나뿐이고, 균등 기대치 324개보다 21개가 적다. 최고인 ⑤번(331개)과는 28문항 차이다.
이 차이가 우연과 구별되는가 — 아니다
숫자를 세는 것과 「규칙이 있다」고 말하는 것은 다른 일이다. 위 다섯 값을 균등분포(각 324개) 기준으로 카이제곱 검정하면 χ² = 1.75, 자유도 4, p = 0.78이다. 어떤 통상적 유의수준에도 걸리지 않는다. 쪼개도 마찬가지다 — 읽기 χ²=5.45(p=0.24), 듣기 χ²=1.32(p=0.86), 수능 본시험 540문항 χ²=1.02(p=0.91).
그래서 이 글의 표는 두 가지를 동시에 뜻한다.
- 기록으로서는 사실이다. 12개년 공식 3대 시험은 표본이 아니라 그 기간의 전수다. 실제로 ①번은 303개였고 ⑤번은 331개였다.
- 규칙으로서는 근거가 없다. 이 분포를 「출제진이 ①번을 덜 쓴다」거나 「다음 회차도 그럴 것」으로 읽을 통계적 근거는 이 데이터에 없다.
아래는 전부 첫 번째 의미, 즉 지난 12년에 무엇이 있었나의 기록이다. 그리고 그 기록에서 볼 만한 자리는 전체 분포가 아니라 영역을 쪼갠 다음이다.
읽기와 듣기는 ①번의 방향이 반대였다
같은 1,620문항을 ‘영역’ 컬럼으로 갈라 보았다.
| 영역 | 문항 수 | 가장 적은 선택지 | 가장 많은 선택지 | 격차(계산값) |
|---|---|---|---|---|
| 읽기 | 1,008 | ① 17.2% | ⑤ 21.3% | 4.2%p |
| 듣기 | 612 | ②·⑤ 각 19.0% | ① 21.2% | 2.3%p |
읽기에서 최저였던 ①번이 듣기에서는 최고다. 그리고 편차의 크기도 다르다. 읽기의 최저-최고 격차는 4.2%p로, 전체 1,620문항 집계의 격차(⑤ 20.43% − ① 18.70% = 1.73%p)보다 두 배 이상 벌어져 있다. 듣기의 격차는 2.3%p다.
전체 집계에서 ①번이 낮게 나온 것은, 문항 수가 더 많은 읽기(1,008 대 612)에서 ①번이 적은 정도가 듣기에서 많은 정도를 넘어선 결과로 읽힌다. 바꿔 말하면 「수능 영어는 ①번이 적다」와 「읽기는 ①번이 적다」는 같은 문장이 아니다. 듣기까지 뭉뚱그린 순간, 읽기에서 실제로 벌어져 있는 4.2%p는 1.73%p로 절반 이하가 되어 보인다.
다만 이 집계는 ‘영역’ 대분류(읽기/듣기) 기준일 뿐이다. 빈칸추론·순서배열 같은 문항 유형별 분포는 이번에 확인하지 않았다. 읽기 1,008문항 안에서 어느 유형이 ①번이 적은 쪽을 끌고 가는지는 이 글의 수치로 답할 수 없다.
수능 본시험만 따로 봐도
6월·9월 모평을 빼고 수능 본시험 12회(540문항)만 세면 이렇게 나온다.
| 구분 | 표본 | 최저 | 최고 | 격차(계산값) |
|---|---|---|---|---|
| 공식 3대 시험 | 1,620문항 | ① 18.70% | ⑤ 20.43% | 1.73%p |
| 수능 본시험만 | 540문항 | ① 18.5% | ④ 21.1% | 2.6%p |
최저가 ①번이라는 점은 두 집계가 같다. 그런데 최고 선택지는 ⑤에서 ④로 바뀐다. 표본을 3분의 1로 줄이면 상위권 순위는 자리를 바꾸고, ①번만 자리를 지킨다 — 이게 이번 집계에서 ①번 쪽만 따로 이야기하는 이유다.
그런데 연도별로 보면 — 누적해야 겨우 보인다
읽기 1,008문항을 연도(시행연도)로 쪼개, 해마다 그 해 최저 비율을 기록한 선택지가 ①번이었는지 확인했다.
| 시행연도 | 읽기에서 ①번이 그 해 최저였나 |
|---|---|
| 2014 | ✅ |
| 2015 | ✅ |
| 2016 | ❌ |
| 2017 | ❌ |
| 2018 | ❌ |
| 2019 | ❌ |
| 2020 | ✅ |
| 2021 | ✅ |
| 2022 | ❌ |
| 2023 | ✅ |
| 2024 | ✅ |
| 2025 | ✅ |
| 합계 | 7 / 12개년 |
12개년 중 7개년이다. 2016~2019는 네 해 연속으로 ①번이 최저가 아니었다. 그러니 이 글이 말할 수 있는 것은 **「1,008문항을 누적하면 ①번이 관측 최저」**까지이고, 「매년 예외 없이 ①번이 최저」는 이 데이터로 뒷받침되지 않는다. 다음 한 회차의 정답 배치를 이 집계로 앞질러 말할 근거도 여기엔 없다.
그리고 왜 그런지는 이 글에 없다. 정답 번호가 ①번에 적게 배정되는 이유(출제 관행이든 의도든)에 대한 평가원 측 공식 설명은 이번에 확인하지 못했다. 국어 영역에서도 이런 영역별(독서/문학 등) 역전이 나타나는지 역시 확인하지 않았다. 이 글은 분포를 센 기록이지 원인을 밝힌 기록이 아니다.
이 파일이 아직 답하지 못하는 것
같은 파일에 ‘오답률’ 컬럼이 있다. 난이도와 정답 번호를 엮으면 「어려운 문항일수록 특정 번호로 몰리는가」를 물을 수 있겠지만, 이 컬럼은 공식 3대 시험 1,620행 중 **135행(8%)**만 채워져 있다. 92%가 빈칸인 컬럼으로는 그 질문에 답할 수 없어 이번 집계에서 제외했다.
정리하면 이 글이 센 것은 셋이다. 공식 3대 시험 1,620문항에서 ①번 18.70%가 최저라는 것, 그 편차가 읽기(①17.2% 최저)와 듣기(①21.2% 최고)에서 반대 방향으로 나타난다는 것, 그리고 수능 본시험 540문항만 봐도 ①18.5%가 최저라는 것. 읽기 연도별로는 12개년 중 7개년에서만 ①번이 최저였으므로, 이 차이는 누적해야 겨우 보이는 크기이고 그 누적조차 균등분포와 통계적으로 구분되지는 않는다. 다음으로 셀 것은 정해져 있다 — 읽기 1,008문항을 문항 유형별로 다시 쪼개는 일이다.
데이터 출처: 영어 기출 enriched DB 자체 집계 · nero_tools/enriched/gichul_e_db_enriched.csv(2014~2025 시행연도, 6,615문항, encoding='utf-8-sig'). 이 글의 집계 대상은 그중 ‘시행’이 수능·6월모평·9월모평인 1,620문항이다.
이 글은 코그닉스랩의 자체 조사·집계로 작성되었습니다. 출처: 수능 영어 정답 번호 — 읽기 1,008문항에서 ①번이 가장 적었다 — 코그닉스랩