문항 유형을 세는 일은 시험지만 있으면 된다. 세기 어려운 것은 그다음이다 — 그 문항이 학생에게 어떤 종류의 사고를 시키는가. 코그닉스랩은 기출 문항을 DB로 쌓으면서 이 축을 따로 태깅해 왔고, 2014~2025 시행연도 12개 연도 어느 해도 통째로 빠지지 않았다. 그래서 이 DB로 양 끝 4개년을 맞대어 볼 수 있었다. 다만 세어 보니, 그 비교에는 먼저 치워야 할 함정이 하나 있었다.
한눈에: 영역이 「읽기」인 문항 4,116개 중 사고유형이 태깅된 3,760개(91.4%)를 셌다. 12년 누적 분포는 사실적이해 29.5% · 추론적이해 21.7% · 논리적구조파악 21.4% · 대의파악 14.4% · 어휘맥락판단 9.4% · 종합적용 3.6%. 앞 4개년(2014
2017)과 뒤 4개년(20222025)을 비교할 때는 학년 구성을 맞춰야 한다 — 앞 구간에는 고1·고2 학력평가가 0문항, 뒤 구간에는 **53.4%**다. 고3급으로 맞춰(718 대 715) 비교하면 사실적이해 32.7%→29.4%, **대의파악 16.3%→14.0%**로 줄고 추론적이해 18.7%→21.4%, **어휘맥락판단 7.1%→10.5%**로 늘었다. 논리적구조파악(21.6%→21.1%)과 종합적용(3.6%→3.6%)은 거의 그대로다. 방향은 자르는 방식 넷에서 모두 같았지만, 유의성 검정은 통과하지 못했다(χ²=8.61, p=0.13).
무엇을 어떻게 세었나
사용한 자료는 하나다.
| 자료 | 실물 | 용도 |
|---|---|---|
| cognixlab 영어 기출 enriched DB(자체 태깅) | C:\WithNero\nero_tools\enriched\gichul_e_db_enriched.csv | 영역·연도·시행·사고유형 집계 |
| └ 영역=‘읽기’ | 4,116문항 | 모집단 |
| └ 그중 사고유형 태깅 | 3,760문항(91.4%) | 이 글의 집계 대상 |
| └ 태깅 없음 | 356문항(8.6%) | 집계에서 빠짐 |
집계는 파이썬 한 줄씩이다. df=pd.read_csv(..., encoding='utf-8-sig')로 읽고, read=df[df['영역']=='읽기']로 읽기 문항만 남긴 뒤, read['사고유형'].notna().sum()으로 태깅 수를, read.groupby('연도')['사고유형'].count()로 연도별 분포를, read['사고유형'].value_counts(dropna=True)로 유형 분포를 센다. 두 구간 비교는 read[read['연도'].between(2014,2017)]과 read[read['연도'].between(2022,2025)]를 각각 잘라 같은 value_counts를 돌린 값이고, 학년 구성을 맞출 때는 여기에 read['시행'] 조건을 하나 더 건다.
연도별 태깅 문항 수는 가장 적은 해가 2015년 169건이다. 어느 해도 0이 아니므로 특정 연도가 통째로 빠져서 생기는 왜곡은 없다. 다만 이것은 「모든 연도에 태깅된 문항이 있다」는 뜻이지 「결측이 없다」는 뜻이 아니다 — 연도별 태깅률은 81.7%(2020년)에서 96.4%(2022년) 사이에 있다.
핵심 개념
- 사고유형 태깅 — 문항이 요구하는 사고의 종류를 6개로 나눈 자체 분류 기준이다. 평가원이 공식 발표한 인지영역 분류가 아니다.
- 표본의 범위 — 수능만이 아니다. 6월·9월 모의평가와 고1~고3 학력평가가 함께 들어 있다.
- 고3급 — 이 글에서 학년 구성을 맞출 때 쓰는 단위. 수능 본시험 + 6·9월 모의평가 + 고3 학력평가를 말한다.
- 양 끝 4개년 비교 — 2014
2017과 20222025의 단순 비율 비교다. 12년 전체의 연도별 추이가 아니다.
12년 누적 분포 — 사실적이해가 가장 크고, 종합적용이 가장 작다
먼저 12년치를 한 덩어리로 본 값이다. 이 표는 DB에 든 읽기 문항 전체의 구성이며, 아래 시간축 비교와 달리 학년 구성을 맞추지 않은 값이다.
| 사고유형 | 문항 수 | 비율 |
|---|---|---|
| 사실적이해 | 1,108 | 29.5% |
| 추론적이해 | 817 | 21.7% |
| 논리적구조파악 | 804 | 21.4% |
| 대의파악 | 541 | 14.4% |
| 어휘맥락판단 | 354 | 9.4% |
| 종합적용 | 136 | 3.6% |
| 합계 | 3,760 | 100% |
상위 세 유형(사실적이해·추론적이해·논리적구조파악)이 72.6%를 차지하고, 종합적용은 136건으로 가장 작다.
🛑 그냥 맞대면 안 된다 — 앞 구간엔 고1·고2가 한 문항도 없다
시간축으로 자르기 전에 확인한 것이 있다. 두 구간에 든 시험의 종류가 같은가. 같지 않았다.
| 구간 | 수능·6월·9월 모평 | 고3 학력평가 | 고2 학력평가 | 고1 학력평가 | 합계 |
|---|---|---|---|---|---|
| 2014~2017 | 336 (46.8%) | 382 (53.2%) | 0 | 0 | 718 |
| 2022~2025 | 336 (21.9%) | 379 (24.7%) | 392 (25.6%) | 427 (27.8%) | 1,534 |
뒤 구간의 절반 이상(53.4%)이 앞 구간엔 아예 없던 고1·고2 문항이다. 그리고 학년군별로 사고유형 비율이 실제로 다르다.
| 학년군 | n | 사실적이해 | 추론적이해 | 논리적구조파악 | 대의파악 | 어휘맥락판단 | 종합적용 |
|---|---|---|---|---|---|---|---|
| 수능·모평 | 1,008 | 30.1% | 20.7% | 21.6% | 14.6% | 9.4% | 3.6% |
| 고3 학평 | 1,145 | 30.3% | 20.7% | 21.2% | 15.4% | 8.7% | 3.7% |
| 고2 학평 | 790 | 28.7% | 22.9% | 21.6% | 13.4% | 9.6% | 3.7% |
| 고1 학평 | 817 | 28.3% | 23.3% | 21.1% | 13.7% | 10.2% | 3.5% |
고1·고2는 고3급보다 사실적이해가 낮고 추론적이해가 높다. 즉 뒤 구간에 고1·고2가 대량으로 들어오는 것만으로도 「사실적이해가 줄고 추론적이해가 늘었다」는 그림이 저절로 그려진다. 시험이 변한 것과 우리 DB가 늘어난 것을 구별하지 않으면, 두 번째를 첫 번째라고 말하게 된다.
그래서 아래 비교는 양쪽을 고3급으로 맞춰서 한다. 앞 구간은 원래 전부 고3급이므로 앞 구간 숫자는 그대로이고, 뒤 구간만 1,534 → 715로 좁아진다.
앞 4개년 × 뒤 4개년(고3급으로 맞춤) — 세 방향으로 갈렸다
| 사고유형 | 2014~2017 (n=718) | 2022~2025 (n=715) | 변화 |
|---|---|---|---|
| 사실적이해 | 235 (32.7%) | 210 (29.4%) | −3.4%p |
| 추론적이해 | 134 (18.7%) | 153 (21.4%) | +2.7%p |
| 논리적구조파악 | 155 (21.6%) | 151 (21.1%) | −0.5%p |
| 대의파악 | 117 (16.3%) | 100 (14.0%) | −2.3%p |
| 어휘맥락판단 | 51 (7.1%) | 75 (10.5%) | +3.4%p |
| 종합적용 | 26 (3.6%) | 26 (3.6%) | 0.0%p |
줄어든 쪽. 가장 크게 움직인 축은 사실적이해다. 12년 누적으로도 1,108건(29.5%)으로 가장 큰 유형이지만, 앞 4개년 32.7%에서 뒤 4개년 29.4%로 3.4%p 낮아졌다. 대의파악도 16.3%에서 14.0%로 2.3%p 줄었다. 두 유형은 뒤 구간에서 문항 수 자체도 줄었다(235→210, 117→100).
늘어난 쪽. 추론적이해가 18.7%에서 21.4%로 2.7%p, 어휘맥락판단이 7.1%에서 10.5%로 3.4%p 올랐다. 어휘맥락판단은 51건에서 75건으로 문항 수가 절반 가까이 늘었다. 늘어난 두 축의 합은 +6.1%p이고, 줄어든 세 축(사실적이해·대의파악·논리적구조파악)의 합은 −6.1%p로 거의 정확히 맞물린다.
움직이지 않은 쪽. 논리적구조파악은 21.6%에서 21.1%로 0.5%p, 종합적용은 26건 대 26건으로 비율이 3.6%에서 3.6%다. 논리적구조파악은 12년 누적에서도 804건(21.4%)으로 세 번째로 큰 유형이고, 어디를 잘라도 21% 안팎에 머문다. 사실적이해가 내려오고 추론적이해가 올라오는 동안에도 이 축은 제자리를 지켰다.
자르는 방식을 바꿔도 방향은 같았다 — 다만 유의하지는 않다
같은 비교를 네 가지 표본으로 돌려 보았다. 방향(사실적이해↓·추론적이해↑·어휘맥락판단↑)은 넷 다 같고, 표본을 엄격하게 맞출수록 폭이 작아진다.
| 자른 방식 | 앞 n | 뒤 n | 사실적이해 | 추론적이해 | 어휘맥락판단 | χ²(df=5) | p |
|---|---|---|---|---|---|---|---|
| 전체 혼합(구성 안 맞춤) | 718 | 1,534 | −4.0%p | +3.8%p | +3.4%p | 14.27 | 0.014 |
| 고3급으로 맞춤 | 718 | 715 | −3.4%p | +2.7%p | +3.4%p | 8.61 | 0.13 |
| 공식 3대 시험만 | 336 | 336 | −3.0%p | +2.1%p | +3.6%p | 3.76 | 0.58 |
| 수능 본시험만 | 112 | 112 | −1.8%p | +1.8%p | +3.6%p | 1.23 | 0.94 |
첫 줄만 p<0.05다. 그런데 그 줄은 고1·고2가 뒤 구간에만 들어 있는 줄이고, 위에서 본 대로 고1·고2는 원래 사실적이해가 낮고 추론적이해가 높다. 즉 그 유의성은 시험의 변화가 아니라 표본의 변화로 설명될 수 있다. 구성을 맞춘 순간 p는 0.13으로 올라가고, 수능만 남기면 0.94가 된다.
그래서 이 글이 말할 수 있는 것은 여기까지다 — 방향은 네 가지 자르기에서 일관되게 같았고, 크기는 통계적으로 우연과 구별할 만큼 크지 않다. 어느 쪽도 버릴 필요는 없다. 일관성은 관측된 사실이고, 유의성 없음도 관측된 사실이다.
이 관측이 말하지 않는 것
첫째, 두 구간 사이는 비어 있다. 이 비교는 20142017과 20222025 두 덩어리를 맞댄 것이지 12년 연도별 추이가 아니다. 가운데 2018~2021년 구간(태깅 1,508문항)은 비교표에 없다. 그리고 변화의 원인(출제 방침 변화 등)은 평가원 공식 자료로 확인하지 못했다. 그래서 이 글은 「왜 그렇게 됐는가」를 쓰지 않는다.
둘째, 유의성이 없다. 구성을 맞춘 비교의 p는 0.13이다. −3.4%p와 +2.7%p가 표본 변동으로 설명될 수 있는 폭인지 이 집계는 부정하지 못한다.
셋째, 이 6개 유형은 자체 분류다. 사실적이해·추론적이해·논리적구조파악·대의파악·어휘맥락판단·종합적용이라는 이름이 평가원 또는 교육과정 성취기준의 공식 인지영역 분류와 정확히 대응하는지는 원문으로 확인하지 못했다. 이 글의 유형명은 코그닉스랩 DB 안에서의 이름으로 읽어야 한다.
넷째, 태깅되지 않은 356문항(8.6%)이 어느 유형에 치우쳐 있는지 알 수 없다. 연도별 태깅률도 81.7%~96.4%로 고르지 않아, 태깅 누락이 무작위라는 보장이 없다.
정리
영역이 「읽기」인 4,116문항 중 사고유형이 태깅된 3,760문항을 셌다. 누적 분포의 1위는 사실적이해(1,108건, 29.5%)이고 최하위는 종합적용(136건, 3.6%)이다. 양 끝 4개년을 맞대되 학년 구성을 고3급으로 맞추면, 사실적이해(32.7%→29.4%)와 대의파악(16.3%→14.0%)의 몫이 줄고 추론적이해(18.7%→21.4%)와 어휘맥락판단(7.1%→10.5%)의 몫이 늘었으며, 논리적구조파악(21.6%→21.1%)과 종합적용(3.6%→3.6%)은 거의 그대로였다.
이 작업에서 제일 중요했던 판단은 숫자가 아니라 무엇과 무엇을 맞대는가였다. 구성을 맞추지 않은 비교는 같은 데이터에서 더 큰 변화와 더 낮은 p값을 내놓는데, 그 차이는 시험이 아니라 DB가 만든 것이었다. 다음으로 셀 것은 정해져 있다 — 가운데 2018~2021년을 채워 연도별 추이로 잇는 일이다.
자료: cognixlab 영어 기출 enriched DB(자체 태깅) — C:\WithNero\nero_tools\enriched\gichul_e_db_enriched.csv
이 글은 코그닉스랩의 자체 조사·집계로 작성되었습니다. 출처: 영어 읽기 사고유형 12년 — 표본을 맞춰도 사실적이해 32.7%→29.4%, 추론적이해 18.7%→21.4% — 코그닉스랩