대형 언어 모델(LLM)은 진짜 ‘의미’를 이해할 수 있을까, 아니면 단순한 패턴 매칭일까?
대형 언어 모델(LLM)은 진짜 ‘의미’를 이해할 수 있을까, 아니면 단순한 패턴 매칭일까?
대형 언어 모델(LLM)은 진짜 ‘의미’를 이해할 수 있을까, 아니면 단순한 패턴 매칭일까?
대형 언어 모델(LLM)은 진짜 ‘의미’를 이해할 수 있을까, 아니면 단순한 패턴 매칭일까?
대형 언어 모델(LLM)은 진짜 ‘의미’를 이해할 수 있을까, 아니면 단순한 패턴 매칭일까?
이 질문은 단순한 기술적 이슈를 넘어 인지과학, 언어철학, 인공지능 연구가 교차하는 핵심적 논점입니다. 최근의 LLM(예: GPT-4, LLaMA, PaLM 등)은 극적으로 복잡한 언어처리 능력을 보이지만, 이들이 인간과 같은 ‘의미’의 이해에 접근하는지, 아니면 긴밀한 통계적 패턴 학습에 머물러 있는지에 대해 학계 내외의 논쟁이 계속되고 있습니다[1][2][3].
‘의미 이해’의 여부를 판단하기 위해선 먼저, 의미(semantics)에 대한 정의와 이해의 기준이 필요합니다. 언어적 의미에는 다음과 같은 주요 기준들이 있습니다.
LLM은 방대한 텍스트 데이터셋으로부터 통계적 패턴(예: 단어·문장 공동출현, 문법적 구조, 의미별 사용 규칙 등)을 학습합니다. 최근 연구는 LLM이 심지어 인간의 공식적 언어 능력(formal linguistic competence) 일부를 획득했다는 점을 보여줍니다[2][5][6]. 특히 GPT-4 등은 다중 의미(sense)의 문장 해석, 문맥의존적 단어 사용, 복잡한 문장 구조의 처리 등에서 인간과 유사한 경향을 보입니다[6][7]. 또한 일부 연구에서는 LLM이 의미 중첩이나 구조적 모호성(scope ambiguity)에 대해서도 인간의 선호와 유사한 해석을 보임을 실험적으로 입증했습니다[6][7].
하지만 이런 뛰어난 성능에도 불구하고, LLM은 "본질적으로" 입력 텍스트의 패턴을 예측하는 소비에 초점을 맞추고 있습니다. 즉, 일반적 상황에서는 실제 사물, 행위, 경험 등 ‘언어 외부 세계’와의 직접적인 연결 없이 오직 텍스트의 분포적 특성에 의존해 의미를 ‘시뮬레이션’합니다[2][3][4].
찬성 입장은 분포 의미론(distributional semantics)과 연결주의(connectionism) 관점에서, 의미는 곧 ‘언어 내에서의 사용 맥락과 통계적 연관성’으로 구성될 수 있으므로, LLM의 내부 표현(internal representation) 역시 일정 부분에서 ‘의미’를 포착한다고 주장합니다[5][8]. 몇몇 연구는 LLM의 응답이 인간 교정자와 상당히 유사하거나(한국어 문장 교정에서 약 0.8의 코사인 유사도)[9], 다양한 언어 작업(번역, 요약 등)에서 인간 수준의 출력물을 산출함을 보였습니다[9][10][11][12]. 더불어 LLM은 사회적, 문화적 맥락에서 파생되는 메타프라그마틱(metapragmatic) 기능이나 인덱시컬리티(indexicality) 등의 복합적 의미 구성도 부분적으로 수행할 수 있습니다[4].
반대 입장은 LLM이 세계와의 실질적 연결성(grounding)이 결여되어 있다고 지적합니다.
구체적으로,
여러 최신 논의에서는, 현재의 LLM을 ‘본질적 의미 이해자’(strong understanding)가 아니라 ‘기능적 의미 조작자’(functional/operational understanding)로 보는 입장이 늘고 있습니다[2][3][4][8].
현 단계에서 LLM은 인간이 직관적으로 경험하는 ‘의미’를 본질적으로 이해한다고 보기 어렵습니다.
다만, 프롬프트 엔지니어링, 멀티모달 통합(예: 시각적, 청각적 데이터), 외부 툴과의 상호작용 강화 등 최신 모델의 발전추세는 LLM이 점차 더 실질적 의미 이해로 나아갈 가능성을 보여줍니다[3][4][16]. 미래에는 환경과의 실시간 상호작용, 감각적 체험, 인과모델링 등이 통합될 때 ‘의미’를 깊이있게 구성할 수 있는 AI가 등장할 수 있습니다.
요약:
참고 표: LLM의 의미 이해에 대한 주요 연구 근거 및 평가
| 관점 | 근거/사례 | 대표 연구 |
|---|---|---|
| 통계적 패턴 | LLM은 텍스트 분포·공출현 기반 예측, 패턴 학습에 특화 | [2][5][10][17] |
| 의미 일부 내재화 | 분포의미론/연결주의 관점에서, 맥락의존적 사용·일부 의미 연상 가능 | [5][7][8][9] |
| 공식적 의미 처리 | 문법/구문/패턴 등 공식적 언어능력에서 LLM과 인간 간 유사성 강조 | [2][6][7][10] |
| 기능적 의미 한계 | 참조투명성, 맥락의존성, 세계지식·상황 처리, 자기 의식·의도 부재 등에 제한적 | [1][2][4][11][13][14] |
| 진정한 이해 한계 | grounding, embodiment, consciousness 결여 | [1][2][3][4] |
| 실용적 가능성 | 프롬프트 개선, 멀티모달 접목 등으로 활용·의미 모델화 고도화 중 | [3][11][12][15][16] |
MITCHELL, Melanie; KRAKAUER, David C. The debate over understanding in ai's large language models [preprint]. arXiv, 2022. arXiv:2210.13966. https://doi.org/10.1073/pnas.2215907120.
MAHOWALD, Kyle, et al. Dissociating language and thought in large language models [preprint]. arXiv, 2023. arXiv:2301.06627. https://doi.org/10.48550/arXiv.2301.06627.
MINAEE, Shervin, et al. Large language models: A survey [preprint]. arXiv, 2024. arXiv:2402.06196. https://doi.org/10.48550/arXiv.2402.06196.
JI, Eugene Yu. Large language models: A historical and sociocultural perspective. Cognitive science, 2024. https://doi.org/10.1111/cogs.13430.
KALLENS, Pablo Contreras; KRISTENSEN-MCLACHLAN, R.; CHRISTIANSEN, Morten H. Large language models demonstrate the potential of statistical learning in language. Cognitive science, 2023. https://doi.org/10.1111/cogs.13256.
CAI, Zhenguang G., et al. Do large language models resemble humans in language use? [preprint]. arXiv, 2023. arXiv:2303.08014. https://doi.org/10.18653/v1/2024.cmcl-1.4.
KAMATH, Gaurav, et al. Scope ambiguities in large language models [preprint]. arXiv, 2024. arXiv:2404.04332. https://doi.org/10.1162/tacl_a_00670.
BLAIS, Antoine. Large Language Models and Human Cognition: An Optimistic Perspective. Journal of Cognitive Science, 2025. https://doi.org/10.17791/jcs.2025.26.1.1.
SINHYE, Nam. 한국어 학습자 오류에 대한 거대언어모델과 모어 화자의 교정 양상 비교 연구. 한국언어문화학, 2024.
박상언. 딥러닝 기반 사전학습 언어모델에 대한 이해와 현황. 한국빅데이터학회 학회지, 2022. https://doi.org/10.36498/kbigdt.2022.7.2.11.
고상훈; 안현철. 대규모 언어 모델을 활용한 한국어 가짜뉴스 탐지: 한계와 가능성. 지식경영연구, 2024. https://doi.org/10.15813/kmr.2024.25.4.006.
OMAR, M., et al. Emerging applications of NLP and large language models in gastroenterology and hepatology: A systematic review. Frontiers in Medicine, 2024. https://doi.org/10.3389/fmed.2024.1512824.
WU, Zhaofeng, et al. Transparency helps reveal when language models learn meaning [preprint]. arXiv, 2022. arXiv:2210.07468. https://doi.org/10.1162/tacl_a_00565.
HOSSAIN, Tamanna; DEV, Sunipa; SINGH, Sameer. MISGENDERED: Limits of large language models in understanding pronouns [preprint]. arXiv, 2023. arXiv:2306.03950. https://doi.org/10.48550/arXiv.2306.03950.
박상언; 강주영. ChatGPT 및 거대언어모델의 추론 능력 향상을 위한 프롬프트 엔지니어링 방법론 및 연구 현황 분석. 지능정보연구, 2023. https://www.kci.go.kr/kciportal/ci/sereArticleSearch/ciSereArtiView.kci?sereArticleSearchBean.artiId=ART003031982.
BEURER-KELLNER, Luca; FISCHER, Marc; VECHEV, Martin. Prompting is programming: A query language for large language models [preprint]. arXiv, 2022. arXiv:2212.06094. https://doi.org/10.1145/3591300.
김병필. 대규모 언어모형 인공지능의 법적 쟁점. 정보법학, 2022. https://www.kci.go.kr/kciportal/ci/sereArticleSearch/ciSereArtiView.kci?sereArticleSearchBean.artiId=ART002840236.
tlooto can make mistakes. Check important information against the original sources.