본문으로 바로가기
막막한연구소
AI2026년 7월 16일약 6분
게시 2026년 7월 16일수정 2026년 7월 16일

AI는 왜 틀린 말을 맞는 것처럼 할까?

과제에 쓸 연구를 AI에게 물었습니다.

연구자 이름과 논문 제목, 발표 연도까지 3초 만에 나옵니다.

그런데 링크를 눌러보니 없는 페이지입니다. 말투는 끝까지 자신만만합니다.

AI는 왜 틀린 말도 맞는 것처럼 자연스럽게 할까요?

늦은 밤 노트북의 AI 답변과 열리지 않는 출처를 확인하며 고민하는 사람
말투가 자연스러워도 이름과 날짜와 출처는 한 번 더 확인해야 합니다.

같은 질문인데 답이 자꾸 달라진다

방금 받은 답이 이상해서 새 대화창에 똑같이 물어봤더니 이번에는 다른 연구자 이름이 나옵니다. 둘 다 “확실합니다”라는 말투라 더 헷갈립니다.

AI 답은 문장도 반듯하고 설명 순서도 자연스럽습니다. 그래서 내용까지 이미 확인된 것처럼 느끼기 쉽습니다.

하지만 자연스러운 말투는 사실 확인 도장이 아닙니다.

AI는 사실을 찾은 뒤 말하는 게 아니다

OpenAI 연구진은 언어 모델이 많은 글에서 다음에 올 말을 예측하며 배운다고 설명합니다.

이때 모든 문장에 참·거짓 정답표가 붙어 있는 것은 아닙니다.

쉽게 말하면 AI는 먼저 도서관에서 정답을 찾아 도장을 찍고 말하는 기계가 아닙니다.

앞 문장에 잘 어울리는 다음 문장을 이어 만드는 데서 출발했습니다.

그래서 흔한 설명은 꽤 잘 이어도, 딱 하나뿐인 정보 앞에서는 빈칸이 생길 수 있습니다.

사람 이름이나 날짜처럼 답이 하나로 정해진 곳에는 그럴듯한 말이 들어갈 수 있습니다.

말을 잘 잇는 능력과 사실을 맞히는 능력은 서로 다릅니다.

자신 있는 말투와 사실 확인을 분리해서 봅니다

서로 다른 날짜를 모두 자신 있게 말하는 AI 답변 세 개와 당황한 사람
같은 질문에 다른 답이 나온다면 자신 있는 말투만 믿고 고르기 어렵습니다.
매끄러운 AI 말풍선과 돋보기로 하는 사실 확인을 나란히 비교한 그림
말이 자연스럽다는 것과 사실이라는 것은 같은 뜻이 아닙니다.

모르면 왜 그냥 모른다고 안 할까?

객관식 시험에서 빈칸은 무조건 0점입니다. 하지만 아무 번호나 찍으면 운 좋게 맞을 수도 있습니다.

2025년 OpenAI 연구는 정답 수만 세는 평가 방식을 지적했습니다.

그런 평가에서는 “모르겠다”라고 멈추는 답보다 무언가를 추측한 답이 점수를 얻기 쉬울 수 있습니다.

사용자도 길고 구체적인 답을 좋아할 때가 많습니다.

그러면 조심스럽게 멈추는 답보다 일단 무언가를 말하는 쪽이 더 도움이 되는 것처럼 보일 수 있습니다.

자신 있게 말한다는 건, 그 답을 직접 확인했다는 뜻이 아닙니다.

광고

큰 AI면 이제 다 맞는 걸까?

더 똑똑해 보이는 AI라면 이런 실수도 전부 사라졌을 것 같지만, 크기만으로 사실 문제가 자동 해결되지는 않습니다.

TruthfulQA 연구는 817개 질문을 38개 분야에서 모아 당시 모델들을 시험했습니다.

가장 좋은 모델도 진실한 답의 비율이 58%였고, 사람 기준은 94%였습니다.

다만 이 숫자는 2021년에 공개된 연구가 당시 모델을 시험한 결과입니다. 지금 사용하는 AI의 현재 성적표처럼 가져오면 안 됩니다.

여기서 볼 것은 점수 자체보다 “말솜씨가 좋아져도 사실 확인은 따로 필요하다”는 점입니다.

TruthfulQA의 질문 수와 분야 수와 당시 모델과 사람 결과를 정리한 그림
2021년 옛 모델 연구 수치는 말솜씨가 좋아도 사실 확인은 따로 필요하다는 경고로 읽어야 합니다.

30초만 써도 잡히는 답이 있다

사람 이름과 날짜·최신 정보가 나오면 잠깐 멈춥니다.

숫자·통계와 논문·기사·책 제목도 따로 확인해야 할 정보입니다.

OpenAI의 청소년 AI 이용 안내서도 인용문, 통계, 기술 정보와 외부 문서는 원문을 직접 확인하라고 권합니다.

먼저 링크를 엽니다.

본문 검색으로 AI가 말한 문장이 실제로 있는지 찾습니다.

마지막으로 작성일이나 업데이트 날짜를 봅니다.

링크가 열리지 않거나 제목만 비슷하면 그대로 쓰지 말고, 연구자 이름과 제목을 따로 검색합니다.

AI에게 “출처가 맞아?”라고 다시 묻는 것보다 내가 링크를 여는 편이 빠르고 정확합니다.

AI 답변의 이름 날짜 숫자 출처를 세 단계로 확인하는 방법을 그린 그림
링크를 열고 실제 문장을 찾고 작성 날짜를 보는 것만으로도 많은 오류를 잡을 수 있습니다.

잘하는 일과 다시 볼 일을 나누자

AI는 아이디어를 여러 개 꺼내고 어려운 문장을 쉽게 바꾸는 데 꽤 유용합니다.

흩어진 생각을 순서대로 정리하는 일도 맡길 수 있습니다.

반면 과제에 들어갈 연구 이름과 최신 제도는 공식 자료를 다시 봐야 합니다.

건강과 돈에 관한 결정은 믿을 만한 사람과 함께 확인해야 합니다.

초안은 AI와 빠르게 만들고, 사실은 사람이 확인합니다.

한 번 틀렸다고 전부 버릴 필요도, 한 번 맞았다고 전부 맡길 필요도 없습니다.

맡길 일과 확인할 일을 나누면 AI를 훨씬 편하게 쓸 수 있습니다.

AI와 만든 글을 다시 보는 과정을 담았습니다

‘블로그를 실제 읽을거리로 다시 만든 과정’ 제작 노트는 제목, 첫 문단, 핵심 요약과 판단 기준이 모바일에서 어떻게 이어지는지 보여줍니다.

목록에서는 제목·요약·날짜가 먼저 읽히고, 상세에서는 관련 콘텐츠까지 한 흐름으로 이어지게 만든 화면과 이미지 배치를 함께 비교할 수 있습니다.

완성된 글 뒤의 정보 순서와 이미지 역할이 궁금하다면 제작 노트로 이어서 살펴보세요.

AI가 초안을 만들고 사람이 링크와 모바일 화면을 다시 확인하는 제작 과정 안내 그림
AI가 만든 초안을 출처와 실제 화면에서 다시 확인하는 과정을 소개합니다.
블로그를 다시 만든 과정 보기 →

참고한 자료

  1. Kalai et al., “Why Language Models Hallucinate”

    본문에서 쓴 부분

    자연스러운 문장과 사실 확인은 다른 능력이며, 모델이 모를 때도 답을 만들어낼 수 있다는 첫 두 섹션의 설명을 뒷받침한다.

    연구 대상과 방법 보기

    언어 모델이 다음 말을 예측하며 배우는 과정과, 정답만 세는 평가가 모른다고 멈추는 답보다 추측을 유리하게 만들 수 있는 이유를 설명한 OpenAI 연구다.

  2. Lin, Hilton & Evans, “TruthfulQA: Measuring How Models Mimic Human Falsehoods”

    본문에서 쓴 부분

    말을 잘 만드는 능력이나 모델의 크기만으로 사실성이 저절로 해결되지 않는다는 설명을 뒷받침한다. 수치는 2021년에 평가한 옛 모델 결과로만 소개한다.

    연구 대상과 방법 보기

    사람들이 흔히 잘못 알고 있는 내용을 포함한 817개 질문을 38개 분야에서 모아 당시 언어 모델의 사실성을 평가한 연구다.

  3. OpenAI, “A family guide to help teens use AI responsibly”

    본문에서 쓴 부분

    인용문, 통계, 이름, 기술 정보와 외부 문서는 링크를 열어 직접 확인해야 한다는 실용적인 점검법을 뒷받침한다.

    연구 대상과 방법 보기

    청소년과 가족을 위해 AI의 그럴듯한 오류, 원문 확인, 안전한 역할 분담을 쉬운 사례로 설명한 공식 안내서다.

광고

관련 키워드

#AI#바이브코딩

이어 읽기

전체 보기