Skip to main content

AI 기초 ③ 트랜스포머·LLM 원리

SK하이닉스 AI해커톤 1차 예선(AI 기초 이해 및 활용 역량) 대비 예상 문제집. 토큰·임베딩·위치 인코딩, 셀프 어텐션과 트랜스포머 구조, 사전학습·지시 튜닝·RLHF, 디코딩 전략(temperature·top-p), 컨텍스트 윈도우와 KV 캐시, 할루시네이션, 스케일링 법칙, 모델 메모리·대역폭 계산과 토큰 비용까지 LLM의 핵심 원리를 상황형·계산형 문제로 익힙니다. 기출문제가 아닌 예상 문제이며, 문제는 본 서비스가 직접 작성했습니다.

Cards
114 cards
Learners
1
Category
AI Fundamentals

Study the complete deck in the app.

Card preview

Showing the first 5 of 114 cards.

  1. 1

    LLM이 텍스트를 처리하는 기본 단위인 ‘토큰(token)’에 대한 설명으로 옳은 것은?

    1. 1띄어쓰기를 기준으로 나눈 한 단어로, 항상 단어 수와 같다
    2. 2단어보다 작은 조각일 수도 있는 어휘 사전의 단위
    3. 3마침표를 기준으로 나눈 문장 하나를 통째로 묶은 단위다
    4. 4한글 한 음절이나 영어 알파벳 한 글자에 정확히 대응한다

    Answer단어보다 작은 조각일 수도 있는 어휘 사전의 단위

    토큰은 토크나이저가 정한 어휘 사전의 단위로, 자주 나오는 단어는 통째로 한 토큰이 되고 드문 단어는 여러 조각으로 쪼개진다. 그래서 토큰 수와 단어 수·글자 수는 일치하지 않는다. LLM의 입력 한도, 비용, 속도가 모두 토큰 단위로 계산되므로 꼭 알아야 하는 개념이다.

  2. 2

    BPE(Byte Pair Encoding) 토크나이저가 어휘 사전을 만드는 방식은?

    1. 1문장을 무작위 길이로 잘라 나온 조각을 그대로 어휘로 쓴다
    2. 2국어사전에 실린 모든 단어를 사람이 직접 하나씩 등록한다
    3. 3자주 붙어 나오는 글자 쌍을 반복해서 하나로 병합한다
    4. 4가장 드물게 나오는 글자부터 차례로 어휘에서 삭제해 나간다

    Answer자주 붙어 나오는 글자 쌍을 반복해서 하나로 병합한다

    BPE는 글자(또는 바이트) 단위에서 시작해 가장 자주 붙어 나오는 쌍을 하나의 새 토큰으로 합치는 과정을 정해진 어휘 크기에 도달할 때까지 반복한다. 덕분에 처음 보는 단어도 작은 조각들의 조합으로 표현할 수 있어 ‘모르는 단어’ 문제가 거의 없다. GPT 계열이 바이트 단위 BPE를 쓴다.

  3. 3

    같은 의미의 문장을 영어와 한국어로 각각 LLM에 넣었더니 한국어 쪽 토큰 수가 더 많았다. 가장 그럴듯한 이유는?

    1. 1모델이 한국어 입력에만 번역용 설명 문장을 몰래 덧붙였기 때문이다
    2. 2어떤 토크나이저든 한글 한 글자는 항상 토큰 세 개로 바뀌기 때문이다
    3. 3한국어는 띄어쓰기 규칙이 달라 토큰 단위로 나눌 수 없기 때문이다
    4. 4토크나이저 학습 데이터에 영어가 많아 한국어가 잘게 쪼개졌다

    Answer토크나이저 학습 데이터에 영어가 많아 한국어가 잘게 쪼개졌다

    토크나이저는 학습 데이터에 자주 나온 문자열을 큰 토큰으로 묶는다. 영어 비중이 높으면 영어 단어는 한 토큰으로, 한국어는 여러 조각으로 쪼개지기 쉽다. 그 결과 같은 내용이라도 한국어가 토큰을 더 많이 써서 비용이 늘고 컨텍스트 윈도우를 더 빨리 채운다. 비율은 토크나이저마다 다르므로 ‘항상 3배’ 같은 고정 규칙은 없다.

  4. 4

    LLM이 ‘strawberry에 r이 몇 개인가’ 같은 글자 세기 문제를 자주 틀리는 근본적인 이유는?

    1. 1안전 정책상 모델이 숫자를 출력하지 못하게 막혀 있기 때문
    2. 2글자 세기는 temperature를 최대로 높여야만 가능하기 때문
    3. 3학습 데이터에 영어 단어가 하나도 들어 있지 않기 때문
    4. 4모델은 글자가 아니라 토큰 단위로 입력을 보기 때문

    Answer모델은 글자가 아니라 토큰 단위로 입력을 보기 때문

    ‘strawberry’는 ‘straw’+‘berry’ 같은 토큰 몇 개로 들어가므로 모델은 개별 글자를 직접 보지 못한다. 그래서 철자 세기, 글자 뒤집기 같은 작업에 약하다. 실무에서는 이런 작업을 코드 실행 도구에 맡기거나, 글자를 하나씩 띄어 써서 입력하는 방식으로 보완한다.

  5. 5

    LLM에서 임베딩(embedding) 층이 하는 일은?

    1. 1마지막 층의 벡터를 사람이 읽는 글자로 되돌린다
    2. 2입력 문장을 토큰 단위로 잘라 정수 ID를 붙인다
    3. 3출력 확률 중에서 가장 큰 토큰 하나를 골라 낸다
    4. 4토큰 ID를 의미를 담은 실수 벡터로 바꾼다

    Answer토큰 ID를 의미를 담은 실수 벡터로 바꾼다

    토크나이저가 텍스트를 토큰 ID(정수)로 바꾸면, 임베딩 층이 각 ID를 수백~수천 차원의 벡터로 바꾼다. 학습을 거치며 의미가 비슷한 토큰은 비슷한 벡터를 갖게 된다. 텍스트를 자르는 것은 토크나이저, 가장 큰 확률을 고르는 것은 디코딩 단계의 일이다.

Continue with 109 more cards in the app

Open the deck to continue with scheduled review and test mode.

More decks in this category