AI 기초
강화학습
Reinforcement Learning
💡 초보자 설명
AI가 시행착오를 거치며 '좋은 결과에는 보상, 나쁜 결과에는 벌점'을 받는 방식으로 점점 더 나은 답을 하도록 학습하는 방법이에요.
🧠 쉬운 비유·기억법
강아지 훈련과 비슷해요. 잘한 행동에는 간식(보상)을 주고, 이를 반복하며 원하는 행동을 더 잘하게 만드는 방식이에요.
📌 실제 사용 상황
AI가 사람이 선호하는 답변 스타일을 익히는 데(RLHF, 사람 피드백 기반 강화학습) 이 방식이 많이 쓰여요.
⚠️ 주의사항
초보자가 직접 다룰 일은 거의 없는 개념이라, 용어의 뜻 정도만 알아둬도 충분해요.