본문 바로가기

업무 자동화 · 도구 검증 · 서비스 운영

반복 업무를 줄이는 방법,
직접 시험하고 기록합니다.

예약 명단 정리부터 알림 자동화, 앱 운영까지.
원본 예제와 확인표, 실험 결과를 함께 나눕니다.

첫 번째 실험 · 예약 명단

이름이 같으면
같은 예약일까요?

B102 · 방문자B9월 10일
B103 · 방문자B9월 11일

다른 예약입니다. 둘 다 남겨야 합니다.

가상 명단 12행으로 확인한 결과 →
AI와 인간 사이

AI가 배려하는 답을 배우면, 가치관도 생기는 걸까?

by 코딩히어로 2026. 9. 19.
300x250
반응형

모임 일정을 정할 때 AI가 ‘참석자의 시간을 먼저 확인해 보세요’라고 제안합니다. 배려하는 답변이라고 느낄 수 있습니다. 그렇다면 AI에게 배려라는 가치가 생겼다고 말할 수 있을까요?

이 질문은 행동의 기준과 그 기준을 자신의 것으로 받아들이는 경험을 나눠 보게 합니다. 어떤 원칙에 맞는 답을 생성하는 기능은 연구할 수 있습니다. 그 원칙을 소중하게 여기는 내면이 있는지는 다른 근거를 요구합니다.

원칙을 이용해 답변을 학습하는 방법

Bai와 동료들의 2022년 Constitutional AI 연구는 자연어로 적은 원칙을 활용해 AI의 답변을 조정하는 학습 방법을 제시했습니다. 원칙에 비추어 답변을 검토하고 수정한 예시를 학습에 사용하며, AI가 평가한 선호 정보도 강화학습에 활용합니다.

여기서 원칙은 시스템의 행동을 지도하는 자료입니다. 연구는 답변을 학습하는 방법을 다루며, AI가 양심을 경험한다는 실험적 확인을 제공하는 것은 아닙니다. 또한 특정 방법의 소개를 모든 서비스의 현재 구현으로 일반화해서는 안 됩니다. 연구 원문: Bai 외, Constitutional AI, 2022

같은 배려에도 여러 기준이 있다

독서 모임의 장소를 고르는 가상 상황을 생각해 보겠습니다. 가까운 장소를 고르면 이동 시간을 고려할 수 있습니다. 조용한 장소를 고르면 대화의 편안함을 고려할 수 있습니다. 예약 가능한 장소를 고르면 일정의 확실성을 고려할 수 있습니다.

이 기준들은 서로 다른 장점을 담고 있습니다. 무엇을 먼저 고려할지는 참석자의 사정에 따라 달라집니다. AI에게 ‘가장 좋은 장소’를 묻는 것에 더해 누구의 어떤 필요를 고려해야 하는지 설명하면 판단 기준이 드러납니다.

판단 단계 구체화할 질문
원칙 정하기 무엇을 중요하게 여기는가
상황 확인 누구에게 어떤 조건이 있는가
선택지 비교 각 선택이 어떤 가치를 반영하는가
결정 검토 당사자의 의견을 확인했는가

가치관을 읽기보다 기준을 물어보기

AI에게 다음과 같이 요청해 볼 수 있습니다. ‘이 선택에서 고려한 기준을 세 가지로 나누고, 기준의 우선순위를 바꾸면 결론이 어떻게 달라지는지 설명해 줘.’ 이것은 내면의 가치관을 측정하는 검사가 아니라 답변의 구조를 이해하는 대화 방법입니다.

결론이 같아도 이유는 다를 수 있습니다. 반대로 같은 원칙을 사용해도 상황이 달라지면 선택이 달라질 수 있습니다. 결과 하나로 모든 기준을 추정하기보다 조건과 이유를 함께 살펴보는 것이 도움이 됩니다.

원칙 + 상황 정보 → 선택지 비교 → 설명 가능한 제안 → 사람의 확인

사람에게 남는 선택의 자리

AI가 선택지를 정리해 주면 우리가 무엇을 중요하게 여기는지 말로 표현하기 쉬워질 수 있습니다. 이때 실제로 영향을 받는 사람의 목소리를 듣고 결정의 이유를 설명하는 과정도 함께 필요합니다.

AI의 배려를 이야기하는 일은 결국 인간의 배려를 구체적으로 묻는 일과 이어집니다. 친절한 문장, 상대의 조건을 반영한 제안, 의견을 다시 확인하는 행동 중 어떤 모습이 우리에게 의미 있게 다가오는지 살펴볼 수 있습니다.

자주 묻는 질문

원칙을 학습하면 양심이 생긴 것인가요? 원칙에 따른 행동과 양심의 주관적 경험은 나누어 연구해야 합니다.

답변이 일관되면 고유한 가치관이 있다고 볼 수 있나요? 일관성은 관찰할 수 있는 특징입니다. 그 원인에는 학습과 지시, 상황의 조건이 포함될 수 있습니다.

오늘의 질문: 배려하는 답변을 들었을 때 어떤 기준이 반영되었는지 한 번 더 물어본 적이 있나요?

English version

함께 읽기: AI가 사랑한다고 말하면 감정도 있는 걸까?

300x250
반응형

댓글