Instinct에게 물었어요. 너와 나의 일치도는 얼마나 될까?
아직 채점한 답변이 없으니 숫자를 말할 수 없다는 답이 돌아왔어요. 좀 싱거웠지만, 맞는 말이죠. 나에 대해 많이 안다고 해서 나처럼 답한다는 보장은 없으니까요.
그런데 내가 궁금했던 건 점수 하나가 아니었어요.
나는 나와 매우 유사한 디지털 트윈을 만들고 싶어요. 그래서 Instinct에게 거의 내 모든 정보를 주고 있어요. 무슨 일을 하는지, 어떤 대화를 나눴는지, 무엇을 읽고 어떤 메일을 보냈는지까지요.
내 정보를 잔뜩 외우게 하려는 건 아니에요. 그걸 바탕으로 내가 어떻게 생각하고 답하는지까지 배웠으면 하는 거죠.
그러려면 확인할 방법이 필요해요. "너 나 잘 알지?"라고 물어보는 것만으로는 부족하니까요.
이름은 '설문 앵벌이'인데
내가 붙인 이름은 '설문 앵벌이'예요. 이름만 들으면 디지털 트윈과는 꽤 거리가 있어 보이죠.
그런데 나는 설문이 에이전트와 나의 일치도를 높이는 가장 효과적인 수단일 거라고 생각했어요. 질문이 있고, 답을 골라야 하고, 그 답을 내가 보고 평가할 수 있으니까요.
막연히 "나를 더 잘 알아줘"라고 하는 대신, 같은 질문 앞에서 얼마나 비슷하게 판단하는지 볼 수 있는 거예요.
방식은 에이전트가 먼저 답하고, 그중 일부를 내가 보고 평가하는 식으로 잡았어요. 기준은 "나랑 똑같이"가 아니라 "그럴듯하게"로요.
내가 다른 답을 골랐다고 전부 틀렸다고 하기는 어려워요. 나도 질문을 언제 받느냐에 따라 답이 달라질 수 있으니까요. 대신 이 답을 내가 할 법한지, 이유가 내 기준과 맞는지를 보려고 해요.
아직 설문이 정말 가장 효과적인 방법인지는 몰라요. 일단 내 생각을 답과 피드백으로 남길 수 있다는 점이 마음에 들었어요.
UX 디자이너라서가 아니라, 나라서
나는 UX 디자이너이고, LLM 관련 일을 하고 있어요. 이 정도만 알려줘도 에이전트는 그럴듯한 답을 만들 수 있겠죠. 문제는 그 답이 나와 비슷한 다른 디자이너의 답이어도 구분하기 어렵다는 거예요.
이를테면 이런 질문을 줄 수 있어요.
"새 도구를 써볼 때, 기능이 더 많은 것과 지금 하던 일을 바로 끝낼 수 있는 것 중 무엇을 고를까?"
이건 예시예요. 아직 이 문항으로 비교한 건 아니에요.
어느 쪽을 고르는지도 보겠지만, 왜 골랐는지가 더 궁금해요. 내가 실제로 맡겼던 일을 근거로 답한 건지, 그냥 'UX 디자이너라면 이렇겠지' 하고 짐작한 건지요.
맞는 답을 찍었어도 이유가 엉뚱하면 다음 질문에서는 쉽게 틀릴 것 같거든요. 내가 원하는 디지털 트윈은 직업이 같은 가상의 누군가는 아니니까요.
그래서 구독하는 메일과 보낸 메일도 참고해달라고 했어요. 나를 소개하는 몇 문장보다 실제로 읽고 쓰는 것에 단서가 있을 것 같아서요.
모르는 것까지 나처럼 답하면 곤란해요
취향이나 판단은 추론해볼 수 있어요. 하지만 내가 무슨 일을 하는지, 어떤 경험이 있는지는 다르게 다뤄야 해요. 모르면 물어봐야죠. 그럴듯하게 채우면 안 되고요.
디지털 트윈을 만들겠다고 없는 이력까지 만들어내면 그건 다른 사람이에요.
정보를 많이 주는 만큼, 에이전트가 어디까지 알고 어디부터 짐작하는지도 확인하려고 해요. 자료가 많아졌다는 것과 나를 잘 이해한다는 건 아직 별개니까요.
아직은 닮았다고 말할 수 없어요
지금 일치도가 얼마냐고 물으면 여전히 몰라요. 숫자를 붙일 만큼 평가한 결과가 아직 없어요.
먼저 어떤 답을 보고 내가 "이건 좀 아닌데"라고 하는지 모으려고 해요. 정답만 고쳐주면 이유는 그대로 남을 수 있으니, 왜 아닌지도 같이 말해주는 식으로요. 그러고 나서 비슷한 질문에서 달라지는지 봐야겠죠.
일에서도 에이전트 평가에 관심이 있는데, 이번에는 평가 기준이 나 자신이에요. 내가 기준이니 쉬울 것 같다가도, 왜 그 답을 골랐는지 설명하려면 나도 생각을 해야 해요.
'설문 앵벌이'라고 이름 붙였지만, 결국 해보려는 건 이거예요. 내가 준 정보가 실제로 나를 닮은 판단으로 이어지는지 확인하는 것.
아직 나를 닮았다고 말할 수는 없어요. 대신 어디서 다른지는 하나씩 찾아볼 수 있겠죠.
이렇게 배우는 거예요. 에이전트도, 나도.