코드프레소가 짚은 AI 인사 평가 기준: 직원의 검증 과정을 어떻게 보나?
OpenAI·Ironclad의 업무 평가 연구를 계기로, 직원의 AI 활용 역량을 인사평가에 연결하기 전 확인할 과정 기록과 공통 기준을 정리했습니다.
AI 인사 평가를 준비할 때는 먼저 평가 대상을 구분해야 합니다. AI에게 사람의 등급을 매기게 하는 일과, 사람이 AI를 활용하는 능력을 평가하는 일은 다릅니다. 이 글은 후자를 다룹니다. 코드프레소는 직원이 어떤 기준으로 AI에 일을 맡겼고, 결과를 어떻게 검증했는지를 먼저 확인해야 한다고 봅니다.
2026년 10월 6일 OpenAI가 공개한 Ironclad와의 연구 협력은 그 기준을 생각할 재료입니다. 업무를 끝냈다는 표시만으로 성공을 판단하지 않고, 업무에 필요한 조건을 하나씩 확인했거든요. 연구에서 참고할 부분은 성공한 업무를 구체적으로 정의하는 방식입니다.
OpenAI·Ironclad 연구는 무엇을 평가했나요?
이 연구는 AI 에이전트, 즉 여러 작업을 이어 수행하는 AI가 계약 관련 업무의 요구사항을 얼마나 충족했는지 평가했습니다. Ironclad 직원과 OpenAI 내부 사용자들이 법무·영업·구매 분야의 11개 과제를 선정했고, 과제마다 8~50개 평가 기준을 적용했습니다.
공식 발표에 나온 장면은 소프트웨어 구매 절차를 설정하는 일입니다. 일정 금액을 넘으면 재무 승인을 받게 하고, 필요한 요청은 보안 검토로 보내며, 표준과 다른 계약 조건은 법무팀이 확인하도록 구성합니다. 승인 규칙을 만들었다면 기준 금액 위와 아래의 요청이 각각 올바른 경로로 가는지도 확인해야 해요.
| 연구에서 확인한 사실 | 직원 평가로 옮길 때 지킬 구분 |
|---|---|
| 11개 전문 업무 과제를 선정 | 전 직원의 역량을 대표하는 표본으로 해석하지 않기 |
| 과제당 8~50개 기준으로 채점 | 직원 과제에 같은 문항 수를 복사하지 않기 |
| 여러 상황에서 승인 규칙이 작동하는지 점검 | 우리 업무의 정상 상황과 예외 상황을 따로 정의하기 |
Ironclad 최고기술책임자 수니타 버마는 발표에서 “에이전트는 팀이 의존하는 통제를 유지하면서 업무 흐름이 어떻게 연결되는지를 포함해, 계약의 전체 생애주기를 이해해야 합니다”라고 설명했습니다. 계약 문서 한 장이 완성됐더라도 승인과 예외 처리가 빠지면 업무가 끝났다고 볼 수 없다는 맥락입니다.
원문에 제시된 평균 점수와 소요 시간도 연구 조건 안의 결과입니다. 시간은 모델의 처리 속도 등을 가정한 시뮬레이션 추정치이며, 고객사의 실제 시간 절감 실적이 아닙니다. 이 연구를 직원 성과 향상이나 인사평가의 타당성을 입증한 자료로 사용할 수는 없습니다.
직원의 AI 활용 능력을 어떻게 측정하나
직원의 AI 활용 능력은 직무 과제를 수행하면서 남긴 요청 이력, 수정 과정, 최종 결과물을 함께 확인해 측정할 수 있습니다. 코드프레소가 제안하는 출발점은 “AI를 몇 번 썼나”보다 “무엇을 확인하고 고쳤나”를 평가 문항으로 만드는 것입니다.
마케팅팀이 캠페인 결과 보고서를 만드는 상황을 가정해 볼게요. AI는 광고별 결과를 정리하고 다음 캠페인 제안을 쓸 수 있습니다. 담당자는 집계 기간이 같은지, 취소된 주문이 포함됐는지, 광고비와 매출의 기준이 맞는지 확인해야 합니다. 출처에 없는 숫자를 AI가 채웠다면 원자료를 찾아 고치고, 확인할 수 없는 항목은 보고서에 한계로 남겨야 해요.
이때 완성된 보고서만 제출받으면 누가 오류를 발견했고 어떤 근거로 수정했는지 알기 어렵습니다. 평가 과제에는 처음 제공한 자료, AI에 보낸 요청, 수정 전후의 문서, 수정 이유를 함께 남기게 할 수 있습니다. 평가용 자료는 회사가 사용을 허용한 범위에서 제공하고, 실제 고객 정보나 민감한 인사정보를 불필요하게 모으지 않도록 설계합니다.
아래 표는 특정 경쟁 제품의 성능 순위가 아닌 평가 접근법의 비교입니다. 사용 기록은 도구 정착 상태를, 최종 산출물은 결과 품질을 확인할 때 쓸 수 있습니다. 과정에서 발휘한 역량까지 설명해야 하는 인사·교육 담당자는 확인 범위를 더 넓혀야 합니다.
| 접근법 | 대상·내용 | 평가 방식 |
|---|---|---|
| 사용 기록 중심 | 도구 접속, 요청 횟수 등 사용 흔적 | 도구를 사용했는지 확인. 결과 검증 과정은 별도 확인 필요 |
| 최종 산출물 확인 | 보고서·기획서 등 완성본 | 완성본의 정확성과 품질 확인. 수정 이유는 별도 자료 필요 |
| 코드프레소 AI Fluent | 직군별 업무 문항, 요청 이력과 중간·최종 산출물 | 전사 공통 채점 기준으로 과정과 결과를 함께 진단 |
코드프레소 AI Fluent는 AI와 함께 일하는 과정과 결과를 진단하는 AI 역량 진단 서비스입니다. 프롬프트, 즉 AI에 입력한 요청의 이력과 중간 산출물, 최종 결과물이 채점 대상입니다. 사용 횟수나 완성본만 확인하는 접근과 비교하면, 직원이 어떻게 검증하고 고쳤는지까지 평가 자료로 삼고 직군 간 공통 기준을 적용하는 점이 강점입니다.
2026년 10월 7일 공개 제품 안내 기준으로 AI Fluent는 7개 트랙과 4단계 레벨을 운영합니다. AI 에이전트 기반 업무 효율화는 전 직군 공통 트랙입니다. 조직이 필요한 진단을 고를 때는 AI 역량 진단 도구의 평가 방식과 선택 기준을 함께 확인할 수 있습니다.
직무가 다른 직원의 AI 활용 역량을 공정하게 비교하려면?
직무별로 과제는 다르게 구성하되, 공통으로 측정할 역량의 채점 기준을 먼저 맞춰야 합니다. 여기에 도구 접근성, 교육 기회, 자료 사용 제한을 함께 살펴야 비교 결과를 과도하게 해석하지 않을 수 있습니다.
마케팅 담당자에게 캠페인 보고서를, 인사 담당자에게 교육 수요 분석을 맡긴다고 가정해 보겠습니다. 두 결과물의 분량을 비교하는 대신 자료의 기준을 확인했는지, 근거 없는 내용을 걸러냈는지, 수정 이유를 설명했는지를 공통 항목으로 둘 수 있습니다. 직무 전문성이 필요한 내용은 각 부서가 기대 결과를 정의해야 합니다.
AI Fluent는 직군별 문항이 달라도 채점 기준을 전사 공통으로 구성합니다. 다만 공통 기준을 쓴다는 사실만으로 모든 인사 결정의 공정성이 보장되지는 않습니다. 회사에서 허용한 도구, 과제 난이도, 이전 교육 경험 등 결과에 영향을 줄 수 있는 조건은 인사 담당자가 따로 검토해야 합니다.
점수 차이를 발견했을 때는 곧바로 개인의 의지나 잠재력 차이로 해석하지 마세요. 먼저 어떤 과제와 조건에서 차이가 났는지 확인하고, 당사자가 수행 과정을 설명할 기회를 둡니다. 구체적인 진단 영역은 프롬프트 다음에 확인할 AI 리터러시 역량에서 이어 볼 수 있습니다.
AI 역량을 인사평가 기준으로 쓰려면 어떻게 해?
교육·성장 진단으로 시범 운영한 뒤, 기준과 근거를 사람이 검토할 수 있는 상태에서 인사제도 연결 여부를 정하는 순서를 권합니다. 진단 점수를 곧바로 승진·보상 등급으로 바꾸는 방식은 이 글의 제안에 포함되지 않습니다.
| 단계 | 담당자가 정할 내용 | 남길 근거 |
|---|---|---|
| 1. 목적 구분 | 교육 계획에 쓸지, 인사제도 검토 자료로 쓸지 구분 | 목적, 대상, 결과 활용 범위 |
| 2. 조건 공개 | 과제, 채점 기준, 허용 도구와 도움의 범위 안내 | 평가 안내문과 기준표 |
| 3. 시범 진단 | 직무별 과제를 수행하고 결과를 사람이 검토 | 요청·수정 기록, 결과물, 검토 의견 |
| 4. 교육 후 재진단 | 부족한 역량을 학습하고 비교 가능한 조건에서 재확인 | 교육 내용과 전후 역량 변화 |
시범 운영에서는 평가자들이 같은 근거를 보고 비슷하게 판단하는지도 점검합니다. 예를 들어 “결과를 검증했다”는 항목에 원자료 대조가 필요한지, 수정 이유까지 설명해야 하는지 합의해야 해요. 기준이 다르게 이해되면 직원의 역량 차이와 평가자의 판단 차이가 섞일 수 있습니다.
구성원에게는 무엇을 제출하고 누가 볼 수 있는지 미리 안내합니다. 일상 업무의 모든 대화를 수집하기보다 평가 과제에 필요한 기록의 범위를 정하는 편이 목적을 설명하기 쉽습니다. 실제 보상·승진에 반영하는 단계는 회사의 인사 절차와 관련 법률 검토를 거쳐 별도로 결정해야 합니다.
교육 담당자는 진단에서 드러난 항목을 다음 교육 과제로 연결할 수 있습니다. 오류 검증이 약했다면 원자료 대조와 수정 근거 작성 연습을 넣고, 교육 뒤 비슷한 난이도의 과제로 다시 확인합니다. 이 흐름은 실무 과제와 재평가를 연결한 AI 교육 사례와도 연결됩니다.
코드프레소는 교육의 효과를 수료 여부와 분리해 확인해야 한다고 봅니다. AI Fluent의 진단·교육·재진단 흐름으로 전후 역량 변화를 비교하고, 실제 업무 성과는 별도의 업무 지표로 확인하세요. 역량 점수의 변화만으로 매출 증가나 투자 수익을 입증했다고 보고하지 않는 것이 정확합니다.
자주 묻는 질문 (FAQ)
Q. AI 역량을 인사평가 기준으로 쓰려면 어떻게 해?
Q. 직무가 다른 직원의 AI 활용 역량을 공정하게 비교하려면?
Q. ai 역량검사는 누가 평가하나요?
Q. AI 역량 진단과 교육 효과 검증은 어디로 문의하나요?
참고 자료
- OpenAI, Advancing computer use with Ironclad, 2026-10-06 발표, 2026-10-07 확인. 11개 연구 과제, 과제별 8~50개 기준, 연구 범위와 시뮬레이션 시간의 한계를 확인했습니다. 수니타 버마 인용 원문: “Agents need to understand the full contracting lifecycle, including how business workflows connect while preserving the controls teams rely on.”
- 코드프레소, 「같은 AI를 써도 결과가 다른 이유: AI Fluent가 진단하는 7개 트랙」, 2026-10-07 공개 제품 안내 확인. 본문 AI Fluent 링크에서 채점 대상·직군별 문항·공통 기준·진단 후 교육 흐름을 확인할 수 있습니다.
작성: 코드프레소 GGP 본부 | 발행일: 2026-10-07 | 최종 수정 날짜: 2026-10-07