인사이트 / 블로그
답변 대신 판단만 하는 AI ‘Jev’ 등장
![]()
기업용 AI 에이전트의 모든 판단에 같은 수준의 AI가 필요할까
9월 15일 TypeSafe AI가 공개한 Jev는 우리가 익숙하게 써온 생성형 AI와 다릅니다. 긴 답변이나 코드를 만드는 대신, 주어진 상황을 읽고 선택·점수·참거짓 등 정해진 형식의 판단과 확률을 돌려줍니다. “이 문의를 어느 팀으로 보낼까”, “다음 단계로 진행할까”처럼 소프트웨어가 다음 행동을 정할 때 쓸 수 있는 모델입니다.[1]
반응도 빨랐습니다. 이튿날 Vercel AI Gateway에 추가된 Jev는 첫 24시간 동안 Vercel 유료 사용팀의 13%가 사용했습니다. Vercel이 밝힌 역대 가장 빠른 초기 모델 채택이었습니다. 무료 체험 기간 중 집계한 수치로, 유료 구매나 장기 이용 실적이 아닌 초기 관심을 보여줍니다.[2][3]
더 좋은 답을 만드는 AI가 계속 나오는데, 왜 ‘판단에 집중한 AI’를 따로 시험하기 시작했을까요? 그 이유를 찾으려면 모델 성능표보다 먼저, 기업이 에이전트에게 맡기는 일을 들여다볼 필요가 있습니다.
주문 문의 하나를 처리할 때도 고객의 요청을 이해하고, 본인 확인을 거쳐 주문을 조회한 뒤 안내해야 합니다. 겉으로는 하나의 업무지만 각 단계에서 해야 할 일은 다릅니다.
Salesforce의 공식 고객지원 예제에서도 이 차이가 드러납니다. 고객의 말에 맞춰 대화를 이어가고 다음에 호출할 기능을 고르는 데는 대규모 언어 모델(LLM)을 사용합니다. 반면 인증코드가 맞는지는 정해진 처리 절차가 확인하고, 검증 결과에 따라 주문 조회를 허용합니다. 자연어를 이해하는 판단과 규칙대로 확인하는 처리가 한 에이전트 안에 함께 들어 있습니다.[4]
Microsoft가 자사 채권회수 업무에 적용한 AI도 이메일 전달에만 머물지 않습니다. 고객 대화를 요약하고, 연체나 분쟁 가능성을 예측하며, 담당자가 우선 처리할 업무를 정하도록 돕습니다. 어느 담당자에게 보낼지 고르는 일과 고객의 과거 상황을 종합해 대응 순서를 정하는 일은 필요한 정보가 다릅니다.[5]
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
SAP 교육자료의 송장 대조 사례를 보면 더 구체적입니다. 에이전트는 송장을 구매주문·입고 기록과 비교하고, 허용 범위 안의 차이를 처리한 뒤 지급 일정과 처리 결과를 기록합니다. SAP는 이 과정에서 정상적인 패턴을 따르는 80%의 송장은 에이전트가 처리하고, 별도의 판단이 필요한 20%는 재무팀이 맡는 구조를 설명합니다.[6]
이 비율은 모든 기업에 적용할 자동화 목표가 아닙니다. 주목할 것은 ‘송장 업무를 맡긴다’는 큰 과제를 실제 처리 조건에 따라 나눈 방식입니다. 자료가 일치하는지 확인하는 단계, 정해진 허용 범위에 들어가는지 따지는 단계, 예외 사유를 검토하는 단계를 구분하면 자동화 범위와 담당자의 역할도 달라집니다.
따라서 자동화 범위를 정할 때는 어떤 조건까지 시스템이 처리하고, 무엇이 달라졌을 때 담당자가 확인해야 하는지를 먼저 정해야 합니다. 이 경계가 없으면 에이전트에게 일을 맡겨도 사람이 모든 결과를 다시 확인해야 할 수 있습니다.
Jev도 에이전트 전체를 대신하기보다, 업무 중간의 판단을 문장 생성과 분리해 처리하는 데 쓰일 수 있습니다. Vercel은 요청 분류, 다음 도구나 하위 에이전트 선택, 우선순위 평가, 계속 진행·재시도·중단 여부 등을 활용 예로 제시합니다. 결과를 긴 설명문으로 받은 뒤 다시 해석하지 않고, 프로그램이 바로 사용할 수 있는 값으로 받는 방식입니다.[2][3]
다만 답의 형태가 짧다고 판단까지 간단한 것은 아닙니다. ‘승인할까’라는 질문도 금액 기준 하나만 확인하면 되는 경우와 계약·거래 이력·예외 사유를 함께 봐야 하는 경우는 다릅니다. 선택지가 두 개라는 이유만으로 같은 방식으로 처리할 수는 없습니다.
인증코드 일치 여부처럼 규칙으로 확실히 확인할 수 있는 일은 굳이 AI가 다시 추정할 필요도 없습니다. 반대로 문의 내용이나 업무 상황을 읽고 정해진 선택지 중 하나를 골라야 하는 일은 판단 모델을 검토할 만한 대상입니다. 여러 자료를 종합해 대응 전략을 만들거나 고객에게 설명할 문장을 작성하는 일은 또 다른 역할입니다. 업무를 나누는 목적은 모델 수를 늘리는 것이 아니라, 각 단계에 불필요한 처리를 줄이는 데 있습니다.
이 구분은 사용량이 늘수록 비용과도 연결됩니다. Vercel이 공개한 2026년 4월 AI Gateway 운영 데이터에서 도구 호출로 끝난 요청은 전체의 22.2%였지만, 해당 요청에 포함된 토큰은 전체의 58.9%였습니다. 요청 건수만 보면 일부였던 작업이 모델이 처리한 데이터양에서는 절반을 넘은 것입니다.[8]
에이전트는 검색 결과를 읽고, 다른 시스템을 조회하고, 결과를 확인한 뒤 다시 판단하는 과정을 이어갈 수 있습니다. 그래서 최종 답변 한 번의 가격만으로는 업무 전체의 비용을 알기 어렵습니다. 무엇을 몇 번 읽고 판단하는지까지 봐야 비용이 어디에서 쌓이는지 보입니다.[8]
그렇다고 이 수치만으로 판단 모델의 절감 효과를 계산할 수는 없습니다. 반복 판단을 별도로 처리하는 것이 유리한지는 실제 업무에서 확인해야 합니다. 잘못된 분류를 고치느라 재시도와 사람의 검토가 늘면, 호출 한 번의 비용을 아껴도 전체 처리비는 줄지 않을 수 있습니다.
오류의 영향도 중요합니다. 담당 부서를 잘못 골랐을 때 다시 배정하면 되는 업무와, 잘못된 승인으로 고객 정보가 노출되거나 지급이 실행되는 업무는 다르게 다뤄야 합니다. 판단에 필요한 정보와 틀렸을 때의 영향을 함께 봐야 어디까지 자동으로 처리할지 정할 수 있습니다.
이번 변화가 특히 중요한 사람은 AI 도입 범위를 정하는 사업부 책임자, AX 담당자, AI 프로젝트 PM과 개발·IT 조직입니다. 이들에게 필요한 질문은 “우리도 Jev를 써야 하나”보다 “우리 업무의 어느 부분에 어떤 판단이 필요한가”에 가깝습니다.
방법은 복잡할 필요가 없습니다. 도입하려는 업무 하나를 골라 실제 처리 순서대로 적고, 각 단계 옆에 필요한 정보, 판단 기준, 예외 발생 시 담당자를 붙여보면 됩니다. 고객지원이라면 문의 이해, 본인 확인, 주문 조회, 해결 가능 여부 판단, 답변, 담당자 이관으로 나눌 수 있습니다. 그러면 규칙으로 처리할 일, 문맥을 읽어야 할 일, 사람이 결정할 일이 구체적으로 드러납니다.
이때 현업은 승인 기준과 예외를 설명하고, 개발팀은 필요한 데이터와 실행 조건을 확인할 수 있습니다. “고객지원을 자동화하자”는 요청보다 “어떤 경우까지 자동으로 처리하고 언제 넘길지 정하자”는 합의가 개발 범위와 검증 기준을 잡는 데 더 도움이 됩니다.
Microsoft도 채권회수 AI를 도입하면서 에이전트 개발만큼 업무 경험을 다시 설계하고 기반 시스템을 정비하는 일이 중요했다고 설명합니다. 좋은 모델을 붙이는 일과 실제 업무가 돌아가게 만드는 일은 같지 않았던 것입니다.[5]
에이전트 도입의 출발점은 모델 선택보다 업무 분해에 가깝습니다. 업무를 나눠봐야 자동화할 범위와 필요한 추론 수준, 사람이 확인할 지점을 정할 수 있습니다. 모델 비교는 그다음에 각 단계가 요구하는 일을 기준으로 진행하면 됩니다.
Jev가 모든 기업 에이전트의 정답이라는 뜻은 아닙니다. 다만 이번 뉴스는 익숙한 질문의 순서를 바꿉니다. ‘어떤 AI가 가장 뛰어난가’를 묻기 전에, ‘우리 업무에서 AI가 실제로 판단해야 하는 것은 무엇인가’를 먼저 묻는 것. 답변을 만들지 않는 AI가 등장한 지금, 기업이 들여다볼 것은 새로운 모델의 이름뿐 아니라 맡기려는 업무의 속사정입니다.
최근 미디어에 소개된 써로마인드의 주요 소식을 확인해 보세요.