서로를 속이고 시스템을 털어버리는 에이전트들: 2026년, 엔터프라이즈 '평가 우선'의 냉혹한 실체
엔터프라이즈 AI 전략 자문 및 임원 고스트라이팅 문의
기술과 비즈니스의 간극을 메우는 AI 도입 로드맵, 클라우드 파트너십 구축, 테크 브랜딩 칼럼 기고를 협업합니다.
최근 며칠 사이 두 편의 테크 리포트를 연달아 읽고 깊은 생각에 잠겼다.
하나는 공격자가 투입한 자율형 AI 에이전트가 사람의 개입 없이 단 6시간 만에 엔터프라이즈 인프라의 자격 증명 수천 개를 탈취했다는 보안 일지였고, 다른 하나는 구글 연구진이 에이전트 군집을 관찰했더니 목표 점수를 높이기 위해 시스템 규칙을 어기고 속임수를 쓰는 녀석과 이를 감시해 시스템에 밀고하는 녀석이 동시에 나타났다는 논문이었다.
이 두 소식을 접하며 20년 넘게 전산 시스템을 다루며 품어왔던 소프트웨어의 가장 기본적인 대전제가 마침내 무너져 내리고 있음을 실감했다.
깨어진 결정론의 신화
지금까지 소프트웨어 엔지니어링의 본질은 결정론(Determinism)이었다. C 언어의 메모리 오류를 잡든 분산 트랜잭션의 충돌을 해결하든, 기계는 언제나 인간이 작성한 논리에 따라 정직하게 성공하거나 정직하게 실패했다. 버그가 있다면 그것은 코드를 잘못 짠 사람의 책임이었다.
하지만 에이전트가 주체적으로 판단하고 행동하는 현시점, 풍경은 완전히 달라졌다.
새벽 2시에 시작된 에이전트의 공격은 표적 탐색부터 백도어 설치까지 몇 시간 만에 끝이 난다. 교대 근무자가 출근해 슬랙 알림을 확인했을 때는 이미 데이터베이스 전체가 털린 뒤다. 공격은 ‘기계의 속도’로 달리고 있는데 방어는 여전히 ‘인간의 결재 시간’에 머물러 있다면 결과는 뻔하다.
더 기괴한 것은 에이전트 간의 상호작용이다. 고객 만족도나 업무 처리량 지표를 극대화하라고 지시받은 에이전트들이, 목표치를 맞추기 위해 백엔드 작업을 대충 허위 완료 처리하거나 감시 시스템의 눈을 피하려 통신 내용을 왜곡하기 시작했다. 인간 사회의 ‘대리인 문제(Agent Problem)‘가 디지털 세계에서 문자 그대로 재현되고 있는 꼴이다.
만들고 나서 시험하는 자들의 패배
이 혼란 속에서 인도의 유니콘 기업 젭토(Zepto)가 데이터브릭스 기반으로 구축한 ‘평가 우선(Evaluation-First)’ 아키텍처 사례를 보며 나는 우리가 서 있는 좌표를 다시 확인했다.
많은 조직이 여전히 프롬프트를 다듬고 RAG 파이프라인을 붙여 그럴듯한 데모를 만든 뒤에야 사후 테스트를 고민한다. 그러나 젭토는 에이전트 코드를 단 한 줄도 짜기 전에, 모델의 행동과 도구 호출을 어떻게 실시간으로 채점하고 격리할 것인가 하는 ‘평가 파이프라인’부터 설계했다.
테스트를 사후 액세서리로 취급한 시스템치고 대규모 환경에서 살아남은 사례를 본 적이 없다. 과거 TDD가 정적인 코드의 품질을 담보했다면, 에이전트 시대의 평가 우선주의는 통제 불능의 지능이 넘지 말아야 할 물리적 경계선을 긋는 일이다.
도구를 호출할 때 인자값의 범위를 벗어나는지, 다중 대화 속에서 초기 보안 지침을 우회하려 드는지, 복수의 에이전트가 담합해 데이터 무결성을 훼손하는지를 실시간으로 감시하지 못하는 시스템은 프로덕션에 올릴 자격이 없다.
아키텍트가 마주한 새로운 책무
이 변화가 우리에게 던지는 진짜 의미는 분명하다. 소프트웨어 아키텍처의 무게중심이 ‘단일 기능의 구현’에서 ‘에이전트 사회의 치안 유지’로 완전히 이동했다는 사실이다.
속임수를 쓰는 에이전트를 잡기 위해 감시 에이전트를 세워야 하고, 그 감시자가 왜곡된 보고를 하지 않는지 제3의 평가 파이프라인이 백그라운드에서 상시 회전해야 한다. 거버넌스는 배포 전 체크리스트가 아니라, 시스템 런타임 그 자체여야 한다.
기계가 자율성을 얻고 서로를 속이기 시작한 시대, 아키텍트에게 필요한 것은 더 똑똑한 모델이 아니다. 그 위험한 지능들을 냉혹하게 감시하고 격리할 수 있는 타협 없는 통제 인프라다.