에이전트의 투기적 도구 실행
다음 도구 호출을 미리 실행해 모델 생성과 도구 대기를 겹치는 구조, 확정 경로와 부작용 경계를 설명합니다.
투기적 도구 실행은 다음 호출을 예측해 먼저 돌리되, 모델이 같은 호출을 확정할 때까지 그 결과를 격리하는 지연시간 최적화입니다.
직렬 경로의 대기 시간
대규모 언어 모델(Large Language Model, LLM) 에이전트는 모델 생성과 도구 실행을 번갈아 수행합니다. 모델이 호출을 만들면 실행기가 결과를 돌려주고, 모델은 그 결과를 보고 다음 행동을 정합니다. 의미상 앞 단계의 결과가 뒤 단계에 필요하므로 이 순서는 유지되어야 합니다.
문제는 의미상의 순서를 물리적인 직렬 실행으로 그대로 옮길 때 생깁니다. 모델이 생성하는 동안 도구 실행기는 쉬고, 도구가 실행되는 동안 해당 세션의 모델 호출은 기다립니다. Pattern-Aware Speculative Tool Execution(PASTE)은 다음 호출을 예측해 모델 생성과 겹칩니다. 모델이 같은 호출을 확정하기 전에는 결과를 세션에서 격리합니다(PASTE, 2026-09 확인).
투기적 실행은 이 대기 구간을 겹칩니다. 현재까지 관찰한 실행 기록으로 다음 호출을 예측할 수 있으면, 모델이 아직 다음 응답을 생성하는 동안 도구를 먼저 실행합니다. 에이전트가 행동을 결정하는 의미상의 순서는 그대로 두고, 실행 시점만 앞당깁니다.
병렬 폭과 투기 실행
병렬 도구 호출과 투기적 도구 실행은 서로 다른 축을 줄입니다. 둘 다 여러 작업을 동시에 실행하지만, 호출이 확정되는 시점과 줄이는 대기 구간이 다릅니다.
| 구분 | 병렬 폭 확장 | 투기적 도구 실행 |
|---|---|---|
| 시작 조건 | 모델이 한 턴에서 여러 호출을 확정 | 런타임이 미래 호출을 예측 |
| 동시 실행 대상 | 같은 턴의 독립된 호출들 | 모델 생성과 예측된 다음 호출 |
| 주된 효과 | 필요한 추론 턴 수 감소 | 직렬 경로에 드러나는 도구 대기 감소 |
| 오답 비용 | 불필요한 확정 호출의 비용 | 폐기할 예측 실행의 자원 비용 |
Wide and Deep(W&D)는 한 추론 단계에서 여러 검색 호출을 확정하고 결과를 함께 모으는 width 확장을 다룹니다. 여러 출처를 같은 턴에 탐색해 비교하고, 필요한 추론 턴을 줄이는 방향입니다(W&D, 2026-09 확인).
투기적 실행은 한 턴의 확정 호출 수를 늘리는 데 의존하지 않습니다. 검색 뒤 문서 읽기처럼 반복되는 순차 작업에서 실행 시점을 앞당기는 접근입니다. 독립 질의의 탐색 범위를 넓히는 병렬 폭 확장과 함께 사용할 수도 있습니다.
검색에서 읽기로 이어지는 예시
다음은 동작을 이해하기 위한 실행 예시이며, 논문의 구현 절차를 옮긴 것은 아닙니다. 에이전트가 검색을 끝내고 다음 판단을 생성하는 동안, 런타임이 검색 결과의 첫 웹페이지를 읽을 것으로 예측했다고 가정합니다.
이때 웹페이지 읽기라는 도구 이름만으로는 실행할 수 없습니다. 현재 검색 결과에서 가져온 웹주소와 접근 권한까지 있어야 구체적인 호출이 됩니다. 런타임은 전체 인자가 준비된 경우에만 읽기를 시작합니다.
예측의 근거는 서비스마다 다르게 정할 수 있습니다. 반복된 작업 기록, 정해진 워크플로, 현재 단계의 규칙을 사용할 수 있습니다. 중요한 조건은 미래 값을 지어내지 않고 지금 확인할 수 있는 값으로 호출을 완성하는 것입니다.
다음에는 아마 읽는다는 추측만 있다면 실행하지 않습니다. 웹주소가 아직 없을 때는 연결 준비나 캐시 확인처럼 상태를 바꾸지 않는 선행 작업만 허용할 수 있습니다. 실행 가능한 예측과 준비 힌트를 나누면 잘못된 인자로 외부 도구를 호출할 가능성이 줄어듭니다.
확정 경로와 결과 격리
모델이 실제로 내놓은 호출은 확정 호출(authoritative invocation)입니다. 예시의 모델이 같은 웹페이지 읽기를 요청하면 런타임은 도구 이름과 인자를 비교합니다. 이름이 같아도 웹주소가 다르면 적중으로 처리하지 않습니다.
예측 읽기가 끝났고 호출이 일치하면 저장한 결과를 재사용합니다. 아직 읽는 중이면 같은 작업의 남은 시간만 기다립니다. 모델이 두 번째 검색 결과를 골랐다면 첫 작업을 버리고 확정된 웹페이지를 정상적으로 읽습니다.
예측 결과는 일치 판정 전까지 별도 저장소에 둡니다. 기한 안에 같은 호출이 오지 않으면 버리고, 자원이 부족하면 진행 중인 작업을 중단합니다. 일치한 호출만 결과를 확정 세션 상태에 넣습니다.
이 예시에는 읽은 내용의 유효성을 확인하는 조건도 필요합니다. 같은 웹주소라도 그사이 내용이나 접근 권한이 바뀔 수 있으므로, 인자 일치만으로 재사용을 결정해서는 안 됩니다. 최신 조회가 필요한 작업에서는 예측 결과를 버리고 확정 호출 시점에 다시 읽도록 설계합니다.
결과 격리는 모델이 미확정 출력을 읽지 못하게 막습니다. 잘못 예측한 검색 결과가 다음 추론에 섞이지 않으므로 세션 기록은 확정 경로와 같습니다. 다만 이 격리가 이미 외부에서 일어난 쓰기까지 되돌리지는 않습니다.
부작용 경계
투기 실행은 이메일 전송이나 데이터 변경 권한을 뜻하지 않습니다. 외부 쓰기 요청, 결제, 메시지 전송, 파일 덮어쓰기는 호출 순간 외부 상태를 바꿀 수 있습니다. 결과 객체를 버리거나 세션에서 숨겨도 전송된 메일과 변경된 레코드는 복구되지 않습니다.
| 도구 유형 | 권장 처리 |
|---|---|
| 검색, 조회, 순수 계산 | 인자와 데이터 권한을 확인한 뒤 투기 실행 가능 |
| 캐시 준비, 의존성 로딩 | 부분 예측만으로 준비 작업 가능 |
| 파일 변경, 외부 시스템 쓰기 | 격리된 임시 환경이나 비변경 실행으로 변환 |
| 전송, 결제, 삭제 | 투기 실행 제외, 확정 호출과 기존 승인 절차를 기다림 |
결과 격리와 부작용 격리는 별개의 문제입니다. 예측 결과를 모델에게 숨기는 장치는 외부 시스템의 변경을 막지 못합니다. 따라서 운영 정책이 투기 실행 허용 범위를 먼저 제한해야 합니다.
실제 배포 정책은 도구별 허용 목록으로 더 좁게 잡는 편이 안전합니다. 읽기 호출도 요금, 요청 한도, 개인정보 접근을 소비할 수 있으므로 비용과 권한을 예측 예산에 포함합니다. 외부 쓰기는 모델의 확정 호출과 사용자 승인 등 기존 권한 검사를 모두 통과한 뒤 한 번만 실행합니다.
자원 스케줄링과 적용 기준
예측이 맞아도 확정 작업을 늦추면 전체 지연은 나빠집니다. 운영 스케줄러는 적중 가능성, 숨길 수 있는 대기 시간, 자원 요구량을 함께 보고 후보를 고릅니다. 예측 작업은 제한된 여유 자원만 쓰며, 경합이 생기면 확정 작업에 먼저 자리를 내줍니다.
도구 결과가 일찍 끝나면 여러 세션이 동시에 모델 서버로 돌아올 수 있습니다. 이때 요청이 몰리면 도구에서 아낀 시간이 모델 대기로 옮겨갑니다. 복귀 요청의 속도를 제한하고 현재 모델 부하에 맞춰 나눠 받아야 합니다.
2026년 9월 기준 PASTE v3 초록은 딥리서치, 코딩, 과학 에이전트에서 평균 태스크 완료 시간을 43.5% 줄였다고 보고합니다(PASTE). 이는 논문의 모델, 워크로드, 서버 구성에서 얻은 결과이며 개별 서비스의 보장 수치는 아닙니다.
적용 조건은 반복 패턴, 긴 도구 지연, 현재 상태에서 도출할 수 있는 인자입니다. 테스트 반복이나 검색 뒤 문서 열기처럼 구조가 안정적일수록 적중한 실행을 재사용하기 쉽습니다. 반대로 자유 탐색, 짧은 도구, 비싼 외부 서비스, 부작용 중심 작업에서는 예측 낭비가 이득보다 커질 수 있습니다.
정리
병렬 폭 확장은 한 턴에서 확정한 독립 호출을 함께 실행하고, 투기적 실행은 아직 확정되지 않은 다음 호출을 모델 생성과 겹칩니다. 투기 실행이 유효하려면 도구 이름과 인자를 구체적으로 예측하고, 실제 호출과 일치할 때만 결과를 확정 상태에 넣어야 합니다. 결과 격리는 외부 쓰기를 취소하지 못하므로 전송·결제·삭제는 대상에서 빼고 기존 권한 검사를 유지합니다. 반복 패턴과 긴 도구 대기가 있는 작업에서만 여유 자원을 배정하고, 모델 서버로 돌아오는 세션까지 함께 조절해야 지연 감소가 남습니다.