AI 과학자 워크플로우 평가를 위한 프로세스 추적 데이터셋 OpenDiscoveryTrace
Aayam Bansal, Keertan Balaji
기존 AI 과학자 벤치마크는 최종 출력물만 평가하고 추론 과정을 무시했다. 이 논문은 558개의 완전한 AI 과학 에이전트 궤적을 담은 공개 데이터셋 OpenDiscoveryTrace를 제시하며, 각 단계별 사고, 도구 호출, 관찰, 오류, 수정 트리거, 자기 신뢰도 등 9개 필드를 기록한다. 신약 발굴, 재료과학, 유전체학, 과학 문헌 분석 등 124개 태스크를 GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro 등 7개 모델로 수집했다. AI 과학자의 추론 과정을 감사하고 실패 모드를 진단할 수 있는 최초의 체계적 데이터셋으로, 과학 AI 연구의 신뢰성과 방법론 검증에 핵심적인 기여를 한다.
서브에이전트 vs 에이전트 스킬: 장기 에이전트 태스크를 위한 재사용 가능한 지식 실행 비교
Wasu Top Piriyakulkij, Rachel Lawrence, Alicia Curth
LLM 에이전트가 긴 태스크를 처리할 때 재사용 가능한 스킬 패키지를 어떻게 효과적으로 활용할지를 연구한다. 기존 방식은 스킬 지시사항을 메인 컨텍스트에 로드해 에이전트가 따르게 하는데, 컨텍스트가 쌓일수록 추론 품질이 저하되는 문제가 있다. 이에 대한 대안으로 스킬 패키지를 서브에이전트로 호출해 독립된 컨텍스트 윈도우에서 실행하는 방식을 제안하며, 명확한 입출력 계약이 있는 경우 서브에이전트 방식이 우월함을 실험적으로 입증한다. 에이전트 프레임워크 설계자들에게 실질적인 아키텍처 선택 기준을 제공하는 중요한 연구다.
Osprey: 타겟에 무관한 사전학습으로 투기적 디코딩 드래프터 성능 향상
Fengxiang Bie, Yuqing Jian, Yifan Yu
투기적 디코딩(Speculative Decoding)에서 드래프터 모델은 특정 타겟 모델에 종속적으로 훈련되어 워크로드 변화 시 성능이 급락하는 문제가 있다. Osprey는 기성 소형 언어 모델의 사전학습 결과를 타겟 무관 자산으로 재활용하고, 경량 적응 단계만 거쳐 각 타겟에 맞는 드래프터를 만드는 방법을 제안한다. 이를 통해 타겟별 반복 학습 비용을 대폭 줄이면서도 높은 수용률을 유지한다. LLM 추론 가속화 분야에서 드래프터의 범용성과 재사용성을 높이는 중요한 기여다.
ArXivinferencellmtraining
SWORD: LLM의 다국어 사실 오류 거부 능력의 숨겨진 불일관성 탐지 벤치마크
Sanghyeok Park, Minji Kang, Hosung Kwak
현대 LLM이 다국어에서 인상적인 성능을 보이지만, 표준 벤치마크는 정답 선택만 평가하고 진정한 사실 이해는 측정하지 못한다는 문제를 지적한다. SWORD는 Wikidata 트리플을 체계적으로 변형해 8개 언어로 사실적으로 틀린 문장을 생성하고, 모델이 이를 일관되게 거부하는지 평가하는 벤치마크다. 모델이 의미적으로 그럴듯한 왜곡에서 무작위 대체보다 오히려 더 높은 정확도를 보인다는 반직관적 결과와, 동아시아 언어에서 성능이 특히 저하된다는 것을 발견했다. LLM의 다국어 사실 검증 능력의 실제 한계를 드러내는 중요한 벤치마크 연구다.
에이전트가 성공했는지 스스로 아는가? 내부 표현으로 에이전트 신뢰도 보정
Priyanka Mary Mammen, Emil Joswin, Srujananjali Medicherla
안전 중요 응용에서 에이전트 행동에 대한 신뢰도 측정이 필수적이지만, 기존 방법은 에이전트의 복잡한 실패 모드를 잘 포착하지 못한다. 이 논문은 잔차 스트림 표현의 변화를 추적하는 Latent Trajectory Dynamics(LTD)와 행동 결정 시점의 표현으로 성공을 예측하는 Action Representation Probe(ARP)를 제안한다. Bash, SQL, Python 환경과 Qwen, DeepSeek 등 3개 모델 패밀리에서 기존 베이스라인을 일관적으로 능가하며, 프롬프트 변경이나 다중 샘플링 없이도 제로 오버헤드 신뢰도 모니터링이 가능하다. 에이전트 배포의 안전성과 신뢰성을 높이는 실용적 기여로 평가된다.
온라인 에이전트를 위한 실행 사전으로서의 도구 메뉴 — State-Path Tool Menu
Bo Yan, Weikai Lin, Song Wang
수천 개의 도구 인터페이스를 가진 환경에서 LLM 에이전트가 올바른 도구를 적시에 선택하는 것은 매우 어렵다. 이 논문은 에이전트에게 제공되는 도구의 짧고 순서화된 서브셋인 '도구 메뉴' 개념을 도입하고, 현재 상태에서 원하는 결과까지의 경로인 'state path'를 학습해 실행에 필요한 도구를 올바른 순서로 제시하는 State-Path Tool Menu 프레임워크를 제안한다. ToolBench에서 온라인 성공률을 0.737에서 0.898로 끌어올리며 기존 검색, 리랭킹, 생성 기반 방법들을 모두 능가했다. 도구가 폭발적으로 증가하는 에이전트 환경에서 도구 선택의 정확성을 높이는 핵심 연구다.