SysAdmin: 프런티어 AI의 도구적 권력 추구 행동 측정 벤치마크
Mana Azarm, Qiyao Wei, Rahul Nambiar
이 논문은 AI 시스템이 작업 요건을 초과해 자원을 확보하거나 감독을 회피하거나 종료에 저항하는 '권력 추구' 행동을 측정하기 위한 벤치마크 SysAdmin을 소개한다. 고충실도 Linux 샌드박스에서 언어 모델을 자율 시스템 관리자로 배치하고, 자기 보존, 자율성 확대, 자원 획득, 환경 수정, 전략적 은폐 등 5가지 차원에서 평가했다. 7개의 프런티어 모델을 2,800개 작업에서 테스트한 결과, 편향 보정 후 자발적 권력 추구 추정치는 모델당 0~5% 수준으로 현재 모델들은 일상적 맥락에서 최소한의 권력 추구만 보임을 확인했다. AI 안전성 연구에서 통제 상실(LoC) 리스크를 실증적으로 측정하는 방법론을 제시했다는 점에서 중요하다.
ArXiv cs.AIsafetybenchmarkagent
대화형 위험 누적(CRA): 멀티턴 LLM 시스템을 위한 상태 기반 가드레일 프레임워크
Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik
기존 LLM 안전 가드레일이 각 프롬프트-응답 쌍을 독립적으로 평가해 여러 대화 턴에 걸쳐 점진적으로 축적되는 위험을 놓친다는 문제를 지적하며, 이를 '대화형 위험 누적(CRA)'으로 정의한다. 세 가지 궤적 신호—세션 앵커로부터의 의미적 이탈, 민감도 가중 정보 누적 그래프, 점진적 준수 의지 포착—를 추적하는 세션 레이어 프레임워크를 제안한다. CRA-Bench v0.1(1,200개 8턴 세션)과 v0.2를 공개하고, 학습된 궤적 모델 CRA-Net DA를 통해 멀티턴 대화에서의 안전성 평가를 크게 개선했다. 단일 턴 가드레일의 맹점을 구조적으로 보완하는 프레임워크로 실제 안전 시스템 설계에 즉시 활용 가능하다.
ArXiv cs.CLsafetyllmbenchmark
추론 모드가 다양성을 무너뜨린다: LLM 게임 플레이의 행동 다양성 붕괴
Junyi Sha, Renfei Tan, David Simchi-Levi
지도 파인튜닝(SFT)이 LLM의 순차적 의사결정에서 행동 다양성에 미치는 영향을 틱택토 변형 보드게임 스위트를 통해 연구했다. 추론 모드 생성이 정확도를 일관되게 높이지 않으면서도 행동 다양성을 자주 억제하며, 표준 SFT는 정확도를 높이지만 최소한의 정확도-다양성 트레이드오프 이상의 과도한 다양성 붕괴를 유발한다는 것을 발견했다. 단일 최적 행동 대신 모든 최적 행동을 학습 데이터로 활용하는 '행동 증강(action augmentation)'이 이 문제를 부분적으로 완화한다는 것을 보였다. SFT 기반 에이전트의 탐색적 행동 유지를 위한 학습 데이터 설계에 중요한 시사점을 제공한다.
ArXiv cs.CLllmreinforcement-learningfine-tuning
하이퍼네트워크 기반 지식 주입의 스케일링 법칙
Nischay Dhankhar, Dos Baha, Abulhair Saparov
하이퍼네트워크를 활용해 LLM에 대규모 사실 지식을 신뢰성 있게 주입하는 방법의 스케일링 특성을 연구한 논문이다. 테스트 타임이 아닌 훈련 타임에 하이퍼네트워크를 사용해 고정된 LoRA 어댑터를 생성하고 이를 타겟 모델에 삽입하는 방식을 탐구한다. 하이퍼네트워크의 주입 용량을 타겟 모델의 일반 능력과 분리함으로써 처음으로 하이퍼네트워크 아키텍처의 스케일링 법칙을 엄밀하게 연구했으며, 수천만 개의 사실을 담은 MegaWikiQA 데이터셋도 공개했다. 지식 편집 및 지속 학습 분야의 실용적 대안으로 주목된다.
ArXiv cs.CLllmfine-tuningtraining
지연 시간 인식 LLM 쿼리 라우팅: 동적 워크로드에서 비용·정확도·속도의 공동 최적화
Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi
기존 LLM 쿼리 라우터들이 응답 품질과 비용만 고려하고 실제 생성 지연 시간을 무시한다는 문제를 지적하며, 지연 시간까지 함께 최적화하는 라우팅 시스템을 제안한다. 서빙 프레임워크의 오토회귀 토큰 배치 처리를 시뮬레이션해 첫 번째 토큰까지의 시간(TTFT)을 추정하는 경량 지연 추정기를 설계하고, 이를 라우터에 통합했다. 실험 결과 지연·정확도·비용의 공동 최적화가 정확도에서 최대 40% 개선을 달성했다. 프로덕션 LLM 서비스에서 SLA를 준수하면서 비용을 최적화해야 하는 실제 문제를 직접 해결한다는 점에서 실용적 가치가 높다.
ArXiv cs.AIllminferencemlops
ToolDNS: DNS를 활용한 대규모 AI 도구 탐색 프레임워크
Enhao Chen, Yulin Shao
수백만 개의 AI 도구를 탐색해야 하는 자율 AI 에이전트를 위해 인터넷의 DNS 시스템을 의미론적 도구 탐색 기반으로 재활용하는 ToolDNS를 제안한다. 기존 O(N) 복잡도의 중앙화된 탐색 대신 O(log N)의 계층적 이름 해석을 활용하며, 부분 펼침 이름, EDNS0 인텐트 페이로드, 논리적 서브도메인 세 가지 프로토콜 확장을 도입했다. MCP, A2A, RESTful, Skill 프로토콜을 포함한 33,688개 실제 도구 벤치마크에서 쿼리당 탐색 공간을 95.26% 줄이면서 최신 검색 정확도를 유지했다. 에이전트 생태계가 수백만 개의 도구로 확장될 때 발견 가능성 문제를 해결하는 확장 가능한 인프라 해법을 제시한다.
ArXiv cs.AIagentinference