NCP-ArchPreview: 다음 개념 예측으로 잠재 공간 언어 모델을 향해
NCP Team, Jiaqi Cao, Chiyu Chen
표준 다음 토큰 예측(NTP)을 넘어서는 잠재 공간 언어 모델인 NCP-ArchPreview를 소개한다. 이 모델은 NTP와 함께 여러 토큰에 걸친 이산적 개념을 예측하는 '다음 개념 예측(NCP)'을 함께 학습하며, 은닉 상태에서 직접 곱 양자화된 개념 어휘를 구성한다. 8.9B 파라미터, 5.73T 토큰으로 학습한 결과 OLMo-3-7B 대비 51.3%의 학습 토큰만으로 동일한 사전학습 손실을 달성했으며, 다운스트림 성능도 2.45포인트 앞섰다. 토큰 수준을 넘어선 개념 수준의 학습 목표가 LLM 효율성을 크게 높일 수 있음을 대규모로 처음 실증한 연구다.
ArXivllmtrainingopen-source
서브에이전트 vs 에이전트 스킬: 장기 작업에서 재사용 가능한 지식 실행 방법 비교
Wasu Top Piriyakulkij, Rachel Lawrence, Alicia Curth
언어 모델 에이전트가 재사용 가능한 스킬 패키지(지시, 스크립트, 리소스가 담긴 멀티파일 번들)를 활용해 장기 태스크를 수행할 때, 기존의 스킬 지시를 컨텍스트에 로드하는 방식과 서브에이전트로 호출하는 방식을 체계적으로 비교한다. 서브에이전트 방식은 각 서브태스크마다 새로운 컨텍스트 창을 할당해 메인 컨텍스트 과부하를 방지한다. 스킬 패키지가 명확한 입출력 계약을 노출할 때 서브에이전트 실행이 더 우수한 성능을 보이지만, 추가적인 통신 오버헤드가 발생한다는 트레이드오프를 분석했다. 장기 실행 AI 에이전트의 컨텍스트 관리 전략을 체계화한 중요한 연구다.
OpenDiscoveryTrace: AI 과학자 워크플로 평가를 위한 프로세스 추적 데이터셋
Aayam Bansal, Keertan Balaji
기존 AI 과학자 벤치마크가 최종 산출물(코드, 가설, 논문)만 평가하고 추론 과정을 버린다는 문제를 해결하기 위해, 558개의 완전한 AI 과학 에이전트 궤적을 담은 공개 데이터셋을 제시한다. GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro 등 7개 모델이 124개 과학 태스크(신약 발굴, 재료과학, 유전체학, 문헌 분석)를 수행하는 과정을 단계별로 기록했다. 각 단계는 사고, 도구 호출, 관찰, 오류, 수정 트리거, 자기보고 신뢰도 등 9개 필드로 구조화된다. AI의 과학적 방법론을 감사하고 체계적 추론과 운 좋은 추측을 구분할 수 있게 해주는 최초의 대규모 프로세스 추적 데이터셋이다.
도구 메뉴를 실행 사전(Prior)으로: 온라인 에이전트를 위한 상태-경로 도구 메뉴
Bo Yan, Weikai Lin, Song Wang
수천 개의 도구 인터페이스를 가진 실용적 에이전트 환경에서, 에이전트에게 표시할 도구 서브셋('메뉴')을 최적으로 선택하는 방법을 연구했다. 기존 방식이 요청 관련성 기반으로 도구를 순위화하면서 최종 액션은 찾지만 필수 선행 도구를 누락하는 문제를 지적한다. '상태 경로(State Path)'를 도입해 현재 상태에서 목표까지의 실행 경로를 학습하고, 이를 기반으로 도구 메뉴를 구성하는 State-Path Tool Menu 프레임워크를 제안한다. ToolBench에서 온라인 성공률을 0.737에서 0.898로 크게 향상시켰다.
에이전트는 자신이 성공했는지 알까? 내부 표현으로 에이전트 신뢰도 보정하기
Priyanka Mary Mammen, Emil Joswin, Srujananjali Medicherla
멀티턴 에이전트 환경에서 모델의 내부 표현이 최종 태스크 성공 여부를 예측하는 신호를 제공할 수 있는지 탐구한 연구다. 잠재 궤적 역학(LTD)과 행동 표현 탐침(ARP) 두 가지 방법을 도입해, Bash·SQL·Python 3개 벤치마크와 Qwen14B·Qwen7B·DeepSeek6.7B 3개 모델 패밀리에서 기존 표면 수준 보정 기준선보다 일관되게 우수한 성능을 보였다. 프롬프트 수정이나 다중 샘플 롤아웃 없이 제로 오버헤드로 신뢰도 모니터링이 가능해, 안전 중요 에이전트 시스템에 실용적으로 적용할 수 있다.
XAI-Arena: LLM이 설명 가능한 AI의 설명 품질을 평가할 수 있는가?
Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein
XAI(설명 가능한 AI) 방법들이 생성하는 설명의 품질 평가가 주관적 인간 판단에 의존해왔다는 문제를 해결하기 위해, LLM을 판사로 활용하는 XAI-Arena 프레임워크를 제안한다. 단순성·명확성·과제 적합성·신뢰 보정·실행 가능성·투명성·충실도·전반적 해석 가능성 등 다차원으로 XAI 설명을 비교 평가한다. 인간 검증 결과 LLM 생성 평가와 인간 평가 사이의 상관계수(Spearman rho=0.693, p<0.001)로 강한 일치를 보여, 재현 가능하고 확장 가능한 XAI 평가 방법으로서의 가능성을 입증했다.
저자원 언어에서의 LLM 한계: 우르두어로 본 다국어 모델의 문화·언어적 취약점
Farah Adeeba, Abdul Rafae Khan, Rajesh Bhatt
GPT-5.1, Qwen-3-Max, DeepSeek-3.1 등 최신 LLM들이 우르두어로 이야기를 생성할 때 어떤 오류를 범하는지 체계적으로 분석한 연구다. 93개의 우르두어 이야기를 생성하고 9가지 언어·의미·문화적 분류 체계로 오류를 수동 주석화했다. 문법·의미 기본 오류, 일관성 부재, 부자연스러운 반복, 광범위한 문화적 피상성이 주요 문제로 나타났으며, 퓨샷 프롬프팅으로도 문화적·맥락적 오류는 대부분 해결되지 않았다. 다국어를 지원한다고 주장하는 LLM이 실제로 저자원 언어에서 얼마나 부족한지를 실증한 의미 있는 연구다.