papers

오늘의 논문

· 7건

2026.10.07 ArXiv의 주요 AI 논문 7건을 한국어로 요약했습니다. 오늘의 톱: 에이전트 툴 사용 시 멀티모달 LLM의 안전 거부 능력이 급격히 저하된다 · 자동 진단과 스킬 발견으로 수치 지능(Numerical Intelligence)을 학습시키는 ADSD 프레임워크 · 블랙박스 LLM 에이전트를 대리 모델 로그 확률로 감사(audit)하는 Proxy Confidence.

01
ArXiv·Rikiya Takehi, Ryo Hachiuma, Shaona Ghosh

에이전트 툴 사용 시 멀티모달 LLM의 안전 거부 능력이 급격히 저하된다

이 논문은 에이전트 방식으로 툴(줌, 태깅 등)을 사용하는 멀티모달 LLM(MLLM)이 해로운 요청에 대한 거부 능력이 크게 떨어진다는 심각한 안전 취약점을 발견했다. 세 가지 주요 안전 벤치마크에서 실험한 결과, 오픈·클로즈드 가중치 모델 모두 툴 사용 환경에서 비툴 환경 대비 최대 68.7%의 거부 실패율 증가를 보였다. 10만 개 이상의 응답 분석을 통해 안전 저하의 두 가지 가능한 원인을 제안하며, 에이전트 AI 시스템 설계 시 반드시 고려해야 할 안전 취약점으로 경고한다.

원문 읽기 ↗
02
ArXiv·Peter Chen, Wotao Yin

자동 진단과 스킬 발견으로 수치 지능(Numerical Intelligence)을 학습시키는 ADSD 프레임워크

AI 에이전트가 수치 솔버(numerical solver)의 성능 저하 원인을 스스로 진단하고, 이를 바탕으로 적절한 수치 기법을 발견해 재사용 가능한 솔버 스킬로 패키징하는 ADSD 프레임워크를 제안한다. 파워 플로우 방정식, AC 최적 전력 제어, 강직 미분방정식 등 4개의 도전적 수치 도메인에서 솔버 정확도·견고성·효율성을 일관되게 개선했으며, GOC-500 파워 플로우에서 평균 오류를 71배 줄이는 성과를 달성했다. 코드 생성을 넘어 알고리즘 자체를 개선하는 AI 에이전트의 가능성을 보여준다.

원문 읽기 ↗
03
ArXiv·Yikai Zhao, Saurabh Pandey, Pradeep Kumar Misra

블랙박스 LLM 에이전트를 대리 모델 로그 확률로 감사(audit)하는 Proxy Confidence

배포된 LLM 에이전트는 토큰 확률을 공개하지 않아 에이전트 행동의 신뢰도를 평가하기 어렵다는 문제를 해결하는 방법론을 제안한다. 저비용 오픈 가중치 대리 모델을 병렬로 실행해 에이전트의 툴 호출·쿼리·코드에 대한 신뢰도를 다양한 방식(teacher forcing, PMI, 판별 평결 등)으로 추정한다. 학습이 필요 없고 에이전트 내부에 접근하지 않아도 되며, 단 하나의 프리필 비용으로 실행 가능해 실용성이 높다.

원문 읽기 ↗
04
ArXiv·Muhammad Ahmed Mohsin, Myeongsoo Kim, Kangrui Ruan

코딩 에이전트를 신뢰성 있게 학습시키기 — SWE-bench에서 52.8% 달성

자율 코딩 에이전트의 신뢰성을 높이기 위해 위치 다양성, 편집 다양성, 검증 신뢰성이라는 세 가지 핵심 행동을 정책(policy)에 직접 학습시키는 방법을 제안한다. 실행 피드백으로 탐색을 유도하고 각 패치를 원래 트리 기준으로 채점하는 방식으로 SWE-bench Verified에서 52.8%를 달성했으며, 이는 8샘플 베이스라인 대비 에이전트 스텝을 48.1% 절약한 결과다. SFT와 RL 학습 조합으로 pass@1을 31.9%에서 35.2%로, pass@8을 46.7%에서 51.1%로 향상시켰다.

원문 읽기 ↗
05
ArXiv·Khashayar Pourtaheri, Ahmad Zareei

LLM 합성 페르소나에서 인구통계 설명보다 행동 이력이 더 효과적

LLM을 설문 응답자 대리인(synthetic persona)으로 활용할 때, 인구통계·성격·인지 점수 등 설명적 정보보다 응답자의 과거 행동 이력을 제공하는 것이 개별 선택을 더 정확하게 예측한다는 것을 845명의 미국 성인 패널 데이터로 실증했다. 집단 수준에서는 편향 수가 비슷하지만, 개인 간 분산 재현에서는 페르소나 설명이 인간 수준의 53~67%에 그친다. AI 합성 페르소나 연구의 유효성 기준을 재정립하는 중요한 실험적 근거를 제공한다.

원문 읽기 ↗
06
ArXiv·Yifeng Zhao, Hongjun Yu, Shibo Wang

CoT 추론의 토큰 비용을 줄이는 구문 정렬 텍스트-잠재 압축 SynLat

긴 Chain-of-Thought(CoT) 추론 과정의 토큰 비용을 줄이기 위해, 압축 경계를 구문 구조(syntactic structure)에 정렬하는 SynLat 프레임워크를 제안한다. 비겹치는 구문 정렬 단위(SAU)를 사용해 의미 있는 청크 단위로 압축하며, 단일 압축 조건 스튜던트 모델이 질문과 압축 수준만으로 혼합 추론을 생성한다. Qwen3-8B/14B에서 MEDIUM·HIGH 압축 수준에서 최강 베이스라인을 각각 최대 7.0/5.5 포인트 상회하는 성과를 달성했다.

원문 읽기 ↗
07
ArXiv·Ziye Deng, Lufang Chen, Shuyu Feng

WAM 양자화 시 정책 향 잠재 계약을 보존하는 LatentQuant

비디오 VAE를 재사용하는 세계 행동 모델(WAM)에서 NVFP4 양자화 시 인코더 잠재 표현이 변화해 다운스트림 액션 정책 성공률이 95.5%에서 10.5%로 폭락하는 문제를 발견하고 해결한다. 양자화-역양자화 연산이 디코더 그라디언트를 왜곡해 인코더에 잠재 드리프트를 유발하는 메커니즘을 규명했다. LatentQuant는 인코더를 먼저 고정밀 기준에 정렬한 뒤 디코더만 적응시키는 2단계 QAT로 LIBERO에서 95.75% 성공률을 회복한다.

원문 읽기 ↗