자기 개선 LLM 에이전트의 메모리 보상 인플레이션 문제
Mohammad Asadolahi, Amir Amini, Samira Talebi
외부 메모리 기반으로 자기 개선하는 LLM 에이전트에서 'Echo Gap'이라는 새로운 실패 패턴을 발견한 연구다. 에이전트가 에피소드를 메모리에 저장할 때 LLM이 자체 평가한 점수(프록시 보상)를 함께 저장하는데, 오류가 있는 에피소드가 오히려 높은 보상을 받아 반복 재사용되는 악순환이 발생한다. 이 문제가 발생하는 이유는 LLM 자체 평가 오류와 검증자의 오류가 서로 상관관계를 가져 상쇄되지 않기 때문임을 수학적으로 증명했다. 자기 개선 에이전트의 신뢰성 있는 배포를 위해 반드시 해결해야 할 핵심 문제를 정식화했다.
ArXiv cs.AIagentreinforcement-learningllm
CoT-Core: Chain-of-Thought 기반 코어셋 선택으로 LLM 평가 비용 획기적 절감
Qihua Pan, Zhenheng Tang, Peijie Dong
LLM을 지속적으로 개발할 때 발생하는 과도한 평가 비용을 줄이기 위한 훈련 불필요(training-free) 핵심 질문 선택 프레임워크를 제안한다. 기존 방법들이 텍스트의 표면적 유사성에 의존하는 반면, CoT-Core는 LLM에게 제로샷 Chain-of-Thought 추론 궤적을 생성하게 한 뒤 이를 잠재 공간에 투영해 논리적으로 동등한 문제들을 클러스터링한다. GSM8K, MMLU, MMLU-Pro, GPQA 실험에서 고신뢰도 점수 추정을 유지하면서 평가 비용을 대폭 절감함을 입증했다. LLM 개발 사이클을 가속화하려는 팀에게 실용적인 도구가 될 것으로 기대된다.
ArXiv cs.AIllmbenchmarktraining
SIRIN: RAG·에이전트·메모리 기반 LLM 시스템의 문맥적 환각 탐지 통합 툴킷
Julia Belikova, Rauf Parchiev, Mikhail Filimonov
SIRIN은 RAG, 에이전트, 메모리 기반 LLM 시스템에서 발생하는 문맥적 환각(contextual hallucination)을 탐지하는 통합 툴킷이자 웹 UI다. 표현 프로빙, 불확실성 추정, 판사형 검증 등 세 가지 탐지 패러다임과 사전 생성 쿼리 답변 가능성 평가 기능을 하나의 인터페이스로 통합한다. 흰색 상자·검은 상자 설정 모두에서 응답 및 스팬 수준의 검사를 지원하며, 새 탐지기를 추가할 수 있는 경량 플러그인 설계를 채택했다. 코드가 공개되어 있어 실제 RAG 파이프라인에 즉시 적용할 수 있다.
소비자용 GPU에서 로컬 LLM 배포의 에너지 효율 벤치마크
Philipp M. Zähl, Anika Hennig
RTX 4060Ti 16GB 단일 소비자용 GPU에서 9개 오픈소스 LLM(1B~7B 파라미터)의 에너지 소비를 측정한 재현 가능한 벤치마크 연구다. Ollama 추론 엔진을 사용해 nvidia-smi로 GPU 전력 소비를 측정했으며, gemma3:1b와 llama3.2:1b가 각각 0.56, 0.65 J/토큰으로 가장 에너지 효율적이었다. 반면 7B Mistral 모델은 가장 효율적인 모델 대비 4.4배 더 많은 에너지를 소비했다. 모델 크기보다 아키텍처와 양자화 전략이 에너지 효율에 더 큰 영향을 미친다는 점이 핵심 발견이다.
ArXiv cs.AIllminferencequantization
JouleShare: 배치 LLM 서빙에서 요청별 에너지 사용량 공정 배분 프레임워크
Qi Luo, Kunlin Li, Ziwen Wang
GPU는 전력 사용량을 서버 전체 단위로만 측정하기 때문에 배치 처리 환경에서 개별 요청의 에너지 사용량을 정확히 파악하기 어려운 문제를 해결하는 연구다. JouleShare는 vLLM에서 요청 서브셋을 재현 실행하여 Shapley 값 기반의 공정한 에너지 배분 기준값을 산출하고, JCalib라는 경량 모델로 서빙 시점에 실시간 예측한다. 토큰 비례 배분 방식은 Shapley 공정 배분 대비 평균 0.44~0.46의 오차를 보임을 밝혔다. AI 인프라의 지속 가능성 보고와 비용 차지백에 필요한 정확한 에너지 회계 방법을 제시한다.
ArXiv cs.AIllminferencemlops
OncoTriad-QA: 방사선·병리·유전체 데이터를 통합한 범암종 의료 AI 벤치마크
Ahnaf Munir, Dannong Wang, Michael W. McDonald
암 진단 및 분석을 위해 방사선 영상, 전체 슬라이드 병리 이미지, 유전체 데이터를 통합하는 멀티모달 의료 AI 벤치마크 'OncoTriad-QA'를 소개한다. TCGA 데이터베이스의 9,281명 환자, 32개 암 코호트에 걸쳐 86,100개의 시맨틱 질문으로 구성되며, CT/MRI, 전슬라이드 영상, 체세포 돌연변이, RNA-seq, DNA 메틸화, 임상 메타데이터를 포괄한다. 단일 모달리티나 좁은 이미지-텍스트 태스크만 다루던 기존 의료 AI 벤치마크의 한계를 극복한 환자 수준의 통합 평가 체계를 제시한다는 점에서 의료 AI 연구의 중요한 기준점이 될 것이다.
ArXiv cs.CLmultimodalbenchmarkvision
OpenAI 프라이버시 필터 독립 평가: 42개 벤치마크로 분석한 개인정보 탐지 성능
Rohith Uppala
OpenAI의 15억 파라미터 양방향 PII 탐지 모델인 'Privacy Filter(OPF)'를 22개 언어, 5개 도메인에 걸친 42개 합성 벤치마크로 최초 독립 평가한 연구다. OPF는 구조화된 합성 PII에서 F1=0.855로 Presidio(0.431), XLM-RoBERTa(0.269)를 크게 앞섰지만, 서사 문장에 PII가 포함된 경우와 아랍어(F1=0.04), 키릴 문자(F1=0.03) 등 비라틴 문자에서는 성능이 급락했다. 이메일(0.78), 전화번호(0.76) 등 구조적으로 규칙적인 PII에는 강하지만, 이름(0.40), 주소(0.49) 등 문화적 변이가 큰 유형에는 약하다는 구체적인 한계를 규명했다.
ArXiv cs.CLsafetyllmbenchmark