AI Today
오후 에디션
AI Weather
Gemma 4 기술 보고서 공개와 AI 에이전트 스킬 생태계가 급성장하는 가운데, 시스템 프롬프트 유출과 MCP 도구 과부하 문제가 개발자들 사이에서 뜨거운 화제인 하루.
오후 에디션
AI Weather
Gemma 4 기술 보고서 공개와 AI 에이전트 스킬 생태계가 급성장하는 가운데, 시스템 프롬프트 유출과 MCP 도구 과부하 문제가 개발자들 사이에서 뜨거운 화제인 하루.
구글 Gemma 팀이 4세대 오픈웨이트 모델 'Gemma 4'의 공식 기술 보고서를 ArXiv에 공개했다. Gemma 4는 2.3B부터 31B까지 다양한 크기를 제공하며, 밀집(dense) 아키텍처와 MoE(Mixture-of-Experts) 아키텍처를 모두 지원한다. 특히 12B 모델에는 별도의 인코더 없이 오디오와 이미지 패치를 직접 처리하는 통합 인코더-프리 아키텍처가 도입됐다. 모든 모델 크기에 걸쳐 개선된 비전·오디오 인코더가 탑재됐으며, 응답 전 추론 트레이스를 생성하는 '씽킹 모드(thinking mode)'도 통합됐다. STEM, 멀티모달, 장문 컨텍스트 벤치마크에서 전작 대비 큰 성능 도약을 이뤘으며, 더 큰 오픈 프론티어 모델들과 비교해도 사람 평가 태스크에서 경쟁력 있는 성능을 보인다고 보고서는 밝혔다. 추론 속도, 메모리, 컴퓨팅 효율성도 설계 단계에서부터 개선했다.
GitHub 저장소 'system_prompts_leaks'에 Claude Fable 5·Opus 4.8·Claude Code·Claude Design, ChatGPT 5.5 Thinking·GPT 5.5 Instant·Codex, Gemini 3.5 Flash·3.1 Pro·Antigravity, Grok, Cursor, Copilot, VS Code, Perplexity 등 주요 AI 서비스의 시스템 프롬프트가 추출·공개됐다. 해당 저장소는 하루 만에 1,378개의 별을 새로 획득했으며 총 52,000개 이상의 스타를 보유하고 있다. 저장소는 정기적으로 업데이트된다고 명시되어 있어, 새로운 모델이 출시될 때마다 지속적으로 확장될 것으로 보인다. 이 유출은 각 모델이 어떤 지침 아래 동작하는지, 제품 간 차별화 전략이 어디서 나오는지를 가늠할 수 있는 직접적인 자료가 된다.
NVIDIA와 Hugging Face가 공동으로 오픈소스 로보틱스 플랫폼 LeRobot에 새로운 모델과 프레임워크를 추가했다. 오픈소스 AI가 공유된 모델·데이터·도구를 통해 개발 속도를 높인 것처럼, 물리적 AI 개발에서도 동일한 혁신이 가능하다는 것이 두 회사의 공동 비전이다. 현재 로보틱스 발전은 대규모 데이터셋, 로봇 파운데이션 모델, 시뮬레이션, 컴퓨팅, 검증 도구 등 비용이 많이 드는 자원에 가로막혀 있다는 점이 지적돼 왔다. 이번 협력으로 이러한 장벽을 낮추고 오픈 로보틱스 커뮤니티의 접근성을 높이는 것을 목표로 한다.
Towards AI에 게재된 실험 사례에 따르면, 단일 에이전트에 파일시스템·GitHub·Slack·브라우저·검색 등 여러 MCP 서버를 연결하자 도구 수가 20개를 넘는 순간부터 정확도가 급격히 무너지는 현상이 관찰됐다. 저자는 MCP 도구를 계속 쌓아 올리는 것이 에이전트를 더 강력하게 만들 것이라는 '직관적인' 가정이 실제로는 반대 결과를 낳는다고 경고한다. 이는 에이전트가 도구 목록이 길어질수록 어느 도구를 언제 써야 할지 판단하는 능력이 저하되는 컨텍스트 과부하 문제로 해석된다. 이 실험 결과는 에이전트 설계 시 도구 수를 제한하거나 동적으로 도구를 선별해 제공하는 전략이 필요함을 시사한다.
Martin Alderson의 분석 글에 따르면 GLM 5.2의 등장이 AI 업계의 마진 구조를 근본적으로 뒤흔들 수 있다는 주장이 제기됐다. HN에서 421점을 받으며 높은 관심을 끈 이 글은 프리미엄 LLM 서비스가 지금까지 누려온 가격 프리미엄이 유지되기 어려운 시대가 도래하고 있음을 논한다. GLM 5.2처럼 경쟁력 있는 성능을 제공하는 모델들이 저렴한 가격 또는 오픈소스로 공개되면서, 기존 대형 AI 기업들이 인프라 비용을 감당하면서도 수익을 내기가 점점 어려워지는 구조적 압박이 가해지고 있다는 분석이다.
NVIDIA가 ICML 2026 채택 논문 동향을 분석한 블로그를 공개했다. 올해 채택 논문들에서 공통적으로 드러나는 방향은 오픈 프론티어 모델과 오픈 AI 인프라가 현대 AI 과학의 기반으로 자리잡았다는 점이다. NVIDIA는 이번 ICML에서 74편의 논문을 채택받았으며, 그 중 상당수가 오픈 모델을 활용한 연구라고 밝혔다. 이는 폐쇄적 독점 모델 중심에서 공개 모델 기반 연구로의 패러다임 전환이 학계에서도 뚜렷하게 나타나고 있음을 보여준다.
kapa.ai 블로그에서 RAG 파이프라인의 컨텍스트를 실제 답변 생성에 필요한 부분만 남기도록 가지치기(pruning)하는 기법을 상세히 소개했다. 불필요한 컨텍스트를 포함하면 LLM의 답변 품질이 저하되고 레이턴시·비용이 증가하는 문제가 있는데, 이를 해결하기 위해 답변에 실제로 기여하는 청크만 선별하는 접근법을 설명한다. HN에서 103점을 받으며 실무 개발자들의 높은 관심을 끌었다. 구체적인 구현 방법과 성능 개선 사례를 함께 제공해 RAG 시스템 최적화에 바로 적용 가능한 실용적인 내용을 담고 있다.
ArXiv에 공개된 Oyster-II 논문은 기존의 '거절 지향(refusal-oriented)' 안전 정렬의 한계를 강화학습으로 극복하는 새로운 접근법을 제안한다. 기존 방식은 유해 콘텐츠를 막는 데는 효과적이지만, 정당한 사용자 요구까지 차단해 실용성을 떨어뜨리는 문제가 있었다. Oyster-I에서 제안한 '건설적 안전(constructive safety)' 패러다임을 계승하면서, Oyster-II는 SFT 기반 방식의 두 가지 한계—분포 외 시나리오에서의 일반화 부족, 안전 CoT의 무해한 쿼리로의 과잉 적용—를 RL 기반 Zero-RL 패러다임으로 해결한다. 이 접근법은 모델이 단순히 거절하는 대신 민감한 쿼리의 근본 의도를 파악해 안전하고 유익한 방식으로 응답하도록 훈련시킨다.
ArXiv에 공개된 SwarmResearch 논문은 단일 장기 실행 에이전트가 단일 고수준 접근법에 수렴해버리는 문제를 해결하기 위해 군집(swarm) 기반 오케스트레이터-서브에이전트 구조를 제안한다. Shepherd Agent가 글로벌 컨텍스트를 기반으로 각자의 git 브랜치에서 로컬 컨텍스트로 동작하는 Search Agent 집단을 조율하는 방식이다. 15개 개방형 최적화 태스크 중 13개에서 최신 LLM 기반 진화 기법 및 멀티에이전트 기법보다 우수하거나 동등한 성능을 달성했다. 고정 병렬 스케일링 대비 오케스트레이터 주도 동적 스케일링이 더 나은 탐색 깊이를 보여줬다는 점도 주목할 만하다.
ArXiv에 공개된 VERITAS는 AI 도구가 과학 출판을 가속화하는 반면 검증 시스템은 따라가지 못하는 현실 문제를 해결하기 위해 고안된 도메인 무관(domain-agnostic) 자동 복제 프레임워크다. 논문과 코드 저장소를 입력받아 논문의 주장을 자동 추출하고, 방법론을 실행하며 발생하는 이슈를 해결한 뒤 각 주장에 대해 증거 기반 판정을 내린다. 결과물로 중요도 가중 복제 점수, 수정 로그, 패치된 코드베이스를 제공한다. CS·사회과학·의학·천체물리학에 걸친 65편의 논문으로 평가한 결과, 같은 모델과 환경에서 실행한 Claude Code 베이스라인보다 우수한 성능을 보였다.
HN에서 421점을 받으며 가장 뜨거운 반응을 얻은 글로, GLM 5.2 같은 경쟁력 있는 저비용 모델의 등장이 AI 서비스 마진 구조를 무너뜨릴 것이라는 분석이다. 댓글에서는 인프라 비용 구조, 오픈소스 대비 클로즈드 모델의 생존 전략, 실제 API 가격 비교 등이 활발히 토론됐다.
HN에서 333점을 받은 AMD의 Ryzen AI Halo 기반 AI 개발 키트 상세 분석 글이다. 로컬 AI 추론을 위한 고성능 NPU와 CPU를 결합한 이 4,000달러짜리 디바이스의 실제 AI 워크로드 성능과 개발자 경험을 다룬다. 로컬 LLM 실행 및 엣지 AI 개발 환경에 관심 있는 개발자들의 댓글이 집중됐다.
HN에서 221점을 받은 프로젝트로, 단 7MB 용량의 임베딩 모델을 WebAssembly로 브라우저에서 직접 실행할 수 있는 데모다. 서버 없이 클라이언트 사이드에서 완전히 동작하는 시맨틱 검색·임베딩 기능 구현이 가능해 프라이버시와 레이턴시 측면에서 주목받고 있다.
HN에서 182점을 받은 오픈소스 프로젝트로, AI 에이전트가 .docx, .xlsx 등 MS Office 파일을 직접 읽고 편집할 수 있게 해주는 CLI 오피스 스위트다. LLM 에이전트에 파일 조작 능력을 부여해 문서 자동화 워크플로우 구축에 활용 가능하며, 에이전트 도구 통합 사례로 주목받았다.
AI 에이전트에 MCP 도구를 계속 추가하면 할수록 오히려 정확도가 떨어진다는 실험 결과가 Towards AI에 공개돼 개발자들 사이에서 화제다. 특히 20개 이상에서 성능 급락이 관찰됐으며, 이는 컨텍스트 윈도우 과부하와 도구 선택 혼란에서 비롯된 것으로 분석된다.
vLLM의 핵심 기술인 PagedAttention이 GPU VRAM 단편화를 어떻게 해결하는지 설명한 DEV.to 글로, 18개의 댓글이 달리며 활발한 토론이 이어졌다. 운영체제의 페이징 메모리 관리에서 영감을 받은 이 기법이 LLM 추론 시 배치 처리 효율을 어떻게 높이는지 기초부터 설명해 입문자에게도 유용하다는 반응이다.
AI 시스템 모니터링에서 기존 옵저버빌리티 도구가 왜 LLM 관찰에 적합하지 않은지, 각 레이어별로 어떤 설계가 필요한지를 다룬 DEV.to 글이다. LLM 특유의 비결정론적 출력과 긴 추론 체인을 추적하는 방법에 대한 실용적 논의가 8개의 댓글로 이어졌다.
구글 AI 공식 DEV.to 계정에서 Gemma 모델을 로컬 환경에서 파인튜닝하는 'gemma-trainer' 도구 사용법을 소개했다. 클라우드 없이 로컬 GPU에서 Gemma를 직접 파인튜닝하는 전체 워크플로우를 단계별로 안내해, 데이터 프라이버시가 중요한 프로젝트에서 활용하기 좋다.
Claude Code, Cursor, Gemini CLI 등 여러 AI 코딩 에이전트 환경에서 프롬프트를 각각 따로 작성하는 번거로움을 해결하기 위해, 프롬프트를 한 번 작성하고 각 환경에 맞게 컴파일하는 방법을 소개한 글이다. 멀티 에이전트 도구를 병행 사용하는 개발자들의 공감을 사며 화제가 됐다.
IEEE Spectrum이 네트워크 연결이 불안정한 환경에서 소형 언어 모델(SLM)이 제약 산업 등 전문 분야에서 실질적인 가치를 발휘하고 있음을 보도했다. HN에서 143점을 받으며, 초거대 클라우드 AI 대신 엣지·오프라인 환경에 최적화된 소형 모델의 실용성에 대한 토론이 이어졌다.
Claude, GPT-5.5, Gemini, Grok, Cursor, Copilot 등 주요 AI 서비스의 시스템 프롬프트를 추출·정리한 저장소. 각 제품이 어떤 지침으로 동작하는지 직접 확인하고 비교할 수 있어 프롬프트 엔지니어링 연구에 활용 가능하며, 정기적으로 업데이트된다.
+1,378
100% 로컬 처리 방식의 프라이버시 우선 AI 회의 어시스턴트. Parakeet/Whisper 기반 실시간 전사(4배 속도), 화자 분리, Ollama 기반 요약을 Rust로 구현했으며, macOS와 Windows를 지원한다. 클라우드 연결 없이 완전히 로컬에서 실행되는 셀프호스팅 오픈소스 회의록 도구다.
+2,494
AI 코딩 에이전트에 '취향'을 부여하는 스킬 도구. 지루하고 일반적인 코드 생성을 방지하고 더 독창적이고 질 높은 출력을 유도하도록 설계됐다. Claude Code, Cursor 등 주요 코딩 에이전트에서 사용 가능하다.
+1,458
AI 코딩 에이전트를 위한 프로덕션급 엔지니어링 스킬 모음. 실제 소프트웨어 개발 현장에서 바로 사용할 수 있는 수준의 에이전트 스킬들을 제공하며, 구글 Chrome 팀 엔지니어링 리드 Addy Osmani가 관리한다.
+1,112
Claude Code에서 OpenAI Codex를 호출해 코드 리뷰나 태스크 위임이 가능하게 해주는 공식 플러그인. 두 AI 코딩 에이전트를 연동해 각자의 강점을 함께 활용할 수 있는 공식 통합 도구다.
+906
터미널에서 동작하는 에이전트 멀티플렉서. 여러 AI 에이전트를 터미널 내에서 동시에 관리하고 조율할 수 있는 Rust 기반 도구로, 멀티 에이전트 작업을 단일 인터페이스에서 처리할 수 있다.
+779
Claude Code, Codex, Gemini CLI, Cursor 등 8개 이상의 코딩 에이전트를 위한 345개 스킬 컬렉션. 30개 이상의 에이전트, 70개 이상의 커스텀 커맨드, 330개 이상의 스킬이 포함되며 엔지니어링·마케팅·법무·C레벨 자문 등 다양한 업무 영역을 커버한다.
+610
macOS 메뉴바에서 OpenAI Codex와 Claude Code의 사용량 통계를 로그인 없이 바로 확인할 수 있는 Swift 앱. AI 코딩 도구의 API 비용과 사용 현황을 실시간으로 모니터링하고 싶은 개발자에게 유용하다.
+598
특정 주제에 대해 Reddit, X, YouTube, HN, Polymarket, 웹 전반을 검색해 최근 30일간의 정보를 종합·요약해주는 AI 에이전트 스킬. 리서치 자동화와 트렌드 파악에 즉시 활용 가능하다.
+458
링크·노트·이미지를 저장하고 AI가 자동으로 태그를 붙여주는 셀프호스팅 북마크 앱. 전문 검색과 AI 기반 자동 분류를 지원하며, TypeScript로 구현된 오픈소스 개인 지식 관리 도구다.
+199
Gemma Team (구글)
구글 Gemma 팀이 4세대 오픈웨이트 모델 스위트 Gemma 4의 기술 보고서를 공개했다. 밀집 및 MoE 아키텍처를 아우르는 2.3B~31B 파라미터 범위를 제공하며, 12B 모델에는 인코더 없이 원시 오디오와 이미지 패치를 직접 처리하는 통합 아키텍처가 도입됐다. 씽킹 모드, 개선된 비전·오디오 인코더, 장문 컨텍스트 처리 효율화가 핵심 기여이며, STEM·멀티모달·장문 컨텍스트 벤치마크에서 더 큰 오픈 프론티어 모델과 경쟁하는 성능을 달성했다. 오픈웨이트 멀티모달 모델의 새 기준점을 제시한다는 점에서 중요하다.
Yuvraj Virk, Zack Edds, Chunqiu Steven Xia, Lingming Zhang
단일 장기 실행 에이전트가 하나의 고수준 접근법에 수렴하는 문제를 해결하기 위해, Shepherd Agent가 여러 Search Agent를 각자의 git 브랜치에서 조율하는 군집 오케스트레이터-서브에이전트 구조를 제안한다. 15개 개방형 최적화 태스크 중 13개에서 SOTA 대비 우수하거나 동등한 성능을 기록했으며, 오케스트레이터 주도 동적 스케일링이 고정 병렬 스케일링보다 더 높은 탐색 다양성을 제공함을 보였다. 자동화 연구 및 코드 최적화에서 에이전트 군집 설계의 효과를 실증적으로 검증한 첫 체계적 연구 중 하나다.
Jiyang Guan, Yong Xie, Jun Chen
거절 지향 안전 정렬의 두 가지 한계—분포 외 시나리오 일반화 부족, 안전 CoT의 무해한 쿼리로의 과잉 적용—를 RL 기반 Zero-RL 패러다임으로 해결하는 Oyster-II를 제안한다. 민감한 쿼리의 근본 의도를 파악해 안전하면서도 유익하게 응답하는 '건설적 안전' 패러다임을 SFT 대신 RL로 구현해 일반화 성능을 높였다. 안전성과 유용성의 균형이 AI 제품의 핵심 과제인 만큼, 과도한 거절 없이도 안전성을 유지하는 실용적 방법론으로 주목받는다.
Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett
LLM이 스스로 생성한 응답을 다시 검증할 때 유효하지 않다고 판단하는 '생성기-검증기 불일치(G-V gap)' 문제를 해결하기 위해, 발화 빈도를 보정한 새로운 G-V 일관성 공식화를 제안한다. 생성기가 유효한 문자열에 낮은 확률을 부여하는 이유가 그 문자열 자체의 사전 확률이 낮기 때문임을 지적하고, 빈도 보정 G-V 일관성(FCPA)을 훈련 목적함수로 도입했다. IFEval과 Human 평가에서 이전 방법 대비 Pearson 상관도 최대 +27pp 향상을 달성했으며, LLM의 내적 일관성 문제를 정량적으로 해결하는 접근법으로 의미가 있다.
Yiyang Li, Tianyi Ma, Zehong Wang
LLM 에이전트가 축적된 경험을 자유형 텍스트로 저장할 때 유지·검증·재사용이 어려워지는 문제를 해결하기 위해, 경험을 실행 가능한 Python 클래스 기반 객체 중심 환경 모델로 구조화하는 OCM을 제안한다. 객체 지식(환경 엔티티와 메커니즘)과 절차 지식(재사용 가능한 상호작용 패턴)의 두 코드베이스를 연결해 관리하며, 각 에피소드 후 자동으로 업데이트·검증한다. 여러 벤치마크에서 평균 순위 1위를 달성하고 유효하지 않은 행동 수를 줄여, 에이전트의 경험 기반 학습 품질을 높이는 새로운 방향을 제시한다.
Siran Zhao, Ruihui Hou, Ziyue Huai
기존 LLM 의료 계산 벤치마크가 단일 계산기·명시적 쿼리 중심으로 단순화되어 실제 임상 환경을 반영하지 못한다는 문제를 지적하며, 단일·다중·중첩 계산기 설정을 포함한 MedCalc-Pro를 제안한다. 14개 임상과의 77개 의료 계산기를 아우르는 2,268개 실제 임상 사례를 포함하며, 다중 도구 선택과 중첩 도구 호출을 지원하는 에이전트 프레임워크도 함께 제시한다. 의료 AI의 실제 임상 적용 가능성을 검증하는 더 현실적인 기준을 제시한다는 점에서 중요하다.
Haokun Liu, Filbert Aurelian Tjiaranata, Chenhao Tan
AI 도구로 논문 출판이 가속화되는 반면 독립 검증은 더 어려워지는 현실에 대응해, 도메인에 무관하게 논문의 주장을 자동 추출·실행·판정하는 VERITAS 프레임워크를 제시한다. CS·사회과학·의학·천체물리학의 65편 논문으로 평가한 결과 Claude Code 베이스라인 대비 우수한 성능을 보였으며, 중요도 가중 복제 점수와 패치된 코드베이스를 결과물로 제공한다. 재현성 위기가 심화되는 시대에 AI 기반 자동 검증 인프라의 필요성을 실증적으로 보여준다.