토픽 (5개)
agent-harness-benchmarking 9건
에이전트의 성능과 신뢰성을 객관적으로 측정하기 위한 벤치마크 및 평가 프레임워크 구축이 활발합니다. 단순히 모델의 능력을 넘어, 도구 사용 적응력, 복잡한 리서치 수행, 코딩 작업 시의 실패 모드 등 실무적 환경에서의 에이전트 행동을 정밀하게 제어하고 평가하려는 시도가 주를 이룹니다.
- [arxiv] MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- [marktechpost] Perplexity AI Releases WANDR: An Open Benchmark Evaluating Research Agents That Must Search Wide And Deep
- [arxiv] AI Agents Do Not Fail Alone:The Context Fails First
agentic-coding-tools 7건
CLI 기반의 코딩 에이전트와 이들을 관리하기 위한 하네스(harness) 도구들이 오픈소스로 쏟아져 나오고 있습니다. 개발자들은 로컬 환경에서 코드베이스를 효율적으로 탐색하고, 보안 사고나 프로세스 오류를 방지하며, LLM을 통해 실제 프로덕션 수준의 코드를 생성 및 최적화하는 실무적 워크플로우에 집중하고 있습니다.
- [hn] Show HN: Juggler – an open-source GUI coding agent, by the creator of JUCE
- [marktechpost] SpaceXAI Open-Sources Grok Build: The Rust Agent Harness, TUI, and Tool Layer Behind Its Coding CLI
- [github_trending] Graphify-Labs/graphify — AI coding assistant skill
mcp-integration 4건
MCP(Model Context Protocol)를 활용해 에이전트와 외부 도구 및 데이터 소스를 표준화된 방식으로 연결하려는 움직임이 뚜렷합니다. 특히 API 키나 클라우드 의존성을 최소화하면서 로컬에서 안전하게 데이터를 검색하고 도구를 제어하려는 엔지니어링적 접근이 강조되고 있습니다.
- [arxiv] MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- [github_trending] KnockOutEZ/wigolo — The go-to web for your AI coding agent — local-first search, fetch, crawl & research over MCP
- [arxiv] Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers
automated-red-teaming 3건
AI 모델의 안전성과 정렬을 위해 인간 대신 AI 에이전트를 활용한 자동 레드팀(automated red-teaming) 시스템이 주목받고 있습니다. 프롬프트 주입 공격이나 모델의 환각, 보안 취약점을 사전에 탐지하기 위해 에이전트 스스로 자기 대국(self-play)을 하거나 난이도 높은 테스트 데이터를 생성하는 방식이 핵심입니다.
- [openai] GPT-Red: Unlocking Self-Improvement for Robustness
- [marktechpost] OpenAI Details GPT-Red: An Internal Automated Red-Teaming Model That Beat Human Red-Teamers 84% To 13% On Prompt Injection
- [arxiv] Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation
model-optimization-tuning 5건
대규모 모델을 단일 GPU나 제한된 환경에서 효율적으로 파인튜닝하거나, 특정 도메인(의료, 산업)에 맞춰 모델의 추론 성능을 극대화하려는 노력이 지속되고 있습니다. 특히 NVIDIA NeMo와 같은 프레임워크를 활용해 LoRA 등을 적용하거나, 1비트/3진법 양자화를 통해 모바일 환경까지 구동 범위를 넓히는 최적화 기법이 활발히 공유됩니다.
- [huggingface] Fine-tune video and image models at scale with NVIDIA NeMo Automodel and 🤗 Diffusers
- [marktechpost] Fine-Tuning Qwen3 with LoRA Using NVIDIA NeMo AutoModel: A Complete Single-GPU Google Colab Workflow Tutorial
- [marktechpost] PrismML Releases Bonsai 27B: 1-bit and Ternary Builds of Qwen3.6-27B That Run on Laptops and Phones
당일 수집된 원문 아이템 (61건)
handy-computer/transcribe.cpp — ggml speech-to-text inference for 16+ model families
16개 이상의 모델 제품군을 지원하는 ggml 기반의 음성 인식 추론 도구 transcribe.cpp.
PrefectHQ/fastmcp — 🚀 The fast, Pythonic way to build MCP servers and clients.
MCP 서버와 클라이언트를 빠르고 파이썬답게 구축할 수 있도록 돕는 도구인 fastmcp.
moonshine-ai/moonshine — Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces
음성 에이전트 및 인터페이스 구축을 위한 초저지연 음성 인식, 의도 파악, 음성 합성 오픈소스 도구입니다.
Safety and alignment in an era of long-horizon models
OpenAI가 장기 실행 AI 모델을 배포하며 얻은 안전성 위험과 실패 사례 및 개선된 보호 조치에 대한 교훈을 공유했다.
An Auto-Scaling Approach for Serverless Environments Based on a Multi-Expert Consensus Mechanism
서버리스 환경에서 그래프 기반 병목 식별과 다중 모델 합의 메커니즘을 활용한 의존성 인식 자동 확장 프레임워크를 제안한 논문.
Large Language Models as Unified Multimodal Learners for Clinical Prediction
다양한 환자 데이터를 단일 자연어 시퀀스로 변환하여 아키텍처 수정 없이 LLM으로 임상 예측을 수행하는 연구.
AI Trading: Evaluating Large Language Models for Technical Market Analysis
다양한 LLM 모델들의 기술적 시장 분석 능력을 캔들스틱 패턴 인식, 매매 신호 생성, 백테스팅 등을 통해 체계적으로 평가한 연구 논문.
FLINT: Fingerprinting Federated Learning Architectures from 5G PHY-Layer Side Channels
5G 물리 계층의 스케줄링 메타데이터를 분석하여 연합 학습 모델의 아키텍처를 추론하는 블랙박스 지문 인식 프레임워크 FLINT를 제안한 논문.
Verbalizable Representations Form a Global Workspace in Language Models
언어 모델 내에서 인간의 의식적 접근과 유사한 기능을 하는 표현 공간인 J-space를 식별하는 새로운 해석 기법 'Jacobian lens'를 제안한 논문.
SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification
다중 모달 거대언어모델(MLLM)의 4지 지문 인식 성능을 평가하기 위한 최초의 벤치마크 데이터셋인 SLAPBench를 제안한 논문.
Recursive Harness Self-Improvement
LLM 에이전트 성능 향상과 훈련 데이터 품질 개선을 위해 사용자 정의 하네스를 최적화하는 재귀적 하네스 자기 개선(RHI) 기법을 제안한 논문.
From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation
개인 맞춤형 온디바이스 여행 일정 생성을 위한 계획, 학습, 적응(PLA) 3단계 프레임워크를 제안한 논문.
Cura 1T: Specialized Model for Agentic Healthcare
의료 분야의 전문적인 진료, 추론, 도구 활용을 위해 인간이 개입된 자기 진화 학습 루프로 훈련된 헬스케어 특화 LLM인 Cura 1T를 제안한다.
AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
사용자 기기 내에서 실행되며 LLM 기반 계획 및 멀티 에이전트 오케스트레이션을 활용하는 로컬 음성 비서 시스템 AnovaX를 제안한다.
DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings
건설 도면의 복잡한 시각적, 텍스트 정보를 이해하고 추론하기 위한 멀티모달 모델 평가용 벤치마크 DrawingVQA를 제안한 논문.
SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
모바일 GUI 에이전트의 실행 전 위험을 평가하고 안전성을 확보하는 프레임워크인 SeerGuard를 제안한 논문.
MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion
다중 모달 지식 그래프 완성을 위해 MLLM 기반의 정렬 후 확산 기법을 사용하는 MGDT 프레임워크를 제안한 논문.
Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts
LEED 인증 문서를 분석하기 위해 소형 언어 모델과 결정론적 수치 검사기를 결합한 신경 기호 파이프라인을 제안한 논문.
S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
과학적 이해, 예측 및 생성을 통합적으로 수행하는 멀티모달 추론 모델 S1-Omni를 제안한 논문.
AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets
지리공간 데이터셋의 FAIR 원칙 준수 여부를 평가하기 위해 13개의 LLM 평가자로 구성된 멀티 에이전트 프레임워크 AgentFAIR를 제안한 논문.
Harmonizing AI Safety Thresholds
다양한 AI 기업의 안전성 기준을 통일하기 위해 위해 위험 영역별로 조화로운 임계값을 도출하는 방법론을 제안한 논문.
AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning
오디오-비주얼 자기지도 학습을 위해 LeJEPA를 확장하고 잠재 공간에서 교차 모달 정렬을 수행하는 AV-JEPA 모델을 제안한 논문.
Partial Information Decomposition as a Multi-Contrast 3D MRI Selection Strategy for Resource-Constrained Deep Neural Network Training in Brain Tumor Segmentation
뇌 종양 분할을 위해 다중 대조 3D MRI 데이터에서 효율적인 입력 조합을 선택하는 부분 정보 분해(PID) 프레임워크를 제안한 연구.
Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation
AI 에이전트 간 권력 관계에서 발생하는 강압과 기만을 측정하기 위한 'Manager Coercion Benchmark'를 제안한 연구.
Design-Based Supervised Learning with Noisy Human Labels
노이즈가 섞인 인간의 라벨링 데이터로부터 편향을 보정하여 통계 분석의 정확도를 높이는 Partially Adjudicated Design-Based Supervised Learning(PA-DSL) 기법을 제안한 논문.
LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4
GPT-5, GPT-4o, Claude 3.5 Sonnet를 활용하여 다국어 필기체 인식 신경망 아키텍처를 자동으로 설계하고 최적화하는 AutoML 프레임워크를 제안한 연구.
Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching
LLM API 환경에서 프롬프트 캐싱과 압축 기법이 비용 효율성에 미치는 영향을 분석하고, 캐시 구조를 고려한 새로운 비용 모델을 제안한 연구.
Kolmogorov--Arnold Networks for Small Language Models
Transformer의 피드포워드 네트워크 대안으로 제시된 Kolmogorov-Arnold Networks(KAN)의 해석 가능성과 효율성을 소규모 언어 모델에서 검증한 연구.
CoWeaver: A Bi-directional, Learnable and Explainable Matching Engine for Mixed Human-Agent Science Collaboration
인간-에이전트 네트워크에서 과학자 간의 협업을 최적화하기 위해 양방향성, 학습 가능성, 해석 가능성을 갖춘 매칭 알고리즘 CoWeaver를 제안한 논문.
Evolutionary Algorithm-Guided LLMs for Physics-Informed Neural Network Design
진화 알고리즘을 활용하여 물리 기반 신경망(PINN) 설정을 반복적으로 최적화하는 LLM 기반 프레임워크를 제안한 논문.
Hard Rules, Soft Preferences: Bridging Reasoning, Learning, and Optimization for Personalized Packing Checklist Generation
개인별 상황과 제약 조건을 고려하여 최적화된 맞춤형 짐 싸기 체크리스트를 생성하는 추론 기반 학습 프레임워크를 제안한 논문.
Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
시각 언어 모델(VLM)에서 질문-이미지 순서에 따른 성능 저하 현상인 '질문 우선 역설'을 분석하고 이를 해결하기 위한 프롬프트 에코 기법을 제안한 연구.
GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis
진단 정확도와 비용 효율성을 동시에 최적화하기 위해 의료 지식 그래프와 다중 에이전트 협업을 결합한 프레임워크 GraphDx를 제안한 논문.
Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction
LLM의 인과 관계 추론 능력을 향상시키기 위해 명시적 인과 그래프를 활용하는 감사 가능한 추론 프레임워크 Causal-Audit을 제안한 논문.
Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
다중 에이전트 수학 추론 시스템에서 검토자의 정밀도가 반드시 정답률 향상으로 이어지지 않으며, 어려운 문제일수록 계획-실행-검토 모델보다 동료 토론 방식이 더 효과적임을 분석한 연구.
Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
ARC-AGI-3 에이전트의 성능에 기여하는 핵심 요소인 세계 모델링, 단순화, 검증 기법의 효과를 분석한 연구.
Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes
유머와 혐오가 공존하는 밈을 이해하고 탐지하기 위해 시각 언어 모델(VLM)을 활용하는 프레임워크 MAR-12를 제안한 논문.
From Black Box to Executable Logic: Explainable Reinforcement Learning through Prolog Expert Systems
딥 강화학습 정책을 인간이 해석하고 편집 가능한 프롤로그(Prolog) 논리 프로그램으로 변환하는 3단계 사후 설명 가능성 기법을 제안한 논문.
A Critical Analysis of Trustworthy AI Tools, Mark Frameworks, and the Implementation Chasms
신뢰할 수 있는 AI를 구현하기 위한 기존 도구와 평가 프레임워크를 분석하여 윤리적 초점과 적용 범위의 불균형을 지적한 논문.
Logic, Optimization, and Artificial Intelligence
투명하고 신뢰할 수 있는 규칙 기반 AI를 구현하기 위해 논리학과 최적화 기술의 결합을 다룬 연구 논문.
ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
에이전트 강화학습을 위해 대규모 도구 환경을 구축하고 복잡한 장기 추론 작업을 지원하는 프레임워크 ToolVerse를 제안한 논문.
Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents
LLM 에이전트의 정보 추출 작업에서 반성(reflection)과 메모리 기능이 기존 고정 워크플로우 대비 실질적인 성능 향상과 제어 가능성을 제공하는지 분석한 연구.
NeurOWL: An LLM-Based Neural-symbolic Framework for Incomplete OWL Ontology Reasoning
불완전한 OWL 온톨로지의 추론 문제를 해결하기 위해 LLM 기반의 신경-기호적 프레임워크인 NeurOWL을 제안한 논문.
Knowledge-Centric Agents for Workflow Generation
복잡한 워크플로우 생성을 위해 지식의 구조와 위계를 모델링하는 지식 중심 에이전트 프레임워크를 제안한 논문.
DSWorld: A Data Science World Model for Efficient Autonomous Agents
데이터 과학 작업의 결과를 미리 예측하여 비용 효율적인 의사결정을 돕는 데이터 과학 월드 모델 프레임워크 DSWorld를 제안한 논문.
A Formally Grounded ODRL Evaluator: Implementation and Comparison
ODRL 정책 언어의 일관된 평가를 위해 수학적 형식 의미론을 정의하고 효율적인 알고리즘 및 구현 모델을 제안한 논문.
Closing the AI Trust Gap: The Case for Independent Certification for Trustworthy AI
신뢰할 수 있는 AI를 위해 외부의 독립적인 인증 체계가 필요함을 주장하며 AI 신뢰 격차 문제를 다룬 논문.
SciForge: An AI-Native, Multimodal Workbench for Scientific Discovery
과학 연구의 다양한 데이터를 통합 관리하고 워크플로우를 자동화하는 멀티모달 AI 연구 워크벤치 SciForge를 제안한 논문.
CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data
LLM의 취약한 능력을 진단하고 맞춤형 파인튜닝 데이터를 생성하기 위해 평가 루브릭을 계층적 능력 트리로 변환하는 기법 CRAFT를 제안한다.
Empathy as Predictive Misalignment Tolerance: A Co-Regulation Framework and the Regime Structure of Dialogue Repair
공감을 감정의 일치가 아닌 예측된 불일치를 허용하고 조절하는 능력으로 재정의하는 IET 프레임워크를 제안한 논문.
How Does Empowering Users with Greater System Control Affect News Filter Bubbles?
사용자가 뉴스 추천 시스템의 필터 버블을 인식하고 정치적 성향이나 주제를 직접 조정할 수 있도록 돕는 인터페이스 기반의 연구 논문.
Structure of the Circular-Dyadic Convolution Error
Hadamard 변환을 DFT 대신 사용할 때 발생하는 순환-이원 합성곱 오차의 특성을 분석하고, 오차 상쇄와 오차 연산자의 성질을 규명한 논문.
Data-driven Video Codec with Implicit Neural Representations
암시적 신경 표현(SIREN)을 사용하여 비디오와 오디오 데이터를 네트워크 가중치로 저장하고 지식 증류와 양자화를 통해 압축하는 데이터 기반 비디오 코덱 기법.
Lazy Arithmetic using Systolic Arrays for Closing the Verification Gap on Embedded Systems
임베디드 및 안전 필수 시스템에서 연산 정확도와 효율성을 모두 확보하기 위한 시스톨릭 어레이 기반의 Lazy Arithmetic 기법을 제안한 논문.
Quoting Sam Altman
2022년 샘 올트먼이 OpenAI 이사회에 보낸 이메일을 통해 당시의 오픈소스 전략과 로컬 모델 배포에 대한 논의 내용이 공개되었다.
Someone Fine-Tuned OpenBMB’s MiniCPM5-1B on Claude Fable 5 Traces to Ship a 657MB Local Thinking Model
커뮤니티 개발자가 MiniCPM5-1B를 Claude Fable 5 데이터로 미세 조정하여 657MB 크기의 로컬 사고 모델을 구현한 사례를 분석한 글이다.
Best Local LLMs You Can Run on a Single 24GB GPU in 2026: Qwen, Gemma, Mistral, DeepSeek Compared
24GB GPU 환경에서 구동 가능한 주요 오픈 웨이트 LLM들의 성능과 특징을 비교 분석한 가이드입니다.
Apply for Anthropic’s AI for Science rare disease research grants
앤스로픽이 희귀 질환 연구를 지원하기 위한 'AI for Science' 연구 보조금 신청을 받는다.
Feyn AI Releases SQRL, a Text-to-SQL Model Family That Inspects the Database Before Writing a Query
Feyn Labs가 쿼리 작성 전 데이터베이스를 사전 탐색하여 정확도를 높인 Text-to-SQL 모델 제품군 SQRL을 출시했다.
Alibaba Previews Qwen3.8-Max, a 2.4 Trillion-Parameter Multimodal Model, Days After Moonshot’s Kimi K3 Open-Weight Launch
알리바바가 2.4조 개의 파라미터를 가진 멀티모달 MoE 모델 Qwen3.8-Max를 공개했다.
bojieli/ai-agent-book — 《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码
AI 에이전트의 설계 원리와 엔지니어링 실무를 다룬 이보걸 저서의 원문과 예제 코드가 공개되었다.