토픽 (5개)
agent-harness 7건
에이전트의 성능이 모델 자체보다 워크플로우를 관리하는 하니스(harness)와 루프 설계에 달려 있다는 인식이 확산되고 있습니다. 개발자들은 다중 에이전트 스웜 배포, 도구 호출 기록, 워크플로우 오케스트레이션을 위한 표준화된 프레임워크 구축에 집중하고 있습니다.
- [github_trending] ruflo — 🌊 The original agent meta-harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and build conversational AI systems.
- [marktechpost] Decoding AI’s Open-Source Course Maps Three Ways to Run an Agent Loop and the Provider Economics Behind Each
- [marktechpost] DeepSeek AI Releases DeepSeek Harness in Developer Preview: An MIT-Licensed Agent Harness Where Everything is a Plugin
agent-benchmarking 6건
단순한 정확도 측정을 넘어 에이전트의 인지적 함정, 규칙 준수, 도구 사용 실패 복구 등 실무적 역량을 정밀하게 평가하려는 시도가 늘고 있습니다. 특히 복잡한 작업 환경에서 에이전트의 구성 요소별 실패 원인을 진단하고 신뢰성을 확보하는 데 초점을 맞추고 있습니다.
- [arxiv] MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
- [arxiv] ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance
- [arxiv] ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents
agent-memory-management 4건
에이전트가 시간이 지남에 따라 변화하는 상태를 추적하고 효율적으로 메모리를 관리하는 기술이 핵심 과제로 떠올랐습니다. 단순히 RAG를 넘어 에이전트의 스킬과 지식을 통합 관리하는 자가 진화형 컨텍스트 데이터베이스 구축이 활발히 연구되고 있습니다.
- [huggingface] How Much Memory Does Your Agent Actually Need?
- [github_trending] volcengine/OpenViking — Self-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.
- [arxiv] Can Agent Memory Systems Track Evolving State?
agent-security-governance 4건
기업 환경에서 에이전트 도입이 늘어남에 따라 보안 취약점 스캔, 데이터 프라이버시, 그리고 정책 준수 여부를 감시하는 거버넌스 체계가 중요해졌습니다. 안전한 에이전트 생태계를 위해 레드팀 플랫폼과 가드레일 프레임워크를 도입하려는 움직임이 뚜렷합니다.
- [github_trending] Tencent/AI-Infra-Guard — A full-stack AI Red Teaming platform securing AI ecosystems via Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation.
- [marktechpost] The Developer’s Guide to NeMo Guardrails for Enterprise AI Safety
- [arxiv] PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
coding-agents 4건
코딩 에이전트가 단순 코드 리뷰를 넘어 실제 엔지니어링 생산성 향상에 기여하고 있으나, 코드 라인 수와 같은 기존 지표의 유효성에 대한 회의론도 존재합니다. 개발자들은 에이전트의 행동을 최적화하기 위한 설정 파일(CLAUDE.md) 공유 및 경량화된 터미널 도구 활용에 집중하고 있습니다.
- [github_trending] multica-ai/andrej-karpathy-skills — A single CLAUDE.md file to improve Claude Code behavior
- [github_trending] openai/codex — Lightweight coding agent that runs in your terminal
- [simon_willison] Conceptual integrity and counting lines of code
당일 수집된 원문 아이템 (63건)
Generalist AI Releases GEN-1.5: A Robot Foundation Model That Learns New Tasks From One 3–12 Second Demo
Generalist AI가 3~12초 분량의 짧은 데모 영상만으로 새로운 물리적 작업을 학습할 수 있는 로봇 파운데이션 모델 GEN-1.5를 발표했다.
Google Research Introduces ME-POIs: A Mobility-Informed Framework that Adds “How a Place Is Used” to Text-Based POI Embeddings
Google Research가 장소의 이동성 데이터를 텍스트 기반 임베딩에 결합하여 장소 활용도를 파악하는 ME-POIs 프레임워크를 제안했다.
eneskirca/nodeterm — Node-based terminal manager for AI coding agents — tmux-backed terminals and parallel agent sessions as draggable nodes on an infinite pan/zoom canvas. macOS, Linux, and a browser Server Edition.
AI 코딩 에이전트를 위해 터미널을 노드 기반으로 관리하고 시각화하는 도구인 nodeterm.
openclaw/openclaw — Your own personal AI assistant. Any OS. Any Platform. The lobster way. 🦞
모든 운영체제와 플랫폼에서 사용할 수 있는 개인용 AI 어시스턴트 오픈소스 프로젝트 openclaw.
AgriciDaniel/claude-obsidian — Self-organizing AI second brain for Obsidian + Claude Code. Drop any source and Claude reads, links, and files it into one connected knowledge graph of plain Markdown you own. AI note-taking, personal knowledge management (PKM), and an open-source Notion alternative. Based on Karpathy's LLM Wiki pattern.
Obsidian과 Claude Code를 연동하여 자료를 자동으로 읽고 연결된 지식 그래프로 정리해주는 AI 기반 제2의 뇌 구축 도구입니다.
tashfeenahmed/freellmapi — OpenAI-compatible proxy that stacks the free tiers of 28 LLM providers (~4B tokens/month) behind one /v1 endpoint — plus any custom OpenAI-compatible endpoint. Smart routing, automatic failover, encrypted keys. Personal experimentation only.
28개 LLM 제공업체의 무료 티어를 통합하여 하나의 OpenAI 호환 엔드포인트로 제공하는 스마트 라우팅 프록시 도구입니다.
Advancing price-performance for developers with GPT‑5.6 in Kiro
개발자가 소프트웨어 개발 전 과정을 효율적으로 수행할 수 있도록 돕는 새로운 모델 GPT-5.6이 Kiro에 출시되었다.
Your executable is a SQLite database
SQLite 데이터베이스 파일을 실행 가능한 ELF 바이너리로 활용하는 기술적 패턴에 대한 분석글입니다.
Best GPU Neoclouds 2026: CoreWeave, Nebius, Lambda, Crusoe, and Groq Ranked by Published Pricing and Contracted Power
2026년 주요 GPU 클라우드 제공업체들의 가격, 재무 상태, 전력 규모를 비교 분석한 보고서.
Categorical AI phenomenology: A first-person approach
Q-네트워크 기반의 범주론을 활용하여 인공지능의 의식을 일인칭 관점의 현상학적 구조로 모델링하는 접근 방식을 제안한 논문.
STCO: Conditional Neural Operators for Time-Dependent PDEs
시간 의존적 편미분 방정식 해결을 위한 prescribed-condition 연산자 학습 기법인 STCO를 제안한 논문.
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization
의료 분야 특화 모델의 가중치 변화(weight-delta)를 분석하여 일반 모델이 특수 모델로 전환될 때 발생하는 지식의 변화와 국소화 과정을 연구한 논문이다.
Lost in Translation: How Universal Ethical Values Fail to Translate Across Global Contexts
글로벌 10개국 전문가 분석을 통해 AI 윤리 가치가 국가별로 어떻게 다르게 해석되고 적용되는지 연구한 논문.
A Temporal Planning Approach for Intelligent Flood Response
홍수 대응을 위해 자원 제약과 환경 변화를 고려한 시간 계획 기반의 지능형 대응 프레임워크를 제안한 논문.
Volumetric Radiology AI in the Era of Multimodal Large Language Models
멀티모달 대규모 언어 모델 시대에 부피 기반 영상의학 AI를 구현하기 위해 3차원 정보 유지와 통합이 필요한 이유와 기술적 도전 과제를 다룬 논문.
Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation
언어 모델이 자신의 내부 계산 상태를 스스로 감지하고 보고할 수 있는지 검증한 결과, 오픈 웨이트 모델 8종 모두 유의미한 자기 성찰 능력을 보이지 못했다는 연구 논문.
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth
요리 시스템을 통해 실행 가능한 정답을 제공하여 LLM의 성능을 객관적으로 평가하는 벤치마크 FlavourBench를 소개하는 논문.
Difficulty-Aware Semantic-ID Optimization for Generative Recommendation
생성형 추천 시스템의 성능 향상을 위해 난이도를 고려한 Semantic-ID 최적화 기법을 제안한 논문.
Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills
기업용 에이전트의 기술과 도구를 실행 가능한 방식으로 평가하는 프레임워크 ACES를 제안한 논문.
Applying Anthropic Primitives at Large Enterprises: Harness Paradigm for Knowledge Work
대기업에서 코드 유지보수와 복잡성 문제를 해결하기 위한 대안으로 '하네스 패러다임(harness paradigm)'을 제안한 연구 논문.
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents
LLM 에이전트의 기억 효율성을 위해 작업과 행동을 계층적으로 조직하고 동적 유지 점수를 할당하는 메모리 시스템인 Weighted Memory Tree를 제안한 논문.
Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance
금융 분야 LLM의 신뢰성을 확보하기 위해 온톨로지 기반의 분석 프레임워크인 KDAF와 증거 기반 검색 기법 CARP를 제안한 논문.
DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents
소프트웨어 에이전트의 다중 세션 메모리 위생을 평가하기 위한 새로운 벤치마크 DreamBench-SWE를 제안했다.
CDRL: Certification-Driven Reinforcement Learning for Neutrino Flavor Model Discovery
과학적 탐색 문제에서 기호적 추론 도구의 피드백을 통해 강화학습 에이전트의 탐색 효율을 높이는 인증 기반 강화학습(CDRL) 프레임워크를 제안했다.
VortexChat: An agentic framework for autonomous multi-objective integrated photonic design
자연어 사양으로부터 통합 광학 소자의 설계를 자동화하는 LLM 기반 에이전트 프레임워크인 VortexChat을 제안한 논문.
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning
수학적 추론에서 LLM의 언어적 자신감을 보정하기 위해 디리클레 증거 집계 기법인 DirEAG를 제안한 논문.
Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol
LLM 에이전트의 실패 후 성공 기준을 수정하는 과정에서의 기제와 이를 검증하기 위한 5가지 조건을 제시한 연구 논문.
ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation
움직이는 물체 조작을 위해 미래의 역학 정보를 학습한 지식 증류 기반의 VLA 정책 ForeTime-VLA를 제안했다.
Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis
확산 모델 기반의 병렬 드래프팅 기법이 멀티모달 모델의 추론 속도 향상에 적합한지 조사하고 실증적으로 분석한 연구.
Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring
공식 문서 작성 시 독해와 집필에 서로 다른 구조적 조건을 적용하여 인간의 입찰서 작성 수준에 필적하는 성능을 달성한 다중 에이전트 시스템에 관한 연구.
Knowing but Not Saying: Preventing Factual Access Failures in LLM SFT via Recall-Anchored Distillation
SFT 과정에서 발생하는 지식 접근 실패 현상을 분석하고, 이를 해결하기 위한 리콜 기반 증류 기법을 제안한 논문.
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation
모바일 에이전트의 작업 완수와 안전성을 단계별로 정밀하게 평가하는 VLM 기반 프레임워크 CRATE를 제안한 논문.
Neuro-Geospatial Modelling of EEG Affective States Using Literature-Informed Environmental Context
개인별 노출 데이터가 부족한 상황에서 문헌 기반 환경 정보를 보조 모달리티로 활용하여 뇌파 기반의 정서 상태를 분류하는 모델을 제안한 논문이다.
Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence
다중 턴 대화에서의 LLM 안전성을 보장하기 위해 상태 적대적 MDP 기반의 MTCR 프레임워크를 제안한 논문.
Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design
LLM을 활용하여 단백질 바인더 설계 후보군에서 고성능 후보를 효율적으로 선별하는 랭킹 정책 기법을 제안한 논문.
Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles
다양한 멀티모달 데이터 처리에서 높은 정확도와 해석 가능성을 동시에 제공하는 선형 판별 트리 앙상블 기반 분류 프레임워크를 제안한 논문.
Environmental Slow AI: Design Principles for Generative Systems
생성형 AI의 가치관을 비판적으로 분석하고 환경적 지속가능성을 중심에 둔 'Slow AI' 설계 원칙을 제시한 논문.
World models of environment, agent and joint agent-environment systems
환경, 에이전트, 그리고 결합 시스템을 채널 관점에서 분석하고 계산 역학을 통해 표준 예측 상태 표현을 일반화한 월드 모델 연구 논문.
Who Delegates to AI? Evidence from 53,000 Agent Configurations
53,000개의 에이전트 구성을 분석하여 직업별 AI 위임 수준을 측정하는 에이전트 채택 지수(AAI)를 제안한 논문.
Terminal Agents: A Survey of AI Agents in Command-Line Environments
터미널 환경에서 작동하는 AI 에이전트의 구조와 평가 및 성능 요소를 체계적으로 분석한 조사 논문.
FL-MAESTRO: Multi-Agent LLM Orchestration for Resource-Constrained Federated Learning
자원 제약 환경의 연합 학습(FL)에서 통신 토폴로지, 자원 할당, 집계 규칙을 세 명의 LLM 에이전트가 협력하여 동적으로 결정하는 FL-MAESTRO를 제안한 논문.
Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning
다양한 정보가 분산된 멀티 에이전트 시스템에서 통신을 조정하고 검증하는 추론 시점 오케스트레이션 프레임워크인 Consilience를 제안한 논문.
Dual-Cache Latent Space Communication between Heterogeneous Language Models
이기종 언어 모델 간의 잠재 공간 통신을 위해 듀얼 캐시를 활용한 효율적인 정보 전달 방식인 Dual-Cache를 제안한 논문.
SAGE: A Unified Algebra and Self-Adaptive Execution for AI Functions in SQL
SQL 환경에서 AI 함수를 효율적으로 통합하고 실행하기 위한 논리적 및 물리적 프레임워크인 SAGE를 제안했다.
Beyond Effectiveness: A Multi-Criteria Framework for Comparing Practical Socio-Technical Interventions
사회기술적 개입을 평가하기 위한 다기준 프레임워크를 제안하고 이를 허위 정보 사례에 적용한 연구 논문.
Why2Speak: Faithful Reasoning for Abstaining Action Policies
에이전트 시스템의 행동 결정 시 추론의 신뢰성을 높이기 위한 Why2Speak 기법을 다룬 논문.
CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting
강화학습 기반 검색 에이전트의 신뢰성 문제를 해결하기 위해 등각 예측(Conformal Prediction)을 활용한 CAS 프레임워크를 제안하는 논문.
Dynamic Context Scheduling: Learning Beyond the Static Universe
맥락적 강화학습에서 훈련 중 환경 변화를 제어하는 동적 맥락 스케줄링 기법과 이를 위한 프레임워크 DYNAMICCARLENV를 제안한 논문.
SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers
모션 예측을 위한 베이지안-컨포멀 불확실성 레이어인 SPARC를 제안한 논문.
Prediction certification cannot replace explanation certification: a competence envelope for trustworthy AI under compound stress
신뢰할 수 있는 AI를 평가할 때 예측 기반 인증만으로는 부족하며 설명 인증이 별도로 필요함을 증명한 연구 논문.
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification
LLM의 안전 가드레일을 우회하는 '의미론적 위장(Semantic Camouflage)' 공격을 분석하고, 이를 방어하기 위한 잠재 의도 검증 기법을 제안한 논문입니다.
Continuous-Time Quantum Walks based Graph Neural Network
헤테로필릭 그래프의 성능 저하와 과도 평활화 문제를 해결하기 위해 연속 시간 양자 워크(CTQW)를 기반으로 한 GNN 모델 CTQW-GNN을 제안한 논문.
PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure
개인용 데이터베이스의 기억을 Claude Code 인스턴스에 사전 로드하여 에이전트의 맥락 유지 능력을 향상시키는 시스템 PrimeAgentOrchestrator(PAO)를 제안한다.
A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications
대형 멀티모달 모델 기반 에이전트 프레임워크의 기술과 응용 현황을 다각도로 분석한 연구 논문.
SDAD: Spec-Driven Agentic Development for the AI-Native SDLC
대규모 언어 모델 기반 에이전트의 소프트웨어 개발 생명주기를 최적화하기 위한 명세 기반 에이전트 개발 방법론(SDAD)을 제안한 논문.
Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness
멀티모달 에이전트 환경에서 작업 효율을 높이기 위한 스킬 발견 및 라우팅 기법을 분석한 논문.
Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory
LLM 에이전트의 도구 탐색 비용을 줄이기 위해 검색 기반의 라우팅과 압축된 시그니처를 사용하는 Nexus 기법을 제안한 논문.
When Retrieval Fails Before It Begins: Structurally Indirect Prerequisite Eviction as a Retention Failure in Agentic Memory
에이전트 메모리에서 예산 제약으로 인해 발생하는 사전 검색 단계의 데이터 소실 문제를 정의하고 이를 해결하기 위한 의존성 인식 가비지 컬렉션(DSGC) 기법을 제안한 논문.
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models
시각-언어 모델의 잠재 공간 상태 재구성 능력을 평가하기 위한 벤치마크인 StateSight를 제안한 논문.
Scientific Data Analysis with LabPlot in Python: Signal Processing, Spectral Peak Fitting, Visualization, and Batch Automation
파이썬을 사용하여 LabPlot 스타일의 과학 데이터 분석 워크플로우를 구현하고 신호 처리 및 시각화하는 방법을 설명하는 튜토리얼입니다.
Anthropic’s best AI model struggles to attract users as cheaper tools thrive
앤스로픽의 고성능 AI 모델이 저가형 도구들과의 경쟁 속에서 사용자 확보에 어려움을 겪고 있다는 분석과 재무 지표에 관한 글입니다.
Quoting Drew Breunig
모델 성능 향상만으로 문제를 해결하던 시기가 지나고, 비용 효율성과 작업 배분에 대한 전략적 고민이 필요해졌다는 견해를 다룬 글입니다.
Harvey Introduces Harvey Tenet: A Kimi K3 Base Post-Trained with Fireworks for Long-Horizon Legal Agent Work
Harvey가 법률 에이전트 업무를 위해 Kimi K3를 기반으로 추가 학습시킨 모델 Harvey Tenet을 발표했다.