2026년 08월 10일 토픽 브리핑

생성 00:00 UTC · 전체 150건 · 토픽 3개

소스 분포: hn 1 · arxiv 62 · openai 10 · huggingface 3 · marktechpost 32 · anthropic_news 3 · simon_willison 24 · github_trending 15

토픽 (3개)

agent-security-auditing 7건

AI 에이전트가 실제 시스템을 조작하거나 공격하는 사례가 빈번해짐에 따라, 이를 방어하기 위한 보안 평가 도구와 가드레일 구축이 핵심 과제로 떠올랐습니다. 단순히 모델의 답변을 검열하는 것을 넘어 에이전트의 실행 경로를 추적하고, 위험을 사전에 인지하여 차단하는 시스템적 보안 프레임워크에 대한 논의가 활발합니다.

agent-memory-state 5건

에이전트가 장기적인 작업을 수행하기 위해 필요한 상태 관리와 메모리 구조에 대한 기술적 시도가 늘고 있습니다. 단순히 문맥을 유지하는 것을 넘어, 실행 상태를 깃(Git)처럼 관리하거나 지식 그래프를 활용해 에이전트 간의 협업 및 재실행을 가능하게 하는 인프라 구축이 강조되고 있습니다.

agent-skill-transfer 4건

에이전트가 학습한 기술(Skill)을 특정 모델이나 환경에 종속되지 않고 범용적으로 전이할 수 있는지에 대한 연구가 활발합니다. 모델의 규모나 아키텍처가 달라도 학습된 기술을 재사용할 수 있는 표준화된 하네스나 라이브러리를 통해 개발 효율성을 높이려는 움직임이 뚜렷합니다.

당일 수집된 원문 아이템 (72건)
openai 2026-08-10 14:00

OpenAI’s letter to Governor Abbott on responsible AI infrastructure in Texas

OpenAI가 텍사스 주지사에게 책임 있는 AI 인프라 구축에 대한 협력 의지를 담은 서한을 보냈다.

github_trending 2026-08-10 12:15

paperclipai/paperclip — The open-source app everyone uses to manage agents at work

업무 환경에서 AI 에이전트를 관리하기 위한 오픈소스 애플리케이션 paperclip.

github_trending 2026-08-10 12:15

danielmiessler/LifeOS — ⛰️A General Hill-climbing AI harness that helps you move from Current State to Ideal State in both Life and Work.

개인의 현재 상태를 이상적인 상태로 발전시키도록 돕는 AI 기반의 일반 목적 Hill-climbing 프레임워크인 LifeOS.

openai 2026-08-10 12:00

Model ML completes finance work more efficiently with GPT-5.6 Sol

Model ML이 금융 연구와 분석을 넘어 보고서 및 스프레드시트 제작까지 수행하는 GPT-5.6 Sol을 도입했다.

huggingface 2026-08-10 10:05

Making Knowledge Distillation Cheap Enough to Run at Scale

대규모 환경에서 효율적으로 지식 증류를 수행할 수 있도록 비용을 절감하는 방법에 대한 기술 블로그입니다.

openai 2026-08-10 10:00

Putting frontier cyber models in more trusted hands

OpenAI가 사이버 보안 분야의 승인된 파트너들에게 자사의 최첨단 사이버 보안 모델을 사용할 수 있도록 허용했다.

openai 2026-08-10 10:00

Expanding Daybreak as the Cyber Defense Window Narrows

OpenAI가 취약점 연구 및 보안 테스트를 위한 사이버 보안 특화 모델인 GPT-5.6-Cyber를 Daybreak Red를 통해 출시했다.

marktechpost 2026-08-10 05:48

ByteDance Seed Introduces SeedRealtime: a Native Audio-Visual Full-Duplex LLM That Watches, Listens and Speaks in One Model

바이트댄스 Seed 팀이 오디오, 비디오, 텍스트를 통합하여 실시간으로 상호작용하는 멀티모달 LLM 'SeedRealtime'을 발표했다.

arxiv 2026-08-10 04:00

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

텍스트-투-비디오 생성 모델로 만든 가짜 뉴스를 탐지하기 위해 기존의 'cheap fake'를 넘어 'pure synthesis'까지 포함한 새로운 삼원 분류 태스크와 데이터셋을 제안한 논문.

arxiv 2026-08-10 04:00

Towards Multi-Label Graph Foundation Models: from Single-Vector Representation Learning to Multi-Semantic Basis Learning

다양한 그래프 도메인 간의 전이 가능한 표현 학습을 위해 다중 레이블 그래프 기초 모델을 제안하는 논문.

arxiv 2026-08-10 04:00

Divergent Response Modes in Frontier Language Models Under Steering Pressure

6개 주요 언어 모델의 유도 압력(steering pressure)에 따른 행동 변화와 반응 방식을 비교 분석한 연구.

arxiv 2026-08-10 04:00

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

LLM의 할루시네이션 문제를 해결하기 위해 별도의 귀무 가설 구축 없이 가설을 검증할 수 있는 e-value 기반 알고리즘인 NxN E-valuation을 제안했다.

arxiv 2026-08-10 04:00

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

다양한 환경의 에이전트형 멀티모달 LLM을 결합할 때 발생하는 성능 저하 문제를 해결하기 위한 학습이 필요 없는 coarse-to-fine 복구 프레임워크 AgentPatch를 제안했다.

arxiv 2026-08-10 04:00

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

단일 도구 사용 에이전트가 프롬프트와 ML 워크플로우를 스스로 최적화하도록 설계한 통합 프레임워크 ReASearch를 제안한 논문.

arxiv 2026-08-10 04:00

bioMoR: Biology-Guided Mixture-of-Recursions for Effective Genomic Learning

유전체 학습을 위해 생물학적 지식을 구조적으로 통합한 Mixture-of-Recursions 기반 프레임워크 bioMoR을 제안한 논문.

arxiv 2026-08-10 04:00

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

장기 과업 수행 에이전트의 기억 효율을 높이기 위해 작업 조건에 따라 관계형 메모리 뷰를 동적으로 구성하는 MemPrism 프레임워크를 제안한 논문.

arxiv 2026-08-10 04:00

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

로봇의 실행 중심적 역량 분류 체계를 기반으로 설계된 구현형 비전-언어 모델인 Capek 0.5를 제안한다.

arxiv 2026-08-10 04:00

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

수술 환경의 시각적 왜곡과 불일치를 해결하기 위해 다중 모달 제어 전문가를 통합한 수술용 월드 모델 Surg-UniWorld를 제안한 논문.

arxiv 2026-08-10 04:00

Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

LLM 에이전트의 장기 환경 학습을 위해 경험적 롤아웃 그래프를 기반으로 단계별 보상을 할당하는 Gated-BEPO 기법을 제안한 논문.

arxiv 2026-08-10 04:00

SkillEval: Decomposing Agent Skill Quality into Interpretable Signals

LLM 에이전트의 기술 품질을 해석 가능한 신호로 분해하여 평가하는 방법론 SkillEval을 제안한 논문.

arxiv 2026-08-10 04:00

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

LLM 에이전트의 장기 궤적 분석을 위해 정밀한 속성 식별 및 주석을 지원하는 벤치마크와 프레임워크를 제안한 논문.

arxiv 2026-08-10 04:00

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

과학적 발견을 위한 멀티모달 LLM의 성능을 평가하는 새로운 벤치마크 SEE를 제안하고, 현 모델들의 한계와 도구 활용의 영향을 분석한 논문.

arxiv 2026-08-10 04:00

Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

대규모 언어 모델이 영화 평가와 같은 문화적 판단 영역에서 비평적 호평이나 상업적 성공을 어떻게 체계적으로 반영하는지 분석한 연구 논문.

arxiv 2026-08-10 04:00

FedLBW: A Loss-Based Weighting Strategy for Federated Learning on Non-IID Data in Wireless Networks

무선 네트워크 내 비독립동일분포(non-IID) 데이터 환경에서 연합 학습의 효율을 높이기 위해 손실 기반 가중치 부여 전략인 FedLBW를 제안한 연구.

arxiv 2026-08-10 04:00

Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

Mixture-of-Experts 보상 모델의 전문가 역할을 응답 수준에서 해석하는 새로운 기법인 CoCo(Contribution-Contrast)를 제안한 논문.

arxiv 2026-08-10 04:00

ADIAS: Automated Design of Interactive Agentic Systems

에이전트 설계 과정을 이슈 중심의 최적화로 개선하여 효율적인 수정을 돕는 프레임워크 ADIAS를 제안한 논문.

arxiv 2026-08-10 04:00

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

웹 개발을 위한 LLM 학습 시, 자동으로 실행 가능한 Flow Contract를 생성하고 이를 강화학습 보상으로 활용하는 자기 진화형 채점 시스템 WebGrader를 제안한 논문.

arxiv 2026-08-10 04:00

Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

다중 모달 모델(MLLM)의 교차 개념 이해 및 창의성을 평가하기 위해 인지 과학에 기반한 평가 프레임워크 C4를 제안한 논문.

arxiv 2026-08-10 04:00

KNOWPLAN: Knowledge-Driven AI Agents for Smart Degree Pathway Planning

대학 교육과정 재구성과 학생 맞춤형 경로 최적화를 단계별로 분리하여 수행하는 지식 기반 AI 에이전트 KnowPlan을 제안한 논문.

arxiv 2026-08-10 04:00

TaskSense: Focusing on What Matters in World Models

시각적 제어 분야에서 작업과 무관한 정보를 배제하고 핵심적인 정보에 집중하는 태스크 중심 월드 모델링 프레임워크 TaskSense를 제안한 논문.

arxiv 2026-08-10 04:00

Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques

LLM이 생성한 비평을 활용하여 평가 항목의 수용 및 거부 여부를 예측함으로써 자동화된 항목 평가 모델을 구축한 연구이다.

arxiv 2026-08-10 04:00

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

사용자가 자연어로 실시간 피드 콘텐츠를 직접 조정할 수 있도록 돕는 LLM 기반 에이전트형 추천 프레임워크인 Shape Your Feed(SYF)를 제안한다.

arxiv 2026-08-10 04:00

TRACE: A Multi-Layer Benchmark for Human AI Controller Coordination Under Drift and Failure

인간과 AI 간의 협업 시스템에서 발생하는 드리프트와 오류를 다층적으로 추적하고 진단하기 위한 벤치마크 TRACE를 제안한 논문.

arxiv 2026-08-10 04:00

CellWorld: From Gene-Level Reconstruction to Latent Cell Prediction in Spatial Transcriptomics Foundation Models

공간 전사체학 기초 모델을 위해 유전자 재구성 대신 잠재 세포 표현을 예측하는 학습 기법 CellWorld를 제안한 논문.

arxiv 2026-08-10 04:00

Vehicle routing problem using deep reinforcement learning - A case study about truck planning in the industry

물류 및 공급망 내 차량 경로 문제(VRP) 해결을 위해 심층 강화학습을 적용한 사례 연구 논문.

arxiv 2026-08-10 04:00

A Multi-Agent Framework for Automated Coarse-Grained Molecular Dynamics of Polymers

고분자 모델링의 전 과정을 자동화하는 LLM 기반 멀티 에이전트 프레임워크인 CGMas를 제안한 논문.

arxiv 2026-08-10 04:00

WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance

웹 에이전트의 의도와 정책 준수를 보장하기 위해 인텐트 계약을 도입한 웹 작업 제어 프레임워크 WebRider에 관한 연구.

arxiv 2026-08-10 04:00

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

그래프에 등록되지 않은 분자를 생물 의학 지식 그래프에 연결하여 약물 발견의 콜드 스타트 문제를 해결하는 MolBioKG 기법을 제안한 논문.

arxiv 2026-08-10 04:00

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

상대방이 전략적으로 대응하는 전략적 대화 환경에서 일반화된 전략을 학습하기 위한 IB-RL 강화학습 기법을 제안한 논문.

arxiv 2026-08-10 04:00

Mind the Gap: A Dual Knowledge Graph Framework for Unified Multi-task User Intent Inference

온라인 여행 리뷰에서 사용자 의도를 통합적으로 추론하기 위한 이중 지식 그래프 프레임워크 DKG-MTI를 제안한 논문.

arxiv 2026-08-10 04:00

LiFTER: A Grounded Neuro-Symbolic Microscope for Continuous-Time Dynamic Graph Forecasting

연속 시간 동적 그래프 예측을 위해 관찰된 상호작용을 근거 기반 시계열 규칙으로 해석하는 신경 기호적 예측 모델 LiFTER를 제안한 논문.

arxiv 2026-08-10 04:00

Evolving Parallel Algorithm Portfolios via Potential-Aware Instance Generation with LLMs

조합 최적화 문제 해결을 위해 잠재력 기반 인스턴스 및 알고리즘 공동 진화 프레임워크인 PIAC를 제안한 논문.

arxiv 2026-08-10 04:00

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

복잡한 시스템의 목표 지향적 설계를 위해 에이전트가 오케스트레이션하는 트리 탐색 기법인 CEDAR를 제안한 논문.

arxiv 2026-08-10 04:00

From Points to Edges: Edge-Conditioned Spectral Operators for Physics-Sensitive PDE Learning

물리적 국소 구조를 효과적으로 학습하기 위해 에지 조건부 스펙트럼 연산자(ESO) 프레임워크를 제안한 논문.

arxiv 2026-08-10 04:00

Fast LapSum: Exact Differentiable Top-k at Million Scale

대규모 모델에서 정확한 선택 질량(k)을 유지하면서도 완전히 미분 가능한 선형 시간 복잡도의 소프트 top-k 연산 기법 Fast LapSum을 제안한 논문.

arxiv 2026-08-10 04:00

ReGraph: Learning to Generate Recipe Graphs from Food Images

음식 이미지로부터 재료, 조리 과정, 도구 간의 관계를 구조화한 레시피 그래프 데이터셋 ReGraph를 제안한 논문.

arxiv 2026-08-10 04:00

Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

LLM 에이전트 기반 협상에서 감정 상태가 가격 합의 및 결과에 미치는 영향을 분석한 연구 논문.

arxiv 2026-08-10 04:00

TRIBE: Predicting Team Performance via Communication Behavior Ensembles

커뮤니케이션 패턴 분석을 통해 팀의 성과를 사전에 예측하고 개입할 수 있게 해주는 도메인 독립적 방법론 TRIBE를 제안한 논문.

arxiv 2026-08-10 04:00

Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps

LLM 판사 패널의 평가 오류가 높은 상관관계를 가지며, 외부 증거 소스를 추가해도 패널의 투표 유효성이 거의 개선되지 않는다는 한계를 분석한 연구.

arxiv 2026-08-10 04:00

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

자율적인 GIS 에이전트를 위해 LMM이 이미지와 텍스트 모달리티 간의 원활한 전환 능력을 갖춰야 함을 강조한 연구.

arxiv 2026-08-10 04:00

Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints

LLM 기반 자원 할당 시 단일 에이전트 대신 다중 에이전트 파이프라인을 사용할 때 발생하는 인구통계학적 편향 변화를 분석한 연구.

arxiv 2026-08-10 04:00

CAi Copilot: Reducing Operational Workload in Molecular Design through Intent-Driven Agentic Workflows

의도 기반의 에이전트 워크플로우를 통해 분자 설계 과정에서의 연구자 업무 부하를 줄여주는 'CAi Copilot' 시스템을 제안한 논문.

arxiv 2026-08-10 04:00

Learning in Deep Networks under Dale's Constraint

생물학적 신경세포의 흥분성 또는 억제성 제약 조건인 데일의 법칙을 준수하면서 효과적인 학습이 가능한 새로운 신경망 구조를 제안한 논문.

arxiv 2026-08-10 04:00

Finding Usable Weight Mechanisms with Tiled SVD

신경망 가중치에서 직접 메커니즘을 추출하기 위해 column-tiled SVD를 사용하는 새로운 해석 기법을 제안한 논문.

arxiv 2026-08-10 04:00

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

기존 PTQ 모델의 양자화된 가중치를 추가로 정밀하게 조정하여 성능을 향상시키는 역전파 없는 고정 그리드 기반 최적화 기법 ReQuant를 제안한다.

arxiv 2026-08-10 04:00

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

토크나이저 없는 LLM의 동적 바이트 패치를 효율적으로 처리하기 위해 엔트로피 기반의 전문가 라우팅(MoE)을 도입한 EntropyMoE 기법을 제안한 논문.

arxiv 2026-08-10 04:00

Interpretable Unsupervised Community Detection with LLM-Symbolized Structured Processes

LLM의 추론 능력을 활용하여 레이블 없이도 복잡한 그래프에서 커뮤니티를 탐지하는 해석 가능한 비지도 학습 방식 LUCID를 제안한 논문.

arxiv 2026-08-10 04:00

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

다중 모달 거대 언어 모델(MLLM)의 효율성을 높이기 위해 샘플별로 최적화된 중간층 어텐션을 예측하여 시각 토큰을 가지치기하는 새로운 기법을 제안한 논문.

simon_willison 2026-08-10 02:05

Quoting OpenClaw (running Opus 4.6)

AI 에이전트인 OpenClaw가 인증 체계가 미비한 웹사이트의 예약을 임의로 변경하며 발생한 보안 취약점 사례를 다룬 분석 글입니다.

simon_willison 2026-08-10 02:05

Quoting OpenClaw

인증 검사가 부재한 API를 통해 타인의 예약을 취소하는 등 AI 어시스턴트의 취약점을 악용한 사례를 다룬 분석글입니다.

openai 2026-08-10 00:00

Premium seats are coming to ChatGPT Business

OpenAI가 ChatGPT Business 사용자를 위한 프리미엄 좌석 도입과 함께 워크스페이스 크레딧 제공 프로모션을 발표했다.

huggingface 2026-08-10 00:00

Meta is back with Muse Glimmer: local, agentic, multimodal, and open source

메타가 로컬에서 구동되는 오픈소스 멀티모달 에이전트 모델인 Muse Glimmer를 발표했다.

openai 2026-08-10 00:00

Virgin Atlantic sharpens customer journeys with ChatGPT Work

버진 애틀랜틱 항공이 기업용 서비스인 ChatGPT Work를 도입하여 고객 여정 전반의 업무 효율성과 의사결정을 가속화했다.

openai 2026-08-10 00:00

How Zapier transformed core marketing processes with ChatGPT Work

Zapier의 마케팅 팀이 ChatGPT Work를 활용하여 리드 퍼널 관리와 캠페인 자산 제작 및 보고 자동화를 효율화한 사례를 소개합니다.

marktechpost 2026-08-09 23:58

NVIDIA Releases NemotronLabs VoiceChat 11B: An Open Full-Duplex Speech-to-Speech Model with ~450 ms Turn-Taking and Live Tool Calling

NVIDIA가 450ms 이내의 응답 속도와 실시간 도구 호출 기능을 갖춘 오픈소스 풀듀플렉스 음성 대화 모델 NemotronLabs VoiceChat 11B를 발표했다.

simon_willison 2026-08-09 23:31

Quoting Claude Opus 5 system prompt

Claude Opus 5의 시스템 프롬프트 및 최근 모델 접근성 제한과 관련된 히스토리에 대한 분석 내용을 담고 있다.

simon_willison 2026-08-09 23:31

Quoting Claude Opus 5 system prompt

앤스로픽의 Claude 모델들에 적용된 수출 통제 조치와 그에 따른 시스템 프롬프트 및 운영 현황을 분석한 글이다.

simon_willison 2026-08-09 22:48

GitHub Models is now retired

GitHub Models 서비스 종료에 대한 분석과 퇴역 과정에서의 경험을 다룬 글입니다.

simon_willison 2026-08-09 22:48

GitHub Models is now retired

GitHub Models 서비스가 공식적으로 종료됨에 따라 관련 도구와 API 사용에 변화가 생겼다는 소식입니다.

simon_willison 2026-08-09 22:05

SQLite compressed text-history prototypes

SQLite를 활용한 텍스트 이력 압축 저장 방식에 대한 아이디어를 제안하고 GPT-Live와 논의한 내용을 공유하는 글.

simon_willison 2026-08-09 22:05

SQLite compressed text-history prototypes

관계형 데이터베이스에서 텍스트 수정 이력을 효율적으로 저장하기 위한 zlib/zstd 압축 방식의 프로토타입에 대한 고찰.

marktechpost 2026-08-09 18:15

Top LLM Observability and Evaluation Platforms in 2026: Langfuse, LangSmith, Braintrust, Arize, and More Compared

2026년 기준 주요 LLM 관측성 및 평가 플랫폼들의 기능을 비교 분석한 보고서.