labyradar

· 상태 degraded

핵심

Introducing Muse Code and Muse Spark 1.2

장문 처리와 에이전트 도구 호출 능력이 뛰어난 코딩 특화 모델인 Muse Spark 1.2 가 출시된 기술적 진보 소식입니다.

simonw

addyosmani/agent-skills

생산 환경 수준의 엔지니어링 스킬을 갖춘 에이전트들이 등장하며 이는 실제 비즈니스 프로세스 자동화와 복잡한 코드 리뷰 작업에 즉시 적용 가능하다.

gh_trending

DeepSeek planning to significantly raise prices

딥시크가 가격을 대폭 인상할 계획이라고 발표했습니다. 이는 AI 모델의 상업적 가치와 시장 수요를 반영한 전략적인 가격 정책 변화로 해석됩니다.

hackernews

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

인과 추론에서 다수의 정답이 존재할 때 기존 투표 방식의 한계를 지적하며, 퍼널의 인과 기준을 적용하는 CALVER 기법을 소개합니다. 이 방법은 참조 답변 없이 구조화된 트레이스를 평가하여 가장 높은 점수를 받은 후보를 선택함으로써 유효한 소수派的 추론도 올바르게 채택할 수 있게 합니다.

hf_papers

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

MLLM 기반 분할 작업의 성능과 대화 능력 유지 및 빠른 추론이라는 삼면 딜레마를 해결하기 위해 올 마스크 예측 기법을 제안합니다. 자동회귀적 대화와 비자동회귀적 마스크 예측을 분리하고 패치 특징과 이미지 정렬된 토큰을 융합하여 효율성을 극대화하는 STAMP 방식을 도입했습니다.

hf_papers

When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

페르소나 스킬을 통해 개인화된 에이전트를 만들 때 발생할 수 있는 개인정보 유출 및 위장 위험을 평가하기 위해 안티스킬벤치 벤치마크를 소개합니다. 대규모 대화 트레이스를 기반으로 프라이버시 누설과 impersonation 리스크를 체계적으로 분석하고 방어 메커니즘의 효과를 검증할 수 있습니다.

hf_papers

Self-Evolving Coding Agents

소프트웨어 개발 환경의 변화와 피드백을 스스로 학습하여 진화하는 코딩 에이전트의 필요성을 강조하고 이를 위한 기술적 방향성을 제시합니다.

hf_papers

🎲 탐험

cloudflare/computer

클라우드플레어에서 에이전트에게 컴퓨터 환경을 직접 부여하는 새로운 기능을 소개하며, 이는 AI 가 실제 작업 환경과 상호작용할 수 있는 능력을 확장시켰다.

gh_trending

obra/superpowers

에이전트 기술 프레임워크와 소프트웨어 개발 방법론을 제시하여 AI 에이전트의 실용성을 높이고 실제 엔지니어링 환경에서의 적용 가능성을 보여준다.

gh_trending