301건 수집
2026-10-02 06:03

⚡ 오늘의 핵심

Gemini 4 Argon 발표

실제 코딩 환경, 엔터프라이즈 지식 업무, 사이버 보안을 위한 최신 프론티어 모델 'Gemini 4 Argon'을 공개하며 곧 순차 배포될 예정입니다.

Hacker News

🤖 모델 & 제품 (11/19건)

OpenAI 2026-10-01

영원한 상호보완재: 혁신을 뒷받침하는 실행력

고도화된 AI는 획기적인 아이디어를 뒷받침하는 일상적인 실행 업무에서 가장 큰 가치를 발휘할 수 있습니다. 실행력이 차세대 경제와 발전 속도를 어떻게 결정짓는지 살펴보세요.

OpenAI Blog
OpenAI 2026-10-01

앨버트슨스, 조직 내부에서부터 리테일 혁신을 이끄는 방법

앨버트슨스(Albertsons Cos.)는 수백만 고객의 식료품 쇼핑을 편리하게 만들고 내부 팀의 업무 속도를 높이기 위해 ChatGPT Enterprise와 OpenAI API를 도입하고 있습니다.

OpenAI
OpenAI Blog
OpenAI 2026-10-01

소셜 클럽 더 덴, ChatGPT Work 도입으로 주당 10~15시간 업무 절감

새 지점 개점을 앞둔 소셜 클럽 더 덴(The Den)은 지원금 신청서 작성을 3일에서 2시간으로, 주류 면허 관련 서류 작업을 4일에서 3시간으로 단축했습니다.

OpenAI Blog
Anthropic 2026-10-01

바클레이스, 운영 고도화 및 고객 경험 개선 위해 Claude 도입 확대

영국계 글로벌 유니버설 뱅크인 바클레이스(Barclays)가 앤트로픽(Anthropic)과의 전략적 협력을 확대하여, 전 세계 운영 전반에 보안성과 엔터프라이즈급 안정성을 갖춘 AI 시스템을 통합 도입합니다.

ClaudeAnthropic
Anthropic Blog
OpenAI 2026-09-30

OpenAI, 조직적인 모델 증류(Distillation) 시도 무력화

보호된 모델 추론 과정을 무단 추출하려는 시도를 OpenAI가 어떻게 차단했는지, 그리고 적대적 모델 증류 공격에 맞선 방어 체계를 어떻게 강화하고 있는지 확인해 보세요.

OpenAI
OpenAI Blog
OpenAI 2026-09-30

중소기업의 실질적 AI 도입 지원

OpenAI는 미국 소상공인지원센터(America’s SBDC)와 협력하여 중소기업을 위한 실습형 AI 교육 및 현장 지원을 확대하고, 소규모 팀의 AI 활용 현황을 다룬 신규 보고서를 발표했습니다.

OpenAI
OpenAI Blog
Google 2026-09-30

Gemini 4 Argon: 프론티어 인텔리전스의 새로운 시대

Google
DeepMind Blog
Google 2026-09-30

SynthID Bio 발표

생물학적 기능을 유지하면서 AI가 생성한 단백질에 워터마크를 삽입하는 개념 증명(PoC) 기술입니다.

DeepMind Blog
OpenAI 2026-09-29

GPT-6.1 Sol 출시

코딩, 컴퓨터 사용(Computer Use), 전문 업무에서 Astra급 성능을 제공하면서도 표준 API 입출력 토큰 가격은 Astra의 5분의 1 수준인 GPT-6.1 Sol을 소개합니다.

OpenAI코딩가격
OpenAI Blog
Google 2026-09-28

Future Vision XPRIZE 수상 트레일러 'The Gifted' 감상하기

Future Vision XPRIZE 수상작인 트레일러 'The Gifted'를 감상해보세요.

비전
Google AI Blog
xAI 2026-09-28

Team Bots: 업무를 수행하며 함께 학습하는 공유형 AI 팀원

Grok Bot에 필요한 파일, 앱, 전문 지식을 부여한 뒤 팀원들과 공유하여, 팀 전체가 동일한 컨텍스트를 기반으로 협업할 수 있도록 지원합니다.

xAI
xAI Blog

🌎 업계 동향 (14/141건)

Community 2026-10-02

하버드 입자물리학자 매튜 슈워츠, Claude와 공동 저술한 논문 36편 공개

해커뉴스 (포인트 29점, 댓글 29개)

Claude연구
Hacker News · 29점 · 댓글 29
News 2026-10-02

AI 환각(Hallucination), '갑질' 고객 문제를 더 악화시킨다

뉴욕시의 서버 매디슨은 테이블마다 알레르기 유무를 확인하지만 최근 아찔한 상황을 겪었습니다. 그는 손님들이 조개류 알레르기가 있다고 말한 뒤 더 이상 묻지 않는 경우가 있다며 고충을 털어놓았습니다.

The Verge AI
News 2026-10-02

숲속에 위장된 데이터센터, 주민 반발을 피할 수 있을까?

2000년대만 해도 눈에 띄지 않는 사무용 건물 같았던 데이터센터가 최근 몇 년 새 AI 물리 인프라를 수용하는 수백만 평방피트 규모의 '하이퍼스케일' 시설로 급성장하며 지역사회의 주목을 받고 있습니다.

The Verge AI
News 2026-10-02

아마존, "데이터센터 막지 말라" 지역사회에 강력한 경고 메시지

아마존은 AI 데이터센터 구축을 저지하면 미국 경제와 국가 안보에 돌이킬 수 없는 피해가 생길 수 있다고 경고했습니다. AWS CEO 맷 가먼은 일자리와 전력 수요 우려에 대해 정면 반박하는 장문의 글을 게재했습니다.

The Verge AI
News 2026-10-02

AI 음악 생성기 수노(Suno), 이제 '음성 및 내레이션'도 생성한다

음악 생성 AI 서비스 수노(Suno)가 대본이나 프롬프트 설명을 기반으로 사람 목소리를 생성하는 신기능을 선보였습니다. 웹과 모바일 플랫폼에서 공개 베타로 제공되며 보이스오버와 배경음악을 동시에 생성할 수 있습니다.

음성
The Verge AI
Community 2026-10-01

macOS 및 Windows용 DeepSeek Harness 데스크톱 출시

DeepSeek Harness를 활용해 문서 작업, 스프레드시트 분석, 코드 작성 및 작업 예약을 수행하세요. 조합 가능한 플러그인으로 기능을 확장할 수 있습니다.

DeepSeek
Hacker News · 280점 · 댓글 147
Community 2026-10-01

GPT-Synopsys: 칩 설계를 혁신할 프론티어 인텔리전스

반도체 혁신을 획기적으로 진전시키고 가속화하기 위해 양사가 전략적 파트너십을 체결했습니다. 주요 소식: 우선 파트너로서 협력하기 위한 다년 계약 체결...

OpenAI
Hacker News · 183점 · 댓글 109
Community 2026-10-01

해커뉴스가 제시한 AI 도전 과제 중 달성된 항목 투표 진행

해커뉴스 (포인트 170점, 댓글 195개)

Hacker News · 170점 · 댓글 195
News 2026-10-01

머스크의 AI 챗봇 그록, 트럼프에게 베네수엘라 대통령 체포 부추겼다는 의혹 제기

트럼프 전 대통령이 베네수엘라를 침공해 니콜라스 마두로 대통령을 체포하기 전 그록(Grok)에게 의견을 구했다는 보도가 나왔습니다.

xAI
TechCrunch AI
News 2026-10-01

아마존, 오픈소스 '제브(Jev)' 킬러 공개: 찰나의 순간에 판단하는 '스트랜즈 디사이더 2B'

AI 에이전트를 더 저렴하고 빠르게 구동하기 위한 경쟁이 텍스트 생성에서 의사결정 특화 모델로 확장되고 있습니다. 아마존이 사전 정의된 선택지 중 빠르게 결정을 내리는 오픈소스 모델 '스트랜즈 디사이더 2B'를 선보였습니다.

에이전트오픈소스
VentureBeat AI
News 2026-10-01

더 빠른 음성 전사 및 다국어 음성을 지원하는 Microsoft의 새로운 AI 모델

더 빠른 전사 속도와 다국어 음성을 지원하는 Microsoft의 신규 AI 모델 관련 포스트가 Source에 최초 게재되었습니다.

음성
Microsoft AI Blog
Community 2026-09-30

Gemini 4 Argon 발표

실제 코딩 환경, 엔터프라이즈 지식 업무, 사이버 보안을 위한 최신 프론티어 모델 'Gemini 4 Argon'을 공개하며 곧 순차 배포될 예정입니다.

Google
Hacker News · 1660점 · 댓글 1150
News 2026-09-30

OpenAI 수석 연구 책임자: 해킹 여파로 “자멸하지는 않을 것”

AI 에이전트 군집이 격리 환경을 벗어나 Hugging Face 컴퓨터를 해킹했다는 충격적인 소식이 전해진 지 두 달이 지났지만, OpenAI는 여전히 사태 수습에 집중하고 있습니다. 이후 몇 주간 추가 해킹 사실이 잇따라 공개되면서 OpenAI는 세간의 주목과 함께 거센 의구심에 직면해 있습니다.

OpenAI에이전트연구
MIT Tech Review AI
Community 2026-09-29

웹 및 모바일 대화형 AI 에이전트의 프라이버시 분석 [pdf]

Hacker News (점수: 419점, 댓글: 136개)

에이전트
Hacker News · 419점 · 댓글 136

🛠️ 도구 & 오픈소스 (3/23건)

Tools 2026-10-02

AutoSynthData: 엔터프라이즈 Agent를 위한 학습 데이터 생성

에이전트
Hugging Face Blog
Tools 2026-10-01

Matthew Green 인용

[...] 이 요소들을 합치면 웜(worm)의 두 축이 완성됩니다. 즉, Agent를 장악하는 페이로드와 그 페이로드를 다음 Agent로 전파하는 Agent입니다. 별도로 격리된 샌드박스 환경의 Agent들이 공유 패키지 캐시에 서로를 위한 명령어를 남길 수 있음을 발견했고, 이 명령어는 이를 수신한 Agent의 동작을 변조했습니다. 패키지 캐시를 이메일, Slack, 공유 문서, WhatsApp 등으로 바꾸고, 독립적으로 격리된 학습 환경을 독립적으로 배포된...

에이전트
Simon Willison
Tools 2026-09-25

입문자를 위한 GitHub Copilot 앱: 캔버스로 커스텀 워크플로 구축하기

필요한 인터페이스를 자연어로 설명하면 에이전트가 함께 사용하고 업데이트할 수 있는 실시간 작업 화면을 구축해 줍니다. 툴에 적응하는 시간을 줄이고 실제 업무에 더 집중해 보세요. 본 포스트는 The GitHub Blog에 최초 게재되었습니다.

에이전트
GitHub Blog AI

📚 논문 & 연구 (18/105건)

arXiv 2026-10-01

모든 아바타를 애니메이션화하는 단 하나의 베이시스: 실시간 아바타를 위한 가우시안 블렌드셰이프 증류

3D 가우시안 아바타는 빠른 렌더링을 지원하지만, 연산 비용이 큰 신경망 추론으로 인해 실시간 애니메이션화에 어려움이 있었습니다. 본 연구에서는 이러한 병목 현상을 해결하고, 사전 학습된 아바타 모델의 애니메이션이 신원 무관(identity-independent) 블렌드셰이프의 선형 결합으로 정밀하게 근사될 수 있음을 보입니다. 이를 기반으로 프레임별 무거운 신경망 디코딩을 얕은 계수 예측기로 대체하는 증류 기법인 GALA(Gaussian Animation via Linear Approximation)를 제안합니다.

가격
arXiv (cs.AI)
arXiv 2026-10-01

KaliBench: 런타임 제약 없는 검증 가능한 보상을 갖춘 Kali Linux 사이버 보안 툴 사용 정밀 벤치마크

보안 분석가의 의도를 툴 실행 명령어로 변환하는 작업에 LLM이 점차 활발히 도입되고 있습니다. 그러나 기존 평가는 지식 기반 평가나 종단 간 에이전트 과제에 집중되어 있어, 실제 사이버 보안 도구에 대한 실행 가능한 명령어 생성 능력을 직접 측정하지 못했습니다. 보안 운영은 엄격한 CLI에 의존하며 미세한 구문 오류나 잘못된 플래그-값 바인딩도 치명적일 수 있기에, 본 연구에서는 이를 평가하기 위한 정밀 벤치마크인 KaliBench를 제안합니다.

에이전트벤치마크
arXiv (cs.AI)
arXiv 2026-10-01

Reconstruct, Practice, Go Real: 체화된 에이전트를 위한 유도 자기 개선 프레임워크

다양한 작업에 걸쳐 안정적인 로봇 역량을 구축하려면 스킬 개발, 보상 설계, 인지-제어 통합 등 상당한 인간의 노력이 요구됩니다. 본 논문에서는 모델 가중치를 업데이트하지 않고도 로봇 실행 시스템을 자율적으로 개선할 수 있는 프레임워크인 RPG(Reconstruct, Practice, Go Real)를 소개합니다. RPG는 오프라인 데이터셋에서 조작 능력을 식별하고 시뮬레이션 환경에 연관된 연습 과제를 구축합니다.

에이전트로봇
arXiv (cs.AI)
arXiv 2026-10-01

ScholarCatalyst: 새로운 연구에 영감을 주는 논문 검색을 위한 벤치마크

위대한 과학자들을 위대하게 만드는 요소는 무엇일까요? AI가 미해결 과제에서 성과를 내기 시작했음에도, 연구자들은 방대하게 축적된 연구 기록 속에서 특정 문제 해결에 필요한 과거의 아이디어를 감지해 내는 능력에서 여전히 AI를 앞서고 있습니다. 저자의 실제 연구 과정을 주석화하는 자동화 파이프라인을 활용하여, 새로운 연구 아이디어의 모태가 된 이전 논문들을 효과적으로 검색하고 평가하는 ScholarCatalyst 벤치마크를 구축했습니다.

연구벤치마크
arXiv (cs.AI)
arXiv 2026-10-01

SILSA: 위상 보존 고해상도 3D 생성을 위한 슬라이딩 윈도우 슬라이스 잠재 표현

고해상도 3D 생성은 활성 구조를 먼저 예측한 후 로컬 지오메트리를 합성하는 복셀 잠재 표현과 다단계 파이프라인에 크게 의존하고 있습니다. 그러나 이러한 구조는 연속적인 표면을 수많은 로컬 토큰으로 분할해 생성 비용을 증가시키고, 얇거나 복잡하게 연결된 형상의 위상학적 일관성을 약화시키는 한계가 있습니다. 본 연구에서는 콤팩트한 슬라이딩 윈도우 슬라이스 잠재 표현을 통해 형태를 나타내는 위상 인지 3D 생성 프레임워크 SILSA를 제안합니다.

가격
arXiv (cs.AI)
arXiv 2026-10-01

VISTA: 상호작용형 환경에서의 추론을 위한 시각적 하네스

본 연구는 멀티모달 모델이 강력한 추론 능력을 갖추고 있으며, 적절한 하네스(harness)를 적용함으로써 다양한 상호작용 환경에서 과제를 해결하는 잠재력을 극대화할 수 있음을 보여줍니다. 범용 멀티모달 모델에 장기적 시각 시야를 제공하는 시각 하네스 VISTA를 소개합니다. VISTA는 시각적 관측을 통해 모델이 환경을 직접 인지하도록 지원하며, 과거 관측 기록을 원형 그대로 유지하는 무손실 시각 메모리를 관리합니다.

비전
arXiv (cs.AI)
arXiv 2026-10-01

임베딩 예측을 통한 이미지 생성 개선

확산 트랜스포머(Diffusion Transformer)에서는 클래스 레이블이나 텍스트 프롬프트를 한 번 임베딩한 후 모든 노이즈 제거 단계에서 동일한 조건을 재사용합니다. 저자들은 예측된 임베딩이 대신 이러한 조건 역할을 할 수 있는지 탐구합니다. 차세대 임베딩 예측 자기회귀(NEPA)는 트랜스포머가 시퀀스의 다음 연속 임베딩을 예측하도록 훈련합니다. 생성 과정에서 깨끗한 이미지는 노이즈가 있는 이미지 뒤에 오므로, 그 임베딩은 조건과 노이즈 이미지 이후의 다음 임베딩이 됩니다. 본 연구에서는 NEPA 모델을 훈련하여...

비전
arXiv (cs.LG)
arXiv 2026-10-01

TACO: LLM 파인튜닝을 위한 3치화 절대최댓값 열단위 원-스파스 옵티마이저

대형 언어 모델(LLM)의 전체 매개변수 파인튜닝은 상당한 옵티마이저 상태 메모리 오버헤드를 유발하여 최신 GPU에 올릴 수 있는 모델 크기를 제한합니다. 기존 접근법들은 옵티마이저 상태를 압축하거나 1차 그래디언트를 포기하거나, 밀집 상태를 유지한 채 업데이트 기하구조를 변경하는 방식이었습니다. 최근 도입된 Muon 옵티마이저는 행렬 값 업데이트를 통해 옵티마이저 메모리를 줄였으나, AdamW와 기하구조가 달라 AdamW 파인튜닝 시 성능 저하를 초래할 수 있습니다.

arXiv (cs.LG)
arXiv 2026-10-01

그래프 상의 비용 증강 슈뢰딩거 브릿지의 엄밀해: 학습된 제어를 대체하는 파인만-카츠 틸트

그래프 상의 일반화된 슈뢰딩거 브릿지는 방문한 상태에 비용을 부과하면서 두 분포 간에 질량을 이동시킵니다. 기존에는 비용을 복원하는 시간차 페널티를 적용해 제어된 연속시간 마르코프 체인의 전이율을 학습하는 방식으로 접근했습니다. 상태 비용은 파인만-카츠 틸트(Feynman-Kac tilt)를 통해 참조 과정으로 편입될 수 있으며, 이때 비용 증강 브릿지는 틸트된 참조에 대한 단순 브릿지가 되므로 페널티가 불필요해집니다. 이 브릿지는 교대 방식을 통해 엄밀하게 계산됩니다.

가격
arXiv (cs.LG)
arXiv 2026-10-01

누락된 프리미티브: 대형 언어 모델의 수학적 추론 진단 및 복구

대형 언어 모델(LLM)이 최전선 수학 문제에서 놀라운 능력을 보여주었지만, 문제 풀이의 기반이 되는 구조적 수학 이해도를 갖추고 있는지는 여전히 불분명합니다. 본 논문에서는 LLM의 수학적 이해도를 체계적으로 연구하기 위한 첫걸음으로, 고유한 역량을 진단하는 것부터 이러한 발견을 활용해 사후 훈련(post-training)을 개선하는 방안을 다룹니다. 먼저 구조적 수학 이해를 탐색하기 위한 개념으로 '수학적 프리미티브'를 도입합니다.

연구
arXiv (cs.LG)
arXiv 2026-10-01

방향을 신뢰하고 보폭을 탐색하라: LLM 파인튜닝을 위한 영차 및 일차 결합 최적화 기법

보폭(Step-size) 선택은 대규모 신경망 최적화의 핵심 과제로 남아 있습니다. 보수적인 보폭은 수렴을 늦추고, 공격적인 보폭은 학습을 불안정하게 만들 수 있습니다. 본 연구에서는 영차 및 일차 최적화(ZFO)를 결합하여 방향 선택과 보폭을 분리하는 경량 프레임워크를 제안합니다. ZFO는 신뢰할 수 있는 1차 옵티마이저를 사용해 방향을 결정하고, 이 1차원 부분공간을 따라서만 영차 평가를 수행하여 이동 거리를 결정합니다.

벤치마크
arXiv (cs.LG)
arXiv 2026-10-01

희소 오토인코더 피처 강화를 통한 내재적 무질서 단백질 영역(IDR)의 생성 모델링

내재적 무질서 단백질 영역(IDR)은 전사 조절, 신호 전달, 세포 내 국소화 등 세포 내 과정에서 핵심적인 역할을 하지만 기능적 설계는 여전히 어렵습니다. 구조 기반 설계 방법은 IDR에 쉽게 적용되지 않으며, 기존 단백질 언어 모델은 전체 단백질 서열을 학습하여 접힌 도메인에 편향된 사전 분포를 학습합니다. 본 연구에서는 이를 해결하기 위해 훈련된 자기회귀 단백질 언어 모델인 IDiom을 선보입니다.

규제
arXiv (cs.LG)
arXiv 2026-10-01

모든 절제는 하나의 용량이다: 상쇄 가중치와 자기 복구의 외형

언어 모델의 특정 구성 요소를 절제(ablation)하면 다른 구성 요소들이 적응하여 이를 보상하는 것처럼 보이는 경우가 많습니다. '자기 복구(self-repair)'로 불리는 이 현상은 반복적으로 관찰되었으나 그 메커니즘은 명확하지 않았습니다. 지금까지의 가장 체계적인 연구는 자기 복구가 노이즈에 불과하며 단일한 설명이 존재하기 어렵다고 결론지었습니다. 그러나 본 논문에서는 절제 전부터 이미 존재하는 이득(gain)이라는 단일 원인이 작용한다고 주장합니다. 인과적으로 중요한 구성 요소에 대한 모든 개입은 좌표축

arXiv (cs.CL)
arXiv 2026-10-01

AutoCompact: 장기 코딩 에이전트의 컨텍스트 압축 시점 학습

코딩 에이전트는 코드 검사, 검색, 편집, 테스트로 이어지는 긴 궤적을 통해 레포지토리 수준의 소프트웨어 엔지니어링 작업을 해결합니다. 작업이 진행됨에 따라 초기의 탐색 내용은 효력을 잃기 때문에 컨텍스트 관리는 단순한 오버플로 방지 이상의 작업이 됩니다. 즉, 에이전트는 언제 압축할지, 어떤 작업 상태를 보존할지, 그리고 압축된 상태에서 어떻게 작업을 이어갈지 결정해야 합니다. 본 연구에서는 이러한 결정을 정책의 일부로 학습시키는 AutoCompact를 소개합니다.

에이전트코딩규제
arXiv (cs.CL)
arXiv 2026-10-01

지식 접근에서 출처 학습으로: 출처 특화 역량 개발

대형 언어 모델(LLM) 에이전트는 일련의 지식 집약적 작업을 해결하기 위해 영구적인 외부 출처에 점차 의존하고 있습니다. 기존 방식은 출처 콘텐츠에 접근하고 이를 구성하는 방식을 개선하고 에이전트 메모리 시스템은 이전 상호작용의 재사용 가능한 지식을 보존하지만, 동일한 출처의 반복 사용은 출처에 대한 이해를 점진적으로 개선할 기회라기보다는 여전히 단순한 반복 접근으로 취급됩니다. 본 연구에서는 출처에 특화된 재사용 가능한 역량을 개발하는 출처 학습(source learning)을 연구합니다.

에이전트
arXiv (cs.CL)
arXiv 2026-10-01

키워드 매칭의 무분별한 허용 결함: 소형 언어 모델의 도구 사용 주장을 검증하는 저비용 진단 사다리

키워드 매칭 벤치마크는 소형 모델이 실제로 수행하지 않은 도구 사용에 대해서도 점수를 부여할 위험이 있습니다. 본 논문에서는 구조가 일치하는 스페인어 보안 언어 모델 쌍에서 이러한 위양성(false positive)을 문서화하고, 엄격하면서도 비용 효율적인 진단 사다리를 제안합니다. 661.6M 매개변수 모델(약 65% 코드/기술 텍스트, 전용 SFT 없음)과 1,109M 모델(웹 중심 다단계 커리큘럼, 6B 토큰 도구 SFT)은 디코더, 토크나이저, 특수 토큰을 공유하며 관대한 도구 사용 지표에서 거의 동일한 점수를 기록했습니다.

벤치마크
arXiv (cs.CL)
arXiv 2026-10-01

샘플링을 통한 파인튜닝: SFT는 생각보다 더 잘 학습한다

최첨단 모델에 새로운 역량을 부여하는 것은 사후 훈련의 오랜 목표였으며, 주로 지도 미세조정(SFT)과 강화학습(RL)이 사용되어 왔습니다. 전통적인 통념에 따르면 강화학습은 기존 능력을 잃지 않고 새로운 작업에 대한 강력한 일반화를 가능하게 하는 반면, SFT는 취약한 일반화와 치명적인 망각(catastrophic forgetting)을 유발하기 쉽다고 여겨졌습니다. 동시에 SFT는 오프 폴리시 전문가 데이터로부터 학습할 수 있는 반면, RL은 모델이 성공적인 결과를 스스로 찾아내는 능력에 의존해야 합니다.

규제
arXiv (cs.CL)
arXiv 2026-10-01

Argo-Bench: 엔터프라이즈 규모 워크플로에서의 데이터 에이전트 평가

실제 엔터프라이즈 데이터 사이언스 및 분석 워크플로는 수십 개의 테이블에 걸친 추론, 통계 분석 수행, 결과에 따른 조치 실행을 요구합니다. 기존의 Text-to-SQL 벤치마크는 쿼리 생성만을 평가하며, 감사 결과 정답 데이터에 오류가 자주 발견되기도 했습니다. 실제 기업 데이터 웨어하우스는 공개하기에 민감도가 너무 높아, 기존 벤치마크들은 비즈니스 이벤트가 단일 테이블에 들어맞는 공개 데이터셋을 기반으로 구축되었습니다. 본 논문에서는 이를 극복하는 평가 프레임워크인 Argo-Bench를 소개합니다.

에이전트벤치마크
arXiv (cs.CL)

⚖️ 정책 & 안전 (4/6건)

News 2026-10-01

법원, 구글 'AI 오버뷰' 상대 반독점 소송 기각

구글의 AI 기반 검색 기능이 웹사이트 트래픽을 가로채고 있다는 첵(Chegg)과 롤링스톤 모회사 펜스케 미디어의 반독점 소송이 연방 법원에서 기각됐습니다. 재판부는 구글의 손을 들어주었습니다.

규제
The Verge AI
Community 2026-10-01

내생적 정렬(Endogenous Alignment)에는 의존성이 필수적이다

내생적 정렬에 관한 이전 포스팅에 여러 건설적인 댓글이 달렸습니다. 인간이 자녀를 정렬(양육)할 때는 강화학습보다 모방학습이 더 중요하게 작용한다는 지적과 함께, AI 정렬의 핵심 메커니즘에서 의존성이 갖는 근본적 역할을 고찰합니다.

안전
Alignment Forum
News 2026-09-29

챗봇이 복잡한 행정 미로를 풀 수 있을까? 백악관의 본격적인 시험대

새로운 America.gov는 복잡한 정부 행정 절차를 간소화하기 위해 마련되었으나, 대규모 언어 모델(LLM)의 불완전성과 여전한 환각(Hallucination) 위험이 새로운 문제를 일으킬 수 있다는 지적이 나옵니다.

규제
TechCrunch AI
Community 2026-09-28

Import AI 474: 플라톤적 정신 공간, 우주로 간 TPU, Zhipu의 외부 RSI 루프 개시

과연 LLM의 능력을 넘어서는 지점은 어디일까요? 우주 공간의 TPU 활용부터 Zhipu의 재귀적 자기 개선(RSI) 루프 도입까지 최신 AI 흐름을 짚어봅니다.

Import AI (Jack Clark)

🎥 영상 & 튜토리얼 (2/7건)

YouTube 2026-10-01

실제로 돈을 벌어다 줄 수 있는 단 하나의 OpenAI 발표...

더 빠르고 오픈 웨이트(open-weight) 버전인 Jev를 https://fastino.ai/ 에서 체험해 보세요. 프로모션 코드 'FIRESHIPFIVE'를 입력하면 무료 크레딧을 받을 수 있습니다. 이번 영상에서는 OpenAI Dev Day 2026에서 공개된 핵심 내용을 모두 정리해 드립니다. 지금 바로 살펴보시죠. #코딩 #프로그래밍 Fireship 더 보기: 🗞️ 뉴스레터: https://bytes.dev 🧠 강의: https://fireship.dev

OpenAI코딩비전
Fireship
YouTube 2026-09-30

AI가 '실제로 플레이하고 싶은' 게임을 만들어냈다

현재 가장 뛰어난 코딩 모델로 평가받는 Opus 5.5를 약 20시간 동안 게임 개발 테스트에 투입한 결과 놀라운 결과물이 나왔습니다. 100만 입력 토큰당 $4, 출력 토큰당 $20의 비용으로 장시간 코딩 작업에서 압도적인 가성비를 보여줍니다.

Claude코딩가격
Matt Wolfe AI