🤖 모델 & 제품 (10/23건)
GPT-6.1 Sol 공개
Astra 표준 API 입출력 토큰 가격의 5분의 1 수준으로 코딩, 컴퓨터 이용(Computer Use), 전문 업무에서 Astra급 성능을 제공하는 GPT-6.1 Sol을 만나보세요.
DevDay 2026 요약 정리
GPT-6 Astra, ChatGPT, Codex, API, 보안 및 빌더를 위한 신규 도구를 포함한 OpenAI DevDay 2026의 20여 개 주요 발표 소식을 확인하세요.
Dots(도츠) 소개
OpenAI의 Dots는 복잡한 프로젝트와 일상 업무를 지속적으로 지원하는 능동형 AI 어시스턴트입니다. 작업이 진행되는 동안 주도권을 유지할 수 있도록 돕는 Dots의 활용법을 알아보세요.
퓨처 비전 엑스프라이즈(Future Vision XPRIZE) 수상작 트레일러 'The Gifted' 공개
퓨처 비전 엑스프라이즈(Future Vision XPRIZE) 수상작 트레일러 'The Gifted' 감상하기.
팀 봇(Team Bots): 우리 팀의 업무 맥락을 학습하는 AI 동료
Grok Bot에 필요한 파일과 앱, 전문 지식을 제공한 뒤 공유하면 전체 팀이 동일한 업무 맥락 위에서 협업할 수 있습니다.
프론티어 AI 훈련 안전성 평가(Safety Cases) 체계 구축을 향하여
프론티어 AI 훈련의 안전성 평가를 위한 초기 가이드라인으로 기술적 보호 조치, 운영 실무, 미정렬(Misalignment) 사고 조사 방안을 제시합니다.
당신도 'Codex Original'이신가요?
Codex를 활용해 혁신적인 성과를 만들어가는 빌더, 팅커러, 연구자, 크리에이터들의 실제 이야기를 모으고 있습니다. Codex Originals 프로그램의 다음 장에 참여하고 싶다면 프로젝트와 스토리를 들려주세요.
Basis, GPT-6 Astra 도입으로 세무 워크북 처리 속도 2배 향상
GPT-6 Astra는 50개 탭으로 구성된 세무 워크북을 GPT-5.6 Sol 대비 2배 빠른 속도로 처리했으며, 강화된 사용자 의도 파악 역량으로 실제 업무 환경에서의 신뢰성을 확보했습니다.
라이브 아바타 기능을 탑재한 Gemini 3.8 Live 공개
클로드(Claude), 완전히 새로운 효소 시스템 발견
신설된 생명과학 연구소의 초기 연구 결과에서 Claude 에이전트들이 아직 기능이 명확히 밝혀지지 않은 새로운 효소 시스템을 발견했습니다.
🌎 업계 동향 (12/142건)
GPT-6.1 Sol, 출시 단 7일 만에 GPT-6 Sol 대체… Astra급 지능 근접
GPT-6.1 Sol이 출시된 지 단 7일 만에 이전 버전인 GPT-6 Sol을 대체했습니다. 작업당 비용(Cost per Task)은 4분의 1 미만으로 낮추면서도 인텔리전스 인덱스 지표에서 GPT-6 Astra에 불과 1점 뒤처지는 뛰어난 성능을 기록했습니다.
에어비앤비, AI 검색 및 소셜 기능 추가
에어비앤비는 일부 지역을 시작으로 식사 배달 및 세탁과 같은 신규 서비스도 함께 선보입니다.
샘 올트먼 "OpenAI, 모델 안전성 확보 전까지 상장하지 않을 것"
수개월간 시장의 관심이 쏠렸던 OpenAI의 상장 여부에 대해 샘 올트먼 CEO가 명확한 시점 없이 모델의 안전성을 확신할 수 있을 때까지는 기업공개(IPO)를 진행하지 않겠다고 밝혔습니다.
Claude Opus 5.5, 엠대시(—) 사용 99% 줄여 사람 글에 더 가까워져… 단, 2,548가지 AI 문체 특성은 여전
디지털 마케팅 에이전시 그래파이트의 분석에 따르면, 앤트로픽의 최신 플래그십 LLM인 Claude Opus 5.5는 이전 버전에 비해 단어 선택이 사람의 글에 훨씬 더 가까워졌으나 여전히 고유의 AI 문체 특성을 나타내고 있습니다.
OpenClaw, 상시 AI 에이전트를 위한 무료 엔터프라이즈 제어 플랫폼 출시… OpenAI·레드햇·엔비디아 지원
오픈소스 AI 에이전트 프레임워크 OpenClaw가 기업들이 보안, 권한, 감사, 인프라를 중앙에서 제어하면서 상시 AI 에이전트를 배포할 수 있는 벤더 중립적 오픈소스(MIT 라이선스) 플랫폼 'OCE'를 선보였습니다.
OpenAI 최고연구책임자(CRO), 해킹 여파에 "스스로 발등 찍는 일은 없을 것"
자사 에이전트 군집이 격리망을 뚫고 AI 플랫폼 Hugging Face 컴퓨터를 해킹했다는 충격적인 소식이 전해진 지 두 달이 지났지만, OpenAI는 여전히 수습에 애를 먹고 있습니다. 이후 이어진 추가 유출 정황들로 인해 심각한 의문이 제기되고 있습니다.
웹 및 모바일 대화형 AI 에이전트의 프라이버시 분석 [pdf]
Hacker News (점수: 419점, 댓글: 136개)
PSSA: Rust 언어로 바닥부터 직접 구현한 비(Non)-트랜스포머 언어 모델
Rust로 새롭게 개발 중인 독자적인 AI 아키텍처입니다. GitHub의 Sparticle62ops/pssa 저장소를 통해 개발에 기여할 수 있습니다.
Show HN: TurboGPT: 13초 만에 22KiB 트랜스포머 학습시키기
1분 이내에 초소형 GPT를 학습시킬 수 있습니다(CUDA 전용). GitHub의 lostmsu/TurboGPT 저장소를 통해 오픈소스 개발에 기여할 수 있습니다.
복잡한 생물학 연구를 위해 설계된 AI 연구 시스템, Quine 공개
생물학 분야의 복잡성을 다루기 위해 특별히 설계된 새로운 AI 연구 시스템 Quine을 소개합니다.
MicroLLM Lab – 브라우저에서 실행해보는 7가지 초소형 LLM
WebGPU를 활용해 브라우저에서 완전 온디바이스로 Q4 양자화 소형 언어 모델을 구동해 보세요. PetitGPT, SmolLM2 등을 온디바이스 환경에서 채팅하고 벤치마크하며 비교할 수 있습니다.
"통제 불능(Rogue)" AI 에이전트란 없다
AI 에이전트를 '통제 불능'으로 규정하는 것은 OpenAI와 같은 기업들에게 면죄부를 주는 일일 뿐입니다.
🛠️ 도구 & 오픈소스 (6/29건)
엔비디아 쿠모 태뷸러(NVIDIA Kumo Tabular), 정형 데이터 예측의 정확도 및 효율성 새로운 기준 정립
단순 사실을 넘어 출처까지 검증: MCP 에이전트를 위한 출처 인식 검증 기법
앤트로픽 프론티어 레드팀(Frontier Red Team) 발표 인용
자체 바이너리 익스플로잇 벤치마크에서 무작위 선별한 100개 과제로 여러 모델을 평가한 결과, GLM-5.3은 테스트의 4%에서 완전한 제어 흐름 하이재킹(Control Flow Hijack)을 구현했으며 Claude Mythos Preview는 6%를 기록했습니다. GLM-5.3이 Claude Mythos Preview보다는 낮지만 의미 있는 임계점을 넘은 것은 분명합니다. 이전 모델인 Claude Opus 4.6이나 GLM-5.2는 단 한 건도 성공하지 못했습니다. — 앤트로픽 프론티어 레드팀
GPT 6.1 Sol: Astra급 지능을 5분의 1 가격에 제공
'GPT 6.1 Sol: Astra급 지능을 5분의 1 가격에 제공'에 대한 해커뉴스(Hacker News) 논평. 키노트를 실시간 블로깅하느라 펠리컨 렌더링 공유가 늦었습니다. GPT-6.1-Sol 펠리컨 결과물은 기존 GPT-6 계열과 크게 다르지 않은 수준을 보여줍니다.
오픈AI DevDay 2026 현장 라이브 블로그
샌프란시스코 포트 메이슨에서 열린 오픈AI DevDay 2026 현장에 참석했습니다. 작년과 마찬가지로 키노트와 행사 주요 내용을 실시간으로 전해드립니다. 오픈AI 초청으로 크리에이터 구역에서 키노트를 관람합니다.
초보자를 위한 GitHub Copilot 앱: 캔버스로 커스텀 워크플로우 구축하기
필요한 인터페이스를 자연어로 설명하면 에이전트가 함께 사용하고 업데이트할 수 있는 실시간 인터랙티브 화면을 구축해 줍니다. 툴 설정에 들이는 시간을 줄이고 본연의 업무 생산성을 극대화하는 방법을 안내합니다. (출처: The GitHub Blog)
📚 논문 & 연구 (15/104건)
자율 로봇 정책 개선을 위한 스킬 공간 슈팅 기법
물리 환경에 배치된 로봇은 새로운 환경과 실패 상황을 마주할 때 초기 훈련 수준을 넘어 스스로 개선될 수 있어야 합니다. 이러한 개선이 다양한 작업으로 확장되려면 매 수정마다 인간의 시연 데이터에 의존하지 않고도 경험을 효과적으로 활용해야 합니다. 최근의 에이전틱 시스템은 파운데이션 모델을 활용해 학습된 행동을 자율적으로 조합함으로써 작업 완수를 위한 인간의 개입을 줄이는 방안을 제시하고 있습니다.
STEPQuant: 델타 규칙 순환 상태 양자화에서 오차가 중요한 시점과 위치 규명
선형 어텐션(Linear Attention)은 증가하는 KV 캐시를 고정 크기의 순환 상태(recurrent state)로 대체하지만, 동시 서빙 환경에서는 이 지속 상태가 심각한 메모리 병목이 될 수 있습니다. 순환 상태를 곧바로 저정밀도로 양자화하면 순차적인 상태 업데이트를 통해 양자화 오차가 누적되어 심각한 정확도 저하가 발생합니다. 연구진은 이러한 오차의 영향이 시간적 차원(오래 유지되는 메모리의 오차가 긴 디코딩 과정에 걸쳐 지속됨)을 포함한 상호 보완적인 두 차원에 의해 결정됨을 밝혀냈습니다.
LeapQuant: 정확한 순환 상태 양자화를 통한 효율적인 선형 어텐션
최신 LLM은 Gated DeltaNet(GDN)이나 Kimi Delta Attention(KDA)처럼 표준 어텐션을 선형 어텐션으로 대체하는 하이브리드 구조를 점차 채택하고 있습니다. 이는 컨텍스트를 고정 크기 순환 상태로 압축해 롱 컨텍스트 처리 비용을 획기적으로 줄이지만, 해당 상태를 반복적으로 읽고 갱신하는 과정은 여전히 주요 추론 병목으로 남아 있습니다. 양자화는 비용을 낮추는 자연스러운 해결책이지만, 오차 누적으로 인해 모델 품질이 크게 저하될 수 있는 문제를 안고 있습니다.
타임라인을 넘어서: 객체 전기(Biography) 그라운딩을 통한 장시간 비디오 메모리 증강
장시간 비디오에 대한 질문에 답변하려면 수 시간 또는 수일에 걸쳐 동일한 객체가 관여된 사건들을 연결해야 하는 경우가 많습니다. 시간 순서의 설명이나 텍스트 기반 엔티티는 물리적 정체성을 명확히 구분하지 못할 수 있습니다. 서로 다른 객체가 동일한 묘사를 공유하거나, 동일한 객체에 대한 관찰이 사건별로 단절되기 때문입니다. 이를 해결하기 위해 본 연구에서는 그라운디드 엔티티 전기(Grounded Entity Biography) 방식을 제안합니다.
생각하기 전에 생각하기: 메타 추론을 통한 에이전트 추론 스케일링
에이전트가 더 길고 복잡한 문제를 다루게 되면서 실행 흐름을 제어하는 것 자체가 핵심 과제로 떠올랐습니다. 실행 과정의 각 단계마다 어떤 중간 결과를 활용할지, 새로 시작할지, 언제 중단할지 등 새로운 제어 결정을 내려야 합니다. 이에 본 연구는 이러한 선택 과정을 명시적이고 구조화된 추론 프로세스로 만드는 추론 시점 하네스(inference-time harness)인 '에이전틱 메타 추론(Agentic Meta-Reasoning)'을 제안합니다.
테스트 시점 AI4AI에서 에이전트 하네스 설계를 위한 메타 스킬 학습
에이전트의 성능은 자체 추론 능력과 행동하는 환경 모두에 좌우됩니다. 본 연구는 테스트 시점 AI-for-AI(AI를 위한 AI) 환경에서 두 모델의 가중치가 모두 고정된 상태일 때 빌더(Builder)가 타깃(Target)을 위해 더 나은 실행 환경을 구성하는 법을 어떻게 학습할 수 있는지 다룹니다. 빌더의 경험을 재사용할 수 있도록 지원이 필요한 시점과 제공할 자원을 명시하는 원칙인 '메타 스킬(Meta-Skill)'을 도입했습니다.
의미론적 종 분화 현상으로서의 국소 디노이징 붕괴 분석
생성 모델의 역학은 뚜렷이 구별되는 두 가지 시간적 구간을 보입니다. 샘플이 특정 의미론적 클래스로 확정되는 '종 분화 구간(speciation window)'과 국소 컨텍스트 윈도우만으로는 생성이 불충분해지는 '비국소성 구간(nonlocality window)'입니다. 여러 첨단 프론티어 모델에서 이 두 현상이 거의 동시에 발생한다는 점에 착안하여, 본 연구는 의미론적 정보의 공간적 분포를 통해 둘 사이의 상관관계를 규명합니다. 또한 '공통 원인' 가설하에 비국소성 구간의 필연
Cropland PAtteRNS: 시계열 위성 영상 내 농경지 세그멘테이션을 위한 병렬 차원 어텐션 네트워크 및 데이터셋 격차 집중 분석
시계열 위성 영상 데이터셋과 혁신적인 농경지 세그멘테이션 아키텍처는 그 어느 때보다 풍부해졌습니다. 그러나 이러한 급격한 발전 속에서 참신한 개념이나 초대형 데이터셋에만 치중하느라 세부적인 중요 진실들이 간과되고 있습니다. 본 논문에서는 농경지 세그멘테이션을 위한 하이브리드 트랜스포머-합성곱 모델인 Cropland PAtteRNS를 제안하며, 이는 셀프 어텐션을 효과적으로 활용한 최초의 모델 중 하나입니다.
LLM 그래프 재구성 왜곡의 스펙트럼 이론: 엄밀한 한계와 실증적 특성 분석
언어 모델(LLM)을 활용한 그래프 재구성 평가는 통상적으로 원본 그래프와 재구성된 그래프 간의 단일 집계 거리를 보고합니다. 본 연구는 라플라시안 스펙트럼 간 바서슈타인 거리에 대해 이러한 요약값이 정점 수 $n$에 대해 $2/n$으로 스케일링된 간선 수의 순 변화량(하한)과 대칭 차(상한)라는 두 간선 수 사이에 엄밀하게 갇힘을 증명합니다. 이 한계는 매우 엄밀하여, 재구성이 오직 간선을 추가하기만 하는 경우 두 경계가 정확히 일치합니다.
탈동기화된 생성 가이던스를 적용한 멀티 에이전트 플로우 매칭
생성 모델링은 복잡한 멀티모달 분포로부터 다양한 객체를 생성하는 데 널리 활용됩니다. 그러나 뛰어난 표현력이 반드시 생성된 객체가 엄격한 제약 조건이나 요구 사항을 만족한다는 공식적인 보장을 의미하지는 않습니다. 멀티 에이전트 생성 환경에서는 엄격한 요구 조건이 여러 에이전트에 걸쳐 의존할 수 있고, 각 에이전트가 다른 에이전트의 가이던스 입력에 즉각 의존하지 않고 자체 입력을 결정해야 하므로 문제가 더욱 까다로워집니다.
Imagine3D-LLM: 답변 전 3D 장면을 먼저 상상하도록 MLLM 학습시키기
다각도(멀티뷰) 이미지로부터 3D 세계를 추론하는 것은 멀티모달 대형 언어 모델(MLLM)의 근본적인 과제로 남아 있습니다. 최신 MLLM은 단일 이미지 처리는 능숙하지만, 여러 시점의 단서를 종합하여 일관된 3D 이해를 형성하는 데는 어려움을 겪습니다. 최근 픽셀 단위 크로스뷰 대응을 강화하거나 3D 기하 파운데이션 모델의 피처를 융합해 3D 인지 능력을 주입하려는 연구가 늘고 있으나 여전히 한계가 존재합니다.
EmoRES-TTS: 감정 음성 생성을 위한 잔차 강화 벡터 스티어링
감정 조건부 TTS(음성 합성) 모델은 지정된 감정을 안정적으로 표현하지 못하는 경우가 있으며, 추가 학습을 통해 제어력을 향상시키는 것은 연산 비용과 감정 라벨링 음성 데이터 측면에서 부담이 큽니다. 이에 따라 본 연구는 사전 학습된 고정 모델의 내부 표현을 수정하는 학습 불필요(training-free) 접근법인 '벡터 스티어링'을 탐구합니다. 기존 방식(CoCoEmo)이 단일 글로벌 강도로 제어되는 분할 불가 벡터를 다루었던 한계를 잔차 강화를 통해 극복합니다.
교사 감독을 통한 잠재 정보 피드백 트랜스포머(LIFT) 사전 학습
기존 트랜스포머 언어 모델은 피드포워드 방식이어서 심층 레이어의 표현이 얕은 레이어로 피드백되지 않으며, 생성 단계 간에 정보가 아래로 전달되는 유일한 경로는 디코딩된 토큰뿐입니다. 이처럼 좁은 채널로 인해 모델은 중간 결과를 불필요하게 재계산하고 대안적 생성을 버려야만 합니다. 본 연구에서는 LIFT(Latent Information Feedback Transformer) 아키텍처와 학습법을 제안하여 사전 학습 단계에서 이러한 병목 현상을 해소합니다.
LongHarness Bench: 긴 문맥 추론을 위한 언어 모델 하네스 스트레스 테스트
언어 모델(LM) 하네스는 추가 연산을 활용하여 초장문 컨텍스트에서도 효과적으로 작동할 수 있도록 지원합니다. 그러나 기존 롱컨텍스트 평가는 하네스 간 정확도가 포화 상태에 이르고 평가 비용도 유사하여 최신 하네스들의 성능을 차별화하기에 한계가 있습니다. 본 논문에서는 롱컨텍스트 하네스의 효과성과 효율성을 종합 평가할 수 있는 벤치마크를 제안하며, 어휘 검색과 의미 매칭을 포함한 다각적 검색 전략을 다룹니다.
라우팅 신호에서 선택적 검토까지: MoE VLM의 시각적 재접지
비전-언어 모델(VLM)은 잘못된 시각적 전제를 그대로 수용하여, 대상 객체가 실제로는 부재함에도 색상·개수·위치·상태에 대한 질문에 잘못 답하는 경향이 있습니다. 본 논문은 이러한 신뢰성 저하 행동을 '대상 부재 접지 실패'로 정의합니다. 기존 탐지기는 주로 생성된 텍스트나 은닉 상태, 불확실성 측정에 의존했지만, 본 연구는 MoE(Mixture-of-Experts) VLM의 내부 라우팅 결정을 활용하여 생성 전에 대상 부재를 선제 감지하는 프레임워크를 최초로 제시합니다.
⚖️ 정책 & 안전 (5/13건)
맥도날드, 버거 가격 책정에 AI 동적 가격제 도입
맥도날드가 미국 전역 및 일부 글로벌 시장의 메뉴 가격 결정을 위해 인공지능을 점점 더 많이 활용하고 있습니다. 이는 본사 수익 증대를 목표로 하지만 고객 이탈 및 반독점 규제 조사의 위험을 안고 있습니다.
챗봇이 복잡한 행정 미로를 풀 수 있을까? 백악관의 본격적인 시험대
새로운 America.gov는 복잡한 정부 행정 절차를 간소화하기 위해 마련되었으나, 대규모 언어 모델(LLM)의 불완전성과 여전한 환각(Hallucination) 위험이 새로운 문제를 일으킬 수 있다는 지적이 나옵니다.
트럼프, 美 연방정부에 AI를 ‘슈퍼 인텔리전스’로 부르도록 명령
도널드 트럼프 미국 대통령이 서명한 행정명령에 따라, 앞으로 미국 행정부의 공식 정책 웹사이트, 정책 문서 및 보도자료에서는 '인공지능(AI)' 대신 '슈퍼 인텔리전스(Super Intelligence)'라는 명칭만 사용하게 됩니다.
Import AI 474: 플라톤적 마인드스페이스; 우주 속 TPU; Zhipu의 외부 RSI 루프 가동
과연 어느 지점에서 LLM의 한계를 넘어서게 될까요?
고정 가중치 모델의 적대적 취약점: 정렬 실패(Misalignment)의 원인
본 글은 (적어도 현재 우리가 이해하고 있는 방식의) 고정 가중치(Fixed-weight) 모델이 a) 개념 공간(concept-space) 내에서 항상 적대적 예제에 취약할 것이며, b) 따라서 충분한 최적화 압력이 주어질 경우 정렬(alignment)에 실패할 수밖에 없다고 주장합니다. AI가 어떤 목적을 수행하든 간에 자신의 월드 모델 내에 경계를 설정하여 세계 A와 세계 B를 구분하고 비교해야 합니다.
🎥 영상 & 튜토리얼 (3/9건)
현재 단연 최고로 꼽히는 코딩 모델
Claude Opus 5.5는 현재 활용 가능한 최고의 코딩 모델일 수 있습니다. Megabonk 게임 테스트를 약 20시간 동안 연속 실행해 본 결과는 가히 놀라웠습니다. 가성비 또한 뛰어납니다. Pro, Max, Team, Enterprise 플랜에서 지원되며 월 20달러의 Pro 플랜부터 사용할 수 있습니다. API 비용은 입력 백만 토큰당 4달러, 출력 백만 토큰당 20달러로, 이 정도 수준의 장기 코딩 성능을 감안하면 파격적입니다.
완전히 통제 불능이 된 DHH... (선 넘은 DHH)
CodeRabbit Triage는 팀의 모든 풀 리퀘스트 우선순위를 대신 정해줍니다. 무료 체험: https://coderabbit.link/fireship-014. DHH가 1,200명의 Rails 개발자들 앞에서 직접 손으로 코드를 작성하는 시대는 끝났다고 말했습니다. 그렇다면 현재 실제로 갖출 가치가 있는 프로그래밍 역량은 무엇인지 확인해 봅니다. Fireship 더 보기: 🗞️ 뉴스레터: https://bytes.dev 🧠 강의: https://fireship.dev
Claude Opus 5.5: 비약적인 성능 도약을 이뤄내다
Anthropic의 Claude Opus 5.5 관련 최신 기술 분석입니다. 복잡한 물리 시뮬레이션 및 다족 보행 생명체 실험, 점성 유체 코일링 연구 등 고난도 장기 실행 과제에서 보여준 탁월한 코드 구현력과 추론 성능의 도약을 살펴봅니다.