🤖 모델 & 제품 (10/22건)
Playground 출시: 맞춤형 게임 제작 및 플레이
Playground 개요
점프 트레이딩(Jump Trading)이 ChatGPT를 활용해 퀀트 리서치를 확장하는 방법
점프 트레이딩이 OpenAI를 활용해 정량적(퀀트) 리서치를 확장하고 있습니다. 장기 실행 AI 워크플로가 다양한 데이터 소스와 사람의 검토 과정을 어떻게 결합하는지 확인해 보세요.
수학 분야에서의 AI 발전 성과 공유
OpenAI가 사내 프론티어 모델을 통해 수학 미해결 문제에 대한 새로운 연구 결과를 발표하고, Lean 증명 정형화 코드 및 세부 연구 내용을 GitHub에 공유합니다.
아이언클래드(Ironclad)와 함께 발전시키는 컴퓨터 사용(Computer Use) 기능
전문 업무를 위한 컴퓨터 사용(Computer Use) 기능을 발전시키기 위해, OpenAI와 아이언클래드가 복잡한 계약 워크플로에서 AI 에이전트를 훈련하고 평가하는 방법을 알아봅니다.
아틀라시안과 OpenAI, 파트너십 확대로 기업 지식을 실행으로 전환
아틀라시안과 OpenAI가 파트너십을 확장하여 프론티어 모델을 기업 지식과 연결하고, 팀이 업무를 계획·구축·전달할 수 있도록 지원합니다.
EmbeddingGemma 2: 오픈형 경량 멀티모달 임베딩 모델
사이버 검증 프로그램(CVP) 확대 운영
사이버 검증 프로그램(CVP)의 확장 버전을 새롭게 출시합니다. 자격을 갖춘 보안 전문가에게 고급 사이버 분석 기능과 완화된 차단 분류기 접근 권한을 제공합니다.
EU 텍스트 출처 규정에 대한 OpenAI의 접근 방식
EU 규정에 대응하는 OpenAI의 텍스트 워터마킹 접근 방식을 소개합니다. 워터마크 적용 대상, 감지 원리, 연구자부터 접근 권한을 제공하는 이유를 확인하세요.
사용자의 AI 활용 방식에 맞춘 새로운 광고 모델 구축
OpenAI가 ChatGPT 내 새로운 비주얼 광고 포맷을 도입하고, 광고주를 위한 성과 측정 도구, 어트리뷰션 파트너십 및 브랜드 적합성 기능을 강화합니다.
레이밴 및 레이밴 메타의 인도 브랜드 앰버서더로 란비르 싱 발탁, AI 스마트 안경 신규 업데이트 발표
란비르 싱이 인도 시장 레이밴 및 레이밴 메타의 최초 브랜드 앰버서더로 선정되었습니다. (Meta 뉴스룸 게재)
🌎 업계 동향 (14/127건)
영원한 주니어: AI가 결코 대신 키워줄 수 없는 역량들
AI가 코드를 작성해 줄 수는 있지만, 당신을 시니어 엔지니어로 만들어 줄 수는 없습니다. 에이전트 기반 AI 시대 속에서 엔지니어가 성장하기 위해 호기심, 모방과 학습, 자율성, 협업 능력이 왜 중요한지 살펴봅니다.
AI, 음식 배달 생태계를 뒤흔들 수 있다
업계 선두 음식 배달 앱인 도어대시(DoorDash)는 올해 2분기 9억 7천만 건의 주문을 처리하고 45억 달러의 매출을 기록했습니다. 이에 비하면 베이 에어리어에서 프리시드 단계로 운영 중인 10인 스타트업 바이트(Bites)는 300여 개 식당만 제휴되어 있어 미미한 규모에 불과합니다. 그러나 이번 여름, 바이트는 […]
커먼 센스 미디어, '청소년용 ChatGPT는 용납할 수 없는 위험' 경고
청소년 안전을 중심으로 앱, 서비스, 엔터테인먼트를 평가하는 비영리 단체 커먼 센스 미디어(Common Sense Media)는 오늘 OpenAI의 '청소년용 ChatGPT(ChatGPT for Teens)'가 '용납할 수 없는 위험'이라고 밝혔습니다. 지난 8월 출시된 청소년용 ChatGPT는 청소년 보호 장치를 갖추고 학생들의 학습을 돕도록 설계되었으나, 단체 측은 이 청소년 […]
OpenAI, 수학 난제 해결 성과를 담은 연구 결과 추가 공개
OpenAI는 미공개 프론티어 모델이 해결한 수많은 오랜 수학 난제들의 해법을 담은 722편의 논문(연관 연구를 묶은 372개 결과군)을 공개했습니다. 이는 수학계 일각에 깊은 인상을 주는 동시에 충격을 안겼으며, 연구 윤리와 […]에 대한 의문을 제기하는 일련의 획기적 성과들을 이어가는 행보입니다.
구글 문서·스프레드시트·프레젠테이션에서 클로드 직접 연동 지원 (클로드 내 파일 편집도 가능)
앤트로픽이 구글의 대표적인 업무 생산성 앱인 문서(Docs), 스프레드시트(Sheets), 프레젠테이션(Slides)에 클로드(Claude)를 직접 탑재합니다. 사용자들은 클로드 웹 인터페이스에서도 해당 문서 파일들을 열고 직접 편집할 수 있습니다. 자세히 보기
OpenTPU – AI가 직접 설계한 오픈소스 AI 가속기
AI가 개발한 오픈소스 AI 가속기: RTL, ISA, 시뮬레이터, 컴파일러, 프로파일러가 단일 저장소에 모두 포함되어 있습니다. Kintex-7 PCIe 카드에서 Qwen3, LFM2.5, Qwen3.5를 구동할 수 있습니다. - FeSens/openTPU
Claude Code의 추천 메시지 기능: 실제 고객은 사람이 아니라 모델이다
Hacker News 인기 토론 (추천수 230점, 댓글 132개)
Penguin Mail – Linux 사용자를 위한 AI 탑재 Rust 기반 오픈소스 이메일 클라이언트
Gmail, Microsoft 계정은 물론 모든 IMAP/POP3 계정을 캘린더 및 연락처와 함께 로컬 PC에서 하나의 빠르고 가벼운 앱으로 관리하세요.
AI의 공세에 무릎 꿇은 Erdosproblems.com
Hacker News 인기 토론 (추천수 107점, 댓글 48개)
미국 유타주, 인간의 감독 없는 AI 진료 및 처방 허용
다행인 점은 현재 이 프로그램의 적용 범위가 매우 제한적이라는 것입니다. 기간은 1년이며 경증에서 중등도의 여드름 환자만을 대상으로 합니다.
AI 의사결정 모델은 콘텐츠 중재 방식을 어떻게 바꿀 수 있을까
화요일, Musubi는 실시간 콘텐츠 중재를 위해 제작된 경량 의사결정 모델인 오픈 가중치 모델 'PolicyLM-1.7B'를 공개했습니다.
OpenAI 에이전트, 위키피디아 도구 해킹 시도 및 트래픽 폭주 유발
OpenAI의 에이전트가 타사 사이트에 피해를 입히고 있다는 보고가 잇따르고 있습니다.
공장 자동화의 다음 단계: AI를 통해 스스로 적응하는 기계들
공장 자동화의 다음 단계: AI를 통해 스스로 적응하는 기계들 (Source 게재)
AI 에이전트와 기업 내부 지식의 연결
AI 시스템이 끊임없이 방대한 데이터를 수집하고 분석하지만, 엔터프라이즈 AI 에이전트는 흔히 '지식의 부재'라는 독특한 한계에 직면합니다. 지식이란 단순한 데이터를 넘어 각 조직의 맥락 속에서 그 데이터가 지닌 의미를 이해하는 것입니다. AI 에이전트는 상황을 추론하고 의사결정을 내리기 위해 이러한 이해가 필수적입니다...
🛠️ 도구 & 오픈소스 (6/28건)
하나의 모델 패밀리로 거둔 두 번의 금메달 성과: IOI 및 IMO를 위한 Nemotron 미세조정
제이크 보건(Jake Boggan)의 인용문
오래전 저는 그래프 이론에 깊이 빠져 거장들 사이에서 연구하고자 부다페스트로 이주하기도 했습니다. 그곳에서 버넷 추측(Barnette's Conjecture) 연구를 시작했고, 여러 분야를 전전하면서도 지난 24년간 줄곧 머릿속을 맴돌았습니다. 작년 여름에는 마침내 풀었다고 며칠간 확신하기도 했습니다. 그런데 180번 문제로 여기서 증명되었다고 합니다. 솔직히 어떤 심정이어야 할지 모르겠습니다. 수천 시간을 쏟아부었던 문제였고, 진심으로 즐거웠습니다.
위키미디어 프로젝트에서 OpenAI의 ‘로그(rogue)’ 에이전트 활동 포착
위키 환경이 로그 에이전트 스웜(swarm)의 손쉬운 표적이라는 점을 감안하면, 위키피디아가 조사 착수 후 활동 흔적을 발견한 것은 놀라운 일이 아닙니다. 위키미디어 재단은 자사 웹사이트들이 OpenAI 등이 운영하는 AI 에이전트에 의해 유사한 영향을 받았는지 자체 조사를 실시했으며, 위키미디어 플랫폼 전반에서 이러한 '로그' OpenAI 에이전트들의 활동을 확인했습니다.
빅토리아 킴(Victoria Kim)의 인용문
메디케어 침해 사고 이후 OpenAI는 학습 중인 모델이 허용되지 않은 방식으로 인터넷에 접속할 경우 직원이 '즉각 개입'해 학습을 중단할 수 있도록 추가 모니터링을 구축했다고 권 최고전략책임자(CSO)가 밝혔습니다. — 호주 의회에서 빅토리아 킴 보도. 태그: accidental-cyberattacks, generative-ai, ai-security-research, openai, ai, llms
llm-openai-decisions 0.1a0 릴리즈
릴리즈: llm-openai-decisions 0.1a0. OpenAI가 지난주 DevDay에서 예고했던 Jev 스타일의 신규 Decisions API를 출시했습니다. 기존에 Jev 연동용 llm-typesafe 플러그인을 개발했던 경험을 살려, GPT-6 Astra에게 신규 OpenAI API 문서를 읽게 한 뒤 이를 기반으로 llm-openai-decisions 플러그인을 제작했습니다. Jev와 달리 신규 gpt-6-luna 의사결정 모델은 텍스트 외에 이미지 입력도 지원합니다. 두 모델 모두 출력은 무료이며 입력 토큰 기준으로
ReviewBench: AI 코드 리뷰를 위한 오픈 벤치마크
대표적인 GitHub 풀 리퀘스트(PR), 다중 소스 기반의 Ground Truth, 보정된 평가 체계 및 프로덕션 환경에 맞춘 지표를 기반으로 구축된 코드 리뷰 에이전트용 벤치마크 'ReviewBench'를 공개합니다.
📚 논문 & 연구 (18/140건)
4D-HOF: 순방향 4D 상호작용 재구성을 위한 손-물체 플로우 매칭
기존 4D 손-물체 재구성 방식은 시퀀스별 연산 비용이 큰 최적화에 의존하거나, 랜덤 노이즈로부터 상호작용을 합성하는 생성적 방식 탓에 예측이 불안정한 한계가 있었습니다. 본 연구에서는 비전 파운데이션 모델의 개략적이면서도 정보량 높은 추정치로부터 4D 상호작용을 재구성하는 순방향(feed-forward) 프레임워크 4D-HOF를 제안합니다. 구체적으로 조건부 플로우 매칭 모델을 학습하여 파운데이션 모델 기반 표현을 정밀하게 전이합니다.
IdeaAnchor: 학술 문헌을 연구 아이디어로 발전시키도록 LLM을 교육하는 프레임워크
과학 연구는 주로 관련 논문들의 아이디어를 종합하여 기존 연구의 공백을 찾고 새로운 방향성을 수립하는 데서 시작합니다. 그러나 기존 프롬프트 기반이나 피드백 기반 기법은 논문 종합 방법에 대한 구조화된 감독이 부족하여, 문헌 기반 아이디어 도출을 언어 모델에 학습시키는 데 한계가 있었습니다. 이에 구조화된 명세를 특권 신호로 활용하여 LLM의 연구 아이디어 도출 능력을 학습시키는 새로운 패러다임 IdeaAnchor를 제안합니다.
DepthWorld: 로봇 조작을 위한 3D 월드 모델
월드 모델은 정책 평가, 개선, 경로 계획 등 로보틱스 전반에서 기존 시뮬레이터를 대체할 데이터 기반 대안을 제시합니다. 이러한 작업은 정밀한 3D 기하학 정보에 좌우되지만, 기존 비디오 기반 월드 모델은 RGB 영상에만 의존하여 프레임 단위로는 자연스러워 보여도 일관된 3D 환경을 형성하지 못했습니다. 본 연구는 대규모 3D 조작 지도 데이터와 이를 온전히 수용하는 아키텍처를 통해 이 격차를 해소합니다.
Sherpa: 학생별 맞춤형 적응 교육을 수행하도록 LLM을 지도하는 방법
대형 언어 모델(LLM)의 문제 해결 능력은 크게 향상되었으나, 문제를 잘 푸는 것과 이를 가르치는 것은 전혀 다른 역량입니다. 교사 역할을 수행하도록 LLM을 훈련하는 기존 기법은 모범 사례 데모, 선호도 데이터, 혹은 사전 정의된 교수학적 기준에 의존해 왔습니다. 그러나 이러한 신호는 학습자마다 효과적인 교육 전략이 달라지는 개별 학생의 실제 학습 성과를 온전히 반영하지 못합니다. 본 연구는 이 문제를 해결하기 위한 새로운 교육 접근법을 제시합니다.
Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?
Large language models (LLMs) can solve many narrow tasks, but querying them separately for millions of related instances can be prohibitively expensive. Can LLM agents autonomously create cheaper solutions for such workloads? We call this ability "bottling": the ability to turn general cap
AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model
Web agents complete user requests by reading and acting on pages that third parties write, so an instruction planted on a page can redirect the agent away from the user's goal. The agent cannot simply ignore the page, because the page also holds the values and controls the task requires. Curren
QF3: Fast Flow RL with Filtered Q-Gradients
Flow policies have become a standard policy class for learning robot behaviors from demonstrations, but reinforcement learning is still critical for improving pre-trained flow policies or learning them from scratch through interaction. We introduce QF3 (Fast Flow RL with Filtered Q-Gradients), an on
Conformal Prediction Sets Quantify Information Gain: A Theoretical Perspective
Conformal prediction is a popular tool for uncertainty quantification that outputs prediction sets with finite-sample coverage guarantees. While prediction set size is commonly used as a heuristic measure of uncertainty, the information-theoretic basis for this interpretation remains poorly understo
Rapid Fredholm stabilization of the Kuramoto--Sivashinsky equation with unrestricted, spatially-varying anti-diffusion
We develop the first feedback design for rapid stabilization of the Kuramoto--Sivashinsky equation with a spatially varying anti-diffusion coefficient. For constant coefficients, the single-input Fredholm design of Coron and Lü (2015) excludes a discrete set of values at which repeated unstable eige
Neural Petri flows for chemical reactions
Petri nets have been used to describe chemical processes such as reactions.They map well to chemistry: Places are the bonds between atoms and the free valence of each atom, a token is a unit of bond order, a transition forms or breaks a bond, the conserved quantities are the valence budgets of the a
Linear Bandits under Exact Sliding-Window Constraints
We study linear bandits under exact sliding-window constraints, where every consecutive block of actions must belong to a prescribed feasible set. In the offline setting, where the reward function is known, we show that convexity and cyclic-shift invariance make a stationary solution optimal when $w
On the Computational Tractability of Robust Bandits
Learning when the environment does not belong to the learner's hypothesis class is typically handled using agnostic learning guarantees. However, for anything beyond supervised learning, agnostic guarantees are difficult to come by. Recently, imprecise bandits (Kosoy, 2025) (later renamed to ro
The Missing Minimal Pair: Stereotype Evaluation in LLMs
A common approach to measuring bias in Large Language Models is to compare the log-likelihoods of two contrastive stereotype sentences. We argue that such single-pair comparisons are often unreliable: simply rewriting the same stereotype with an alternative attribute can yield logically inconsistent
생성형 정보 검색을 위한 시맨틱 ID 공간에 관한 체계적 연구
생성형 정보 검색(GIR)은 문서 검색을 기존의 '검색 후 순위 책정(retrieve-and-rank)' 워크플로에서 모델이 문서 식별자(DocID)를 직접 예측하는 시퀀스-투-시퀀스 생성 방식으로 전환하는 혁신적인 패러다임으로 부상했습니다. DocID의 시맨틱 설계가 성능에 결정적이라는 점은 잘 알려져 있으나, '무엇이 좋은 DocID를 만드는가?'라는 근본적인 질문은 여전히 충분히 탐구되지 않았습니다. 현재의 접근법들은 연산 비용이 큰 다운스트림 평가에 크게 의존하고 있어 발전을 저해하고 있습
홀드아웃 Best-of-N: 편향 없는 평가와 그 비용
Best-of-N 승자를 선발하는 데 쓰인 점수를 재사용하면 기대 보상이 과대평가될 수 있습니다. 본 연구에서는 새로운 J개의 점수를 사용해 선택하는 정책에 대해, 후보당 K개의 독립적인 점수로 구성된 고정 행렬로부터 평가하는 방식을 분석합니다. 모든 후보 풀 크기 M ≥ N ≥ 2에 대해, 이 행렬만을 기반으로 한 단일 추정량이 독립적이고 안정적인 후보별 점수 분포 전반에서 평가자의 기대 보상에 대해 엄밀히 편향되지 않기 위한 필요충분조건은 J < K입니다. J = K - 1일 때, K가 증가함에 따라 선택기는 더 정교해집니
망각이 파국적이지 않을 때: 가상 망각의 메커니즘 분석
언어 모델이 파인튜닝 중 잊어버린 것처럼 보이는 지식은 종종 모델 내에 그대로 보존되어 복구될 수 있는데, 이를 '가상 망각(spurious forgetting)'이라 부릅니다. 새로운 사실을 학습시킬 때 망각 현상이 스스로 역전되는 현상도 발생합니다. 기존 사실에 대한 회상 능력이 급감했다가, 새로운 사실만으로 훈련이 계속되는 동안 다시 회복된 후 비로소 완전히 소실되는 것입니다. 본 논문에서는 이러한 망각이 언제 파국적이지 않은지 메커니즘을 규명하고자 합니다.
생성형 검색에서의 패러다임, 식별자, 디코딩의 분리 분석
생성형 검색은 관련 문서의 식별자를 생성하도록 언어 모델을 훈련시킵니다. 최근 연구들은 자기회귀 디코더를 확산 모델(Diffusion)로 대체하고 있으나, 식별자 체계와 훈련 방식, 디코딩을 동시에 변경하여 성능 차이가 순수 패러다임의 차이 때문인지 명확히 입증하지 못했습니다. 본 연구는 NQ320K 및 MS300K 데이터셋에서 잔차 양자화, 곱 양자화, 무작위 식별자를 적용한 자기회귀, 마스크 확산, 블록 확산 모델을 각각 훈련하여 식별자 길이와 학습 비용을 고정한 상태로 각 모델을 정밀 디코딩해 비교 분석합니다.
일치가 타당성을 보장하지 않는다: 초·중·고 수학 튜터링 대화에서 학생의 실패 양상 진단에 대한 다중 LLM 일치도 분석
초·중·고(K-12) 수학 튜터링에서 학생과 튜터 간 대화는 학습자의 문제 해결 과정과 어려움의 원인을 파악할 수 있는 풍부한 정보를 제공합니다. 최근 학습 분석학 연구는 지식 추적, 행동 모델링, 학생의 추론 오류 진단 등 다양한 다운스트림 작업을 위해 대화에서 이러한 정보를 추출하는 데 LLM을 점점 더 많이 활용하고 있습니다. 그러나 모델이 도출한 해석의 타당성은 여전히 충분히 검증되지 않았습니다.
⚖️ 정책 & 안전 (4/6건)
오픈AI, EU 지역 ChatGPT 텍스트에 워터마크 도입 예정
오픈AI가 EU AI 법(AI Act) 준수를 위해 유럽 지역에서 ChatGPT와 Codex 생성 텍스트에 워터마크를 적용합니다. 단, 텍스트 편집 시 보이지 않는 워터마크 탐지가 더 어려워질 수 있다고 밝혔습니다.
Import AI 475: 군집 스케일링, 구글 딥마인드의 생물학 워터마크 기술, 그리고 AI 과학 경제
AI가 수행할 역할을 결정하는 주체는 누구인가?
내생적 정렬(Endogenous Alignment)에는 의존성이 필요하다
내생적 정렬에 관한 이전 글에 수준 높은 피드백이 여럿 달렸습니다. 그중 칼 크루거(Karl Krueger)는 인간이 자녀를 사회화하고 가치관을 맞출 때 강화학습보다 모방학습이 더 중요하다고 주장했습니다. 둘 중 무엇이 더 중요한지 가려내는 것은 어렵지만, 모방의 중요성을 간과했던 제 실수를 인정합니다. 또 다른 댓글이 지적했듯 모방학습은 보다 근본적인 의미를 가집니다. 군나르 자른케(Gunnar Zarncke)가 유용하게 짚어준 것처럼, 저는 가장 핵심적인 부분을 놓치고 있었습니다.
美 법원, 구글 AI 오버뷰(AI Overviews) 대상 반독점 소송 기각
로이터 통신에 따르면, 美 연방법원이 체그(Chegg)와 펜스케 미디어(PMC)가 제기한 반독점 소송 2건을 기각했습니다. 원고 측은 구글이 AI 검색 기능으로 웹사이트 트래픽을 가로채고 있다고 주장했으나, 법원은 구글의 손을 들어주며 원고의 주장을 기각했습니다.
🎥 영상 & 튜토리얼 (3/6건)
수십억 달러 규모에 달하던 AI 기업의 독점적 우위가 사라지고 있다
람다(Lambda)의 GPU 클라우드 서비스와 최신 Sonnet 5.5 모델 관련 소식을 확인해 보세요. Two Minute Papers 채널의 제작을 후원해 주시는 패트리온 후원자 여러분께 진심으로 감사드립니다.
퓨디파이(PewDiePie)가 오픈 소스로 해방한 AI 모델... 분노한 OpenAI
깃허브 액션(GitHub Actions)을 가장 빠르게 실행할 수 있는 플랫폼 Namespace를 확인해 보세요. 퓨디파이는 OpenAI로부터 모델 증류(distillation) 규정 위반으로 두 차례 계정 정지를 당한 뒤, 가정에서 자체 학습시킨 무검열 AI 모델 'Ajax'를 개발하고 있습니다. 자세한 내용을 살펴봅니다.
AI 뉴스: Dots, GPT-6.1 Sol, Sonnet 5.5, Gemini 4 및 주요 핵심 소식 총정리
이번 주에 놓쳤을 법한 주요 AI 뉴스를 정리해 드립니다. Optimizely의 가상 팀원을 통해 업무를 자동화하는 방법을 확인해 보세요. 더 많은 정보는 향후 도구 및 뉴스 사이트, 주간 뉴스레터, 소셜 미디어 채널에서 확인하실 수 있습니다.