🤖 모델 & 제품 (12/22건)
GPT-6 제품군 모델 가이드
스타트업이 GPT-6 모델을 선택하고, 추론 강도를 조정하며, 프롬프트와 스킬을 개선하고, 도구를 조율하여 프로덕션 워크플로우를 준비하는 방법을 알아보세요.
채텀 파이낸셜, OpenAI로 자본 시장 전문성 확장
채텀 파이낸셜은 Codex와 GPT-5.6을 활용해 기술을 구축하고 워크플로우를 재설계함으로써 거래 검증 시간을 30분에서 4분 미만으로 단축했습니다.
2026년 9월 발표된 주요 AI 뉴스 요약
9월 AI 업데이트 소식을 담은 동영상
Claude Frontier Academy: 1,000억 원 규모 투자로 1만 명의 엔지니어 양성
Anthropic 자체 수준에 맞춘 프론티어 배포 엔지니어(Frontier Deployed Engineers)를 육성하는 'Claude Frontier Academy'가 출범합니다. 2027년 말까지 1억 달러(약 1,300억 원)를 투입해 10,000명의 엔지니어를 양성할 계획입니다.
영원한 보완재
고급 AI는 혁신적인 아이디어 이면의 일상적인 작업에서 가장 중요한 역할을 할 수 있습니다. 실행력이 어떻게 다음 경제 구조와 발전 속도를 좌우할 수 있는지 살펴보세요.
앨버트슨, 내부에서부터 리테일을 재구성하는 방법
앨버트슨은 ChatGPT Enterprise와 OpenAI API를 활용해 팀의 업무 속도를 높이고 수백만 고객의 식료품 쇼핑을 더욱 편리하게 만들고 있습니다.
소셜 클럽 더 덴, ChatGPT Work로 매주 10~15시간을 확보해 성장 가속화
새 지점을 오픈 중인 이 소셜 클럽은 보조금 신청 준비 시간을 3일에서 2시간으로, 주류 판매 면허 서류 작업을 4일에서 3시간으로 단축했습니다.
바클레이스, Claude 전면 도입으로 운영 효율화 및 고객 경험 혁신 추진
영국계 글로벌 유니버설 은행 바클레이스(Barclays)가 Anthropic과의 전략적 협업을 확대하여, 글로벌 운영 전반에 안전한 엔터프라이즈급 AI 시스템을 통합 구축합니다.
조직적인 모델 지식 증류(Distillation) 공격 무력화
OpenAI가 보호 대상인 모델 추론 데이터를 무단 추출하려는 시도를 어떻게 차단했는지, 그리고 적대적 증류 공격에 맞서 방어 체계를 어떻게 강화하고 있는지 알아보세요.
Gemini 4 Argon: 프론티어 인텔리전스의 다음 세대를 열다
SynthID Bio 소개
생물학적 기능을 유지하면서 AI가 생성한 단백질에 워터마크를 삽입하는 개념 증명(PoC) 기술을 소개합니다.
팀 봇(Team Bots): 업무를 수행하며 함께 학습하는 공유형 AI 동료
Grok Bot에 필요한 파일, 앱, 전문 지식을 연동한 후 팀원들과 공유해 보세요. 팀 전체가 동일한 맥락(Context)을 바탕으로 원활하게 협업할 수 있습니다.
🌎 업계 동향 (14/136건)
Show HN: macOS 내 모든 사진과 동영상 프레임을 검색하는 AI
macOS의 모든 폴더 내 사진과 동영상 프레임을 심층 검색하는 AI - allenv0/SCM
Homa: AI 클러스터에서 TCP의 종말을 알리다 [영상]
Hacker News (추천 50개, 댓글 17개)
AI를 활용해 의도, 품질, 예술성을 확장하는 방법 [영상]
Hacker News (추천 47개, 댓글 13개)
AI 시대, 순수 수학 연구의 미래는?
스티븐 울프럼(Stephen Wolfram)이 언어 개발자이자 과학 연구자라는 독보적인 관점을 바탕으로 순수 수학과 AI의 미래에 대한 견해를 전합니다.
구글, AI 생성 제출물 ‘급증’으로 오픈소스 버그 바운티 프로그램 일시 중단
저품질 AI 제출물(AI slop)이 버그 바운티 프로그램을 뒤덮고 있는 것으로 보입니다.
‘초지능’ 명칭과 구속력 없는 안전 협약이 AI의 이미지 문제를 해결할 수 있을까?
팟캐스트 Equity에서 트럼프 행정부의 AI 이미지 쇄신(리브랜딩) 시도에 대해 논의했습니다.
전 뉴저지 부지사, 성희롱 무죄 주장 위해 AI 활용 논란
데일 콜드웰 전 뉴저지 부지사는 직원에 대한 성희롱 및 반복적인 윤리 규정 위반 조사 결과가 발표된 후 지난 9월 25일 사임했습니다. 그는 자신의 결백을 주장하기 위해 여러 언론 인터뷰를 진행하고 있으나, 최근 NJ 인터뷰 중 다소 기이한 방식을 활용해 논란이 되고 있습니다.
인간을 이기지 못한 스타크래프트 AI, 결국 치트 사용해
StarSkirmish는 AI가 개발한 스타크래프트 봇끼리, 혹은 사람이 만든 봇과 대결을 펼치는 대회입니다. OpenAI의 GPT-6 Astra와 Claude Opus 5.5는 AI 제작 봇 중 최상위 성능을 기록하며 대등한 모습을 보였으나, 인간이 제작한 최고 랭킹 봇 Stardust를 꺾지 못했습니다. 보도에 따르면 금요일 대결 도중 황당한 일이 발생했습니다.
ServiceNow용 AI 에이전트 구축기: 실제 문제는 로드맵보다 좁은 영역에 있었다
ITSM 플랫폼에는 데이터가 항상 풍부했지만 카탈로그 구축, 라이선스 해석, CMDB 상태 유지 관리에도 불구하고 데이터가 시사하는 바와 후속 조치를 파악하기란 쉽지 않았습니다.
망가진 조직 문화 때문에 OpenAI를 떠났습니다
해커 뉴스 (추천 315점, 댓글 550개)
Claude 및 Claude Code에서 Opus 5.5 최대한 활용하기
Claude 앱 및 Claude Code에서 Opus 5.5 프롬프트를 작성하고 장기 실행 작업을 조율하며 결과를 확인하는 방법.
애플, AI 에이전트의 남용 방지 위해 전체 디스크 접근 권한 정책 개편
메타는 뮤즈의 메시지 열람을 위해 기본 전체 디스크 접근(FDA) 권한 이상의 설정이 필요 없다고 주장하지만, 애플은 이에 반대되는 입장을 취하고 있습니다.
마이크로소프트 디지털 방어 보고서: AI가 사이버 보안 환경을 어떻게 재편하고 있는가
마이크로소프트 디지털 방어 보고서: AI가 사이버 보안 환경을 어떻게 재편하고 있는가에 대한 소식입니다.
자율형 AI로 엔터프라이즈 인텔리전스를 재정의하다
엔터프라이즈 AI는 더 이상 미래의 야망이 아닙니다. 이미 전면적인 운영 단계에 진입했습니다. 모델 역량은 대부분의 조직이 수용할 수 있는 속도보다 빠르게 발전하고 있으며, 성능 대비 비용은 지속적으로 하락하고 있습니다. 전 세계적으로 AI 투자는 2026년 전년 대비 44% 증가한 2조 5천억 달러에 달할 전망입니다. 많은 기업들에게 이러한 투자는...
🛠️ 도구 & 오픈소스 (3/25건)
앞으로 거의 모든 서비스에 강력한 기본 예산 상한선(Hard Budget Cap)이 필수적인 이유
향후 몇 달, 몇 년간 기술 생태계에 절실히 필요한 제품 기능이 있습니다. 바로 기본으로 적용되는 엄격한 예산 상한(Hard budget cap)입니다. 사용량 기반 결제 서비스나 API에서 '월 $X를 초과하면 즉시 차단하고 에러를 반환'하도록 설정할 수 있는 기능을 말합니다. 이는 이메일 경고를 보내는 정도의 소프트 한도로는 부족하며 강력한 차단선이어야 합니다. 코딩 에이전트와 친숙한 UI를 입힌 개인용 에이전트의 등장으로 자원 생성 장벽이 크게 낮아졌기 때문입니다.
에이전트는 완료했다고 했지만, 데이터베이스의 기록은 달랐다
AI가 개발자의 업무를 바꾸고 있습니다: 강화해야 할 세 가지 핵심 역량
AI 에이전트를 지휘하고 결과물을 비판적으로 검토하며 기술적 판단력을 워크플로의 중심에 두는 방법을 소개합니다. 원문은 GitHub 공식 블로그에 게재되었습니다.
📚 논문 & 연구 (18/84건)
One Basis to Animate Them All: 실시간 아바타를 위한 가우시안 블렌드셰이프 증류 기법
3D 가우시안 아바타는 빠른 렌더링을 지원하지만, 높은 신경망 추론 비용으로 인해 실시간 애니메이션 구현에 한계가 있었습니다. 본 연구에서는 이러한 병목 현상을 해결하며, 사전 학습된 아바타 모델의 움직임이 신원 무관 블렌드셰이프의 선형 결합으로 근사될 수 있음을 증명합니다. 이를 기반으로 프레임별 무거운 신경망 디코딩을 얕은 계수 예측기로 대체하는 증류 기법인 GALA(Gaussian Animation via Linear Approximation)를 제안합니다.
KaliBench: Kali Linux 기반 사이버 보안 도구 활용을 위한 세부 벤치마크 및 런타임 독립 검증 가능 보상
분석가의 의도를 도구 실행으로 변환하는 사이버 보안 워크플로우에 LLM 적용이 점차 확대되고 있습니다. 그러나 기존 평가는 지식 기반 평가나 종단간(End-to-End) 에이전트 작업에 치우쳐 있어, 실제 사이버 보안 도구에 대한 실행 가능한 명령어 생성 능력을 직접 측정하지 못했습니다. 보안 운영은 사소한 문법 오류나 잘못된 플래그-값 매핑에도 민감한 엄격한 CLI에 의존하기 때문에 이러한 간극을 해결하는 것이 매우 중요합니다.
Reconstruct, Practice, Go Real: 체화된 에이전트를 위한 유도형 자가 개선 프레임워크
다양한 작업에서 신뢰할 수 있는 로봇 역량을 구축하려면 스킬 개발, 보상 설계, 인식-제어 통합에 막대한 인간의 노력이 필요합니다. 본 연구에서는 모델 가중치 업데이트 없이 로봇 실행 시스템의 자율 개선을 가능케 하는 RPG(Reconstruct, Practice, Go Real) 프레임워크를 제안합니다. RPG는 오프라인 데이터셋에서 조작 능력을 식별하고 시뮬레이션 내 관련 연습 과제를 생성한 뒤, 실행 피드백과 특권 정보를 활용하여 성능을 점진적으로 개선합니다.
ScholarCatalyst: 새로운 연구에 영감을 주는 논문 검색 벤치마크
위대한 과학자들을 탁월하게 만드는 요인은 무엇일까요? AI가 미해결 과제에서 성과를 내기 시작했음에도, 끊임없이 방대해지는 연구 아카이브 속에서 특정 문제 해결에 필요한 과거 아이디어를 포착하는 직관은 여전히 인간 과학자가 크게 앞서 있습니다. 이러한 역량을 연구하기 위해 저자 주석 파이프라인을 자동화 및 확장하여, 실제 프로젝트 완성을 이끈 과거 연구들을 매핑한 벤치마크인 ScholarCatalyst를 구축했습니다.
SILSA: 위상 보존 고해상도 3D 생성을 위한 슬라이딩 윈도우 슬라이스 잠재 표현
고해상도 3D 생성은 복셀 잠재 표현과 활성 구조 예측 후 로컬 지오메트리를 합성하는 다단계 파이프라인에 의존하는 추세입니다. 그러나 이 방식은 연속적인 표면을 수많은 로컬 토큰으로 분할하여 생성 비용을 높이고, 얇거나 복잡하게 연결된 형상의 위상학적 일관성을 저해합니다. 본 논문에서는 컴팩트한 슬라이딩 윈도우 슬라이스 잠재 표현을 통해 형태를 나타내는 위상 인식 3D 생성 프레임워크 SILSA를 제안합니다.
VISTA: 대화형 환경에서의 추론을 위한 시각적 하네스
본 연구는 멀티모달 모델이 뛰어난 추론 능력을 갖추고 있으며, 적절한 하네스(Harness) 설계를 통해 다양한 상호작용 환경에서 그 잠재력을 극대화할 수 있음을 입증합니다. 범용 멀티모달 모델에 장기적 시각 시야를 부여하는 시각 하네스 VISTA를 소개합니다. VISTA를 통해 모델은 시각적 관측으로 환경을 직접 인지하며, 과거 관측을 원형 그대로 보존하는 무손실 시각 메모리를 유지하여 필요 시 능동적으로 정보를 검색·활용할 수 있습니다.
임베딩 예측을 통한 이미지 생성 성능 향상
디퓨전 트랜스포머(Diffusion Transformer)에서는 클래스 레이블이나 텍스트 프롬프트를 한 번 임베딩한 후 모든 노이즈 제거(denoising) 단계에서 동일한 조건을 재사용합니다. 본 연구는 예측된 임베딩이 이러한 조건을 대신할 수 있는지 탐구합니다. 차세대 임베딩 예측 자기회귀(NEPA)는 시퀀스에서 다음 연속 임베딩을 예측하도록 트랜스포머를 학습시킵니다. 생성 과정에서 깨끗한 이미지는 노이즈가 있는 이미지 뒤에 위치하므로, 조건 및 노이즈 이미지 다음의 임베딩을 예측하도록 NEPA 모델을 훈련하여 성능을 높입니다.
TACO: LLM 파인튜닝을 위한 3진수 절대최댓값 열별 1-희소 옵티마이저
대규모 언어 모델(LLM)의 풀 파라미터 파인튜닝은 옵티마이저 상태 메모리 오버헤드가 커 최신 GPU에 올릴 수 있는 모델 크기를 제한합니다. 기존 접근 방식들은 옵티마이저 상태를 압축하거나 1차 그래디언트를 포기하거나, 밀집 상태를 유지하면서 업데이트 구조를 변경했습니다. 최근 도입된 Muon 옵티마이저는 행렬 값 업데이트를 통해 메모리를 줄였으나, AdamW와 업데이트 구조가 달라 AdamW로 사전학습된 모델의 파인튜닝 시 성능 저하를 유발할 수 있습니다.
그래프 상의 비용 증강 슈뢰딩거 브릿지의 엄밀해: 학습된 제어를 대체하는 파인만-카츠 틸트
그래프 상의 일반화된 슈뢰딩거 브릿지는 방문한 상태에 비용을 부과하면서 두 분포 간에 질량을 이동시킵니다. 기존에는 시간차(temporal-difference) 페널티로 비용을 복원하며 제어된 연속시간 마르코프 연쇄의 전이율을 학습하는 방식으로 접근했습니다. 본 연구에서는 상태 비용이 파인만-카츠(Feynman-Kac) 틸트를 통해 참조 과정에 자연스럽게 통합됨을 밝힙니다. 이를 통해 비용 증강 브릿지는 틸트된 참조 과정에 대한 표준 브릿지가 되며 페널티가 불필요해져 교대 계산으로 엄밀해를 구할 수 있습니다.
사라진 원시 개념: 대규모 언어 모델의 수학적 추론 진단 및 복구
대규모 언어 모델(LLM)이 최첨단 수학 문제에서 눈부신 역량을 보여주고 있지만, 해결 과정의 바탕이 되는 구조적 수학 이해를 실제로 갖추고 있는지는 여전히 불분명합니다. 본 논문에서는 LLM의 구별되는 능력을 진단하는 것부터 이러한 발견을 사후 학습(post-training) 개선에 활용하기까지, LLM의 수학적 이해를 체계적으로 연구하는 첫걸음을 내딛습니다. 먼저 구조적 수학 역량을 검증하기 위해 '수학적 원시 개념(Mathematical Primitive)'을 도입합니다.
방향은 신뢰하고 보폭은 탐색하라: LLM 파인튜닝을 위한 0차 및 1차 결합 최적화 기법
학습 보폭(step-size) 결정은 대규모 신경망 최적화의 핵심 과제로, 너무 보수적이면 수렴이 느려지고 과도하면 불안정해집니다. 본 연구는 0차 및 1차 최적화(ZFO)를 결합하여 이동 방향 선택과 보폭 결정을 분리하는 경량 프레임워크를 제안합니다. ZFO는 신뢰할 수 있는 1차 옵티마이저로 이동 방향을 결정한 뒤, 해당 1차원 부분공간 상에서만 0차 평가를 수행하여 최적의 이동 거리를 결정합니다.
희소 오토인코더 피처 강화를 통한 내재적 무질서 단백질 영역(IDR)의 생성 모델링
내재적 무질서 단백질 영역(IDR)은 전사 조절, 신호 전달, 세포 내 위치 결정 등 주요 세포 작용에서 중추적 역할을 하지만 기능적 설계가 까다롭습니다. 기존 구조 기반 설계 방식은 IDR에 적용하기 어렵고, 기존 단백질 언어 모델은 전체 단백질 서열로 학습되어 접힌 도메인에 편향된 사전 분포를 학습합니다. 이에 본 연구는 자기회귀 단백질 언어 모델인 IDiom을 제안합니다.
모든 절제는 투여량이다: 평형추와 자가 복구 현상의 실체
언어 모델의 특정 구성 요소를 절제(ablation)하면 다른 구성 요소들이 이를 보정하고 적응하는 듯한 현상이 자주 관찰되며, 이를 '자가 복구(self-repair)'라고 부릅니다. 이 현상은 반복적으로 관찰되었으나 메커니즘은 명확하지 않았습니다. 지금까지의 가장 체계적인 연구는 자가 복구가 불규칙하며 단일 원인으로 설명하기 어렵다고 결론지었습니다. 그러나 본 논문은 절제 이전부터 이미 존재하던 이득(gain)이라는 명확한 원인이 있음을 규명합니다.
AutoCompact: 장기 코딩 에이전트의 컨텍스트 압축 시점 학습
코딩 에이전트는 코드 검사, 검색, 편집, 테스트로 이어지는 긴 과정을 거쳐 저장소 수준의 소프트웨어 엔지니어링 작업을 수행합니다. 작업이 진행됨에 따라 초기 탐색 정보는 노후화되므로, 컨텍스트 관리는 단순히 오버플로를 방지하는 것을 넘어 언제 압축하고 어떤 작업 상태를 보존하며 어떻게 작업을 이어갈지 결정해야 합니다. 본 연구에서는 코딩 에이전트가 이러한 결정을 자체 정책의 일부로 학습하도록 하는 AutoCompact를 제안합니다.
지식 접근에서 소스 학습으로: 소스 특화 역량 개발
LLM 에이전트는 지식 집약적 작업을 연속으로 해결하기 위해 영구적인 외부 소스에 점점 더 많이 의존하고 있습니다. 기존 연구들은 소스 내용의 접근 및 정리 방식을 개선하고 에이전트 메모리로 이전 상호작용 지식을 보존해 왔지만, 동일한 소스의 반복 사용은 소스에 대한 점진적 이해 증진보다는 여전히 단순한 반복 접근으로 취급됩니다. 본 연구는 재사용 가능한 소스 특화 역량을 구축하는 '소스 학습'을 탐구합니다.
키워드 벤치마크의 오류 개방성: 소형 언어 모델의 도구 사용 검증을 위한 저비용 진단 사다리
키워드 매칭 벤치마크는 소형 언어 모델이 실제로 수행하지 않은 도구 사용에 대해서도 점수를 부여하는 오류를 범할 수 있습니다. 본 연구는 동일 아키텍처 기반의 스페인어 보안 언어 모델 쌍에서 이러한 위양성(false positive)을 입증하고, 엄격하면서도 비용 효율적인 진단 사다리를 제안합니다. 구조와 토크나이저를 공유하는 661.6M 모델과 1,109M 모델은 관대한 평가 지표에서 거의 동일한 점수를 기록했으나 정밀 평가에서는 극명한 차이를 보였습니다.
샘플링 기반 파인튜닝: 지도 미세조정(SFT)의 숨겨진 잠재력
최첨단 모델에 새로운 역량을 부여하는 것은 사후 학습의 오랜 목표였으며, 주로 지도 미세조정(SFT)과 강화학습(RL)이 활용되어 왔습니다. 전통적인 통념에 따르면 RL은 기존 역량을 유지하면서 새로운 작업에 대한 강력한 일반화를 가능하게 하는 반면, SFT는 취약한 일반화와 치명적 망각(catastrophic forgetting)을 유발하기 쉽다고 여겨졌습니다. 동시에 SFT는 오프폴리시 전문가 데이터로부터 학습할 수 있는 장점을 가집니다.
Argo-Bench: 엔터프라이즈 규모 워크플로 기반 데이터 에이전트 평가
실제 엔터프라이즈 데이터 사이언스 및 분석 워크플로는 수십 개 테이블에 걸친 추론, 통계 분석 수행 및 결과 조치를 요구합니다. 기존 Text-to-SQL 벤치마크는 쿼리 생성만을 평가하며 정답 오류도 빈번히 발견되었습니다. 또한 실제 기업 데이터 웨어하우스는 보안상 공개가 어려워 단일 테이블 수준의 공개 데이터셋에 의존해 왔습니다. 이에 엔터프라이즈 규모의 복합 워크플로를 평가할 수 있는 프레임워크인 Argo-Bench를 제안합니다.
⚖️ 정책 & 안전 (4/8건)
트럼프, 새로운 '초지능 기동대(Super Intelligence Force)' 발표
이번 신설 태스크포스는 AI 안전성 논쟁에 대한 트럼프의 최신 대응책입니다.
내재적 정렬(Endogenous Alignment)에는 의존성이 필요하다
내재적 정렬에 관한 제 글에 훌륭한 댓글이 여럿 달렸습니다. 그중 칼 크루거(Karl Krueger)는 인간이 자녀를 정렬시키는 과정에서 모방 학습이 강화학습보다 더 중요하다고 주장했습니다. 둘 중 무엇이 더 중요한지 가려내는 것은 어려워 보이지만, 모방의 중요성을 간과한 제 실수를 인정하며, 다른 댓글의 설명처럼 모방 학습이 더 근본적인 이유가 있을 수 있습니다. 군나르 찬케(Gunnar Zarncke)가 유용하게 지적했듯...
美 법원, 구글 AI 오버뷰(AI Overviews) 대상 반독점 소송 기각
로이터 통신에 따르면, 美 연방법원이 체그(Chegg)와 펜스케 미디어(PMC)가 제기한 반독점 소송 2건을 기각했습니다. 원고 측은 구글이 AI 검색 기능으로 웹사이트 트래픽을 가로채고 있다고 주장했으나, 법원은 구글의 손을 들어주며 원고의 주장을 기각했습니다.
Import AI 474: 플라톤적 마인드스페이스; 우주 속의 TPU; Zhipu의 외부 RSI 루프 시작
어느 지점에서 LLM의 역량을 뛰어넘게 될까요?
🎥 영상 & 튜토리얼 (2/6건)
AI 뉴스: Dots, GPT-6.1 Sol, Sonnet 5.5, Gemini 4 및 알아야 할 모든 최신 소식
이번 주 놓쳤을 수 있는 주요 AI 뉴스입니다. Optimizely의 Virtual Teammates가 자동화할 수 있는 작업을 확인하고, 다양한 AI 툴과 주간 뉴스레터 소식을 만나보세요.
실제로 수익을 안겨줄 수 있는 단 하나의 OpenAI 발표
https://fastino.ai/ 에서 더 빠른 오픈 웨이트 버전의 Jev를 사용해 보세요. 프로모션 코드 'FIRESHIPFIVE'를 입력하면 무료 크레딧을 받을 수 있습니다. 이번 영상에서는 OpenAI DevDay 2026에서 놓쳤을 법한 핵심 내용들을 총정리합니다. #coding #programming Fireship의 추가 콘텐츠가 궁금하시다면? 🗞️ 뉴스레터: https://bytes.dev 🧠 강의: https://fireship.dev