🤖 모델 & 제품 (10/21건)
OpenAI 모델을 포함한 제3자 사이버 평가
OpenAI explains recent third-party cybersecurity evaluation incidents and outlines new safeguards to strengthen AI model testing and evaluation.
ChatGPT Work 및 Codex를 통해 배우고 가르치는 새로운 방법
K-12 교사, 대학 교육자 및 학생이 배우고, 가르치고, 연구하고, 구축하는 데 도움이 되는 ChatGPT Work 및 Codex용 새로운 교육 플러그인을 살펴보세요.
2026년 7월에 발표한 최신 AI 뉴스
7월 AI 요약 헤더
Tino Cuellar, 최고 글로벌 업무 책임자로 Anthropic에 합류
Anthropic은 신뢰할 수 있고 해석 가능하며 조종 가능한 AI 시스템을 구축하기 위해 노력하는 AI 안전 및 연구 회사입니다.
애플이 잘못하고 있다
OpenAI는 Apple의 근거 없는 소송을 해결하고 직원에 대한 주장을 정정하며 발생한 상황을 기록한 메시지를 공유합니다.
6개월 만에 반응형 음성 AI를 위한 실시간 시스템을 구축한 방법
GPT-Live는 더 빠르고 자연스러운 대화를 위해 무회전 음성 모델과 저지연 아키텍처를 사용하여 AI와의 지속적인 음성 상호 작용을 가능하게 합니다.
Circles는 OpenAI 기술로 통신사 개인화를 강화합니다.
Circles는 OpenAI API 및 Codex를 사용하여 AI 기반 통신 경험을 강화하고 ARPU를 22% 늘리고 이탈률을 9% 줄이며 개발 효율성을 향상시킵니다.
353,000명의 바이브 코딩 코스 내부
노트북, AI 스파크, 메시지, 코드, 3D 큐브 일러스트레이션
수학과 이론 컴퓨터 과학의 10가지 발전
OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.
참조가 포함된 비디오 1.5를 상상해 보세요.
이제 텍스트, 이미지, 음성 참조가 포함된 최고의 비디오 모델이 최대 1080p까지 생성됩니다.
🌎 업계 동향 (12/136건)
MacPaw taps Liquid AI to offer on-device inference to devs building for its app store
MacPaw는 Liquid AI의 모델을 사용하여 AI 비서 Eney의 로컬 버전을 구축하고 있습니다.
AI는 날씨 예측을 더 좋게 만듭니다. WindBorne이 수익성을 높일 수 있을까요?
WindBorne Systems는 날씨 풍선과 AI 예측을 확장하기 위해 3,700만 달러의 시리즈 B 투자를 유치했습니다.
다음달부터 Google 어시스턴트가 휴대전화에서 사라집니다
Google 어시스턴트의 시대는 Gemini가 현장에 도착한 이후로 계속 이어져 왔으며 이제 그 시간이 다 되었습니다. 구글은 9월 4일부터 안드로이드 스마트폰과 태블릿, 스마트워치나 헤드폰 등 페어링된 기기에서 어시스턴트에 대한 액세스를 제거할 것이라고 발표했습니다. 이 발표는 […]로 보낸 것으로 보이는 이메일로 나왔습니다.
트럼프의 AI 테스트 계획은 제한적이고 모호하다
첨단 AI로 인한 잠재적인 사이버 보안 위험을 평가하기 위한 트럼프 행정부의 프레임워크는 개방형 모델을 테스트하는 데 관심이 없는 것으로 알려졌습니다. Axios는 자발적인 지침이 개방형 모델을 완전히 제외할 뿐만 아니라(누구나 다운로드하여 핵심 구성 요소를 검사할 수 있음을 의미) 프레임워크에서 이를 사용할 수 없다고 명시적으로 명시하고 있다고 보고했습니다.
Mistral의 Shieldstral: 다중 모드 조정을 위한 3B 개방형 가중치 모델
Shieldstral은 크기가 최대 7배인 모델보다 성능이 뛰어난 3B 개방형 다중 모드 안전 분류기를 출시합니다.
단일 AMD MI300X의 DeepSeek V4 플래시
GitHub에 계정을 만들어 ryanzhou/deepseek-v4-flash-mi300x 개발에 기여하세요.
AI는 사기 급증으로 아프리카 사이버 범죄의 절반 이상을 부채질합니다 – Interpol
INTERPOL의 2026년 아프리카 사이버 위협 평가 보고서에 따르면, 인공 지능은 이제 아프리카 전역에서 보고된 사이버 범죄의 절반 이상을 지원하여 범죄자들이 더 빠르고, 더 설득력 있고, 더 큰 규모의 공격을 시작할 수 있게 해줍니다.
AI-Generated Images Discourage Me from Reading Your Blog
AI 생성 이미지를 사용하려는 경우 텍스트가 AI 생성 이미지가 아닌지 어떻게 알 수 있나요?
AI 코딩 에이전트가 예산을 초과하고 있습니다. Replit, Kilo Code 및 Symbotic이 이를 관리하는 방법을 설명합니다.
공동 창업자인 Emilie Schario에 따르면 Kilo Code에서 엔지니어가 스스로 코드를 읽거나 쓰는 시간은 현재 전체 시간의 약 1%에 불과하며 나머지는 에이전트입니다. 이러한 변화는 개발팀에게 새로운 질문을 강요하고 있습니다. 어떤 시스템을 넘겨도 안전한지, 모델이 문제가 생겼을 때 누가 정리하는지, 다중 모델 아키텍처를 지원하는 방법, 치솟는 토큰 비용이 실제 발전을 의미하는지 아니면 IT 예산을 소진시키는지 등을 말이죠.
SQLite 중요 CVE 또는 LLM Slop?
The JFrog security research team recently identified a supply chain attack targeting the `xinference` package on PyPI. Versions 2.6.0, 2.6.1, and 2.6.2 were compromised and yanked by maintainers after users reported suspicious behavior. If you installed or imported these versions, you must assume yo
Prevent cognitive debt by manually retyping LLM-generated code
해커뉴스 (375포인트, 316댓글)
클로드는 인터넷에 악성코드를 유포하고 실제 기업 3곳을 공격했다.
해킹이 기존 방법을 사용했다면 누군가 감옥에 갔을 가능성이 높습니다.
📚 논문 & 연구 (18/117건)
TurnSight: 도구 통합 추론을 위한 턴레벨 사후 통찰력 자가 증류
Tool-Integrated Reasoning (TIR) enables LLMs to solve complex tasks through iterative tool interactions. However, existing reinforcement learning methods often rely on trajectory-level supervision, limiting fine-grained credit assignment in long-horizon TIR scenarios. On-policy self-distillation off
Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
대규모 언어 모델은 더 많은 추론 시간 컴퓨팅을 통해 훨씬 더 어려운 추론 문제를 해결할 수 있습니다. 그러나 "테스트 시간 확장"이라는 용어는 이제 단일 궤적을 따라 심의를 확장하고, 완료된 후보를 샘플링하고, 투표 또는 검증을 통해 이를 집계하거나, 완료되지 않은 부분 상태를 검색하는 다양한 추론 알고리즘을 포괄합니다. 이러한 알고리즘은 통계가 다릅니다.
대규모 언어 모델은 컴파일러가 놓친 의미론적 최적화 기회를 복구할 수 있습니까?
최적화 컴파일러는 분석된 프로그램 표현에 활성화 의미가 없을 때 수익성 있는 변환을 놓치게 됩니다. 우리는 대규모 언어 모델(LLM)이 이기종 C/C++ 컨텍스트에서 이러한 의미 체계를 복구하고 이를 검증된 계약 보존 아티팩트로 실현할 수 있는지 묻습니다. 100개의 합성 사례와 20개의 소스 기반 사례를 포함하는 실행 가능한 벤치마크인 SeGaBench를 소개합니다.
Video-DeepResearch: 차세대 다중 모드 Deepresearch 에이전트를 향하여
우리는 다중 모달 에이전트를 정적 이미지에서 지속적인 비디오 스트림으로 확장하는 Video-DeepResearch(Video-DR)를 소개합니다. 이는 개방형 웹 탐색과 결합된 조밀한 시공간 기반을 요구하는 설정입니다. 예비 평가는 현재 모델에서 두 가지 중요한 병목 현상을 보여줍니다. (1) 에이전트가 텍스트 검색을 위해 시각적 도구를 우회하는 모달리티 편향 및 (2) 매개변수적 지식 누출
ReflectRL: 반사-직접 추론을 통해 골든 네거티브 궤적에서 학습
정책에 따른 훈련은 대규모 언어 모델의 추론 능력을 향상시키기 위한 강력한 사후 훈련 패러다임으로 등장했으며, 더 강력한 전문가 모델의 황금 궤적에 의해 강화되는 경우가 많습니다. 그러나 전문가가 더 어려운 문제에 실패하면 기존 궤도 기반 방법은 감독의 주요 소스를 잃고 이러한 실패한 궤도는 일반적으로 부정적인 것으로 폐기됩니다.
LLM 에이전트에게 타이핑을 해야 할까요, 아니면 대화를 해야 할까요? 음성 및 키보드 입력 교란에 대한 종합적인 연구
인간의 입력은 타이핑이나 말하기를 통해 언어 모델에 도달하며 각 채널은 고유한 서명을 남깁니다. 음성의 경우 기존 전사의 유창성 및 AI 지원 받아쓰기 도구의 재구성이 가능합니다. LLM의 성과에 어떤 영향을 미치나요? 이 논문에서는 음성 전사 섭동 및 QWERT 제품군인 HIVE(Human Input-Variation Engine)를 제시합니다.
합성 조직병리학 이미지 생성을 위한 조건부 확산 모델 평가
합성 조직병리학 이미지 생성은 전산 병리학의 데이터 부족을 해결할 수 있는 접근 방식으로 등장했지만 현재 평가 방법으로는 의료 응용 분야의 합성 데이터 품질을 완전히 평가하지 못할 수 있습니다. 이 작업은 기존 평가 지표의 한계를 조사하고 해결하며, 이를 통해 합성 조직병리학 영상 품질을 평가하는 접근 방식을 조사합니다.
GFlowNets의 정보기하학적 순방향 정책 교육
Generative Flow Networks (GFlowNets) have emerged as a flexible framework for amortised inference over discrete and mixed discrete-continuous objects, requiring only an unnormalised target density specified through a reward. In this work, we formulate forward-policy training in GFlowNets through the
Muon과 Mamba의 만남: 상태 공간 모델을 위한 스펙트럼 최적화
Muon is a recent optimizer that orthogonalizes the update to each weight matrix with a Newton-Schulz iteration, which performs steepest descent under the spectral norm. Almost all the evidence for it comes from Transformer models, and its behavior on state-space models is largely unreported. We comp
언어 이전의 논리: 형식 파생에 대한 사전 사전 훈련으로 기술 습득 및 압축성 촉진
Pre-pretraining language models (LMs) on symbolic data can accelerate and improve natural language acquisition. However, existing pre-pretraining tasks, such as Dyck and procedural algorithms, rely on narrow primitives that fail to capture the expressive capacity of natural language. Moreover, prior
확산 선호 정렬을 위한 잠재 보상 레지스터
확산 모델을 인간의 선호도에 맞추는 것은 일반적으로 최종 생성된 샘플에 대해 평가된 희박한 최종 보상에 의존하며, 이는 다단계 노이즈 제거 프로세스 전반에 걸쳐 심각한 시간적 신용 할당 문제를 제시합니다. 우리는 학습 가능하고 위치가 없는 레지스터를 앞에 추가하여 중간 잡음 잠재성에서 직접 단말 선호도를 추정하는 메커니즘인 잠재 보상 레지스터를 제안합니다.
교차 집중 샘플링에서 강력한 낮은 관 등급 텐서 완성
t-CCS(텐서 교차 집중 샘플링)는 선택된 수평 및 측면 슬라이스 내에서만 항목을 관찰하여 항목별 샘플링과 t-CUR 슬라이스별 샘플링을 연결합니다. 그러나 기존 t-CCS 완료 방법은 관측값에 심각한 손상이 없다고 가정합니다. 이 작업에서 우리는 오염된 b로 오염된 부분 t-CCS 관찰로부터 3차 낮은 관급 텐서의 강력한 복구를 연구합니다.
ParVL: 다중 모드 LLM을 위한 병렬 확장 및 확장 가능한 컴퓨팅 할당
MLLM(다중 모드 대형 언어 모델)에 대한 기존 확장 전략은 일반적으로 모델 매개변수 또는 순차적 추론 계산을 확장하여 상당한 메모리 또는 대기 시간 오버헤드를 발생시킵니다. 더 중요한 것은 대부분의 기존 방법이 Vision Transformer와 대규모 언어 모델 구성 요소 간의 엄격하고 고정된 계산 할당을 변경하지 못하여 작업별 최적화가 제한된다는 것입니다.
SocietyBench: 반사실적 사회 세계 진화 예측
LLM(대형 언어 모델)과 그 위에 구축된 에이전트는 이제 버그 수정, 브라우저 구동, GUI 운영 등의 작업을 완료할 수 있는지 여부에 대해 집중적으로 벤치마킹됩니다. 보완적인 사회적 능력, 즉 모델이 실제 사회적 사건이 전개되는 방식을 얼마나 잘 이해하고 예측하는지는 거의 측정되지 않았습니다. 한 줄의 이벤트 상위권을 차지하는 엔드투엔드 벤치마크인 SocietyBench를 소개합니다.
월드컵 경기장: 라이브 토너먼트에서 프론티어 LLM의 전향적, 누출 없는 평가
대규모 언어 모델의 예측 능력을 측정하는 벤치마크는 거의 항상 회고적입니다. 이벤트가 발생했고 답은 웹 어딘가에 있으며 평가는 암기로부터 스스로를 방어해야 합니다. 우리는 반대 디자인을보고합니다. 2026년 FIFA 월드컵 39일 동안 확장된 사고 방식과 기본 서버측 웹 검색 기능을 갖춘 6개의 프론티어 LLM에게 질문이 주어졌습니다.
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
반복적인 자기 개선을 위해서는 에이전트가 축적된 경험을 더 나은 미래 행동으로 전환해야 합니다. 개인 AI 에이전트는 세션 전반에 걸쳐 기본 설정, 작업 기록, 도구 루틴 및 학습된 기술을 유지하므로 이 기능을 연구하기 위한 구체적인 설정을 제공합니다. 그러나 유지된 경험이 실제로 시간이 지남에 따라 향상되는지 여부는 체계적으로 테스트되지 않았습니다. PAST-Bench를 소개합니다
Agogic: LLM 네이티브 텍스트-심볼릭-음악 생성을 위한 성능 시간별 음악 토큰
텍스트-음악 언어 모델은 일반적으로 기본적으로 선택되는 선택인 음악을 토큰화하는 방법으로 시작됩니다. 일반적으로 백본, 데이터, 레시피와 얽혀 있어 그 효과를 단독으로 측정한 적이 없습니다. 사전 훈련된 Qwen3.5(0.8B-27B), 데이터, 예산 및 디코딩을 수정하고 7개의 토큰화에 걸쳐 표현만 교환하여 텍스처 측정항목을 각 표현의 모델 없는 한도에 고정합니다. 그만큼
주의가 흐려질 때: ALiBi 위치 인코딩의 수치 오류
우리는 이전에 간과되었던 ALiBi 위치 인코딩의 실패 모드를 식별합니다. 선형 바이어스 스케일링은 부동 소수점 정밀도를 언더플로우하여 주의 가중치의 상당 부분을 0으로 만들고 영향을 받는 주의 머리를 부분적으로 눈이 멀게 만듭니다. 우리는 이러한 실패 모드를 분석하고 그 영향을 특성화하며 4가지 완화 전략을 검토합니다. 우리는 현재 상태에서 그 발생을 추가로 보여줍니다.
🎥 영상 & 튜토리얼 (3/10건)
이제 나만의 기억을 검색할 수 있습니다
신용카드가 모든 것을 기억할 수 있다면 어떨까요? SecondBrain Note는 회의, 대화, 아이디어를 캡처한 다음 이를 정리된 메모와 실행 가능한 후속 조치로 바꾸는 신용카드처럼 얇은 AI 녹음기입니다. 이메일, 캘린더, Slack, Notion, Google Workspace와 같은 도구에 연결할 수도 있으므로 슈퍼 에이전트가 이메일 초안을 작성하고, 오래된 아이디어를 찾고, 조치를 취할 수 있습니다.
또 다른 DeepSeek 순간이 왔습니다
❤️ 여기에서 Lambda를 확인하고 GPU 클라우드에 가입하세요: https://lambda.ai/papers 📝 DeepSeek v4 Flash 0731: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 DeepSeek API: https://platform.deepseek.com/ 🙏 Two Minute Papers를 가능하게 해주신 관대하신 Patreon 후원자: Adam Bridges, Benji에게 감사드립니다. 라반, B 샹, 카메론 네이버, 찰스 이안 노먼 벤,
Anthropic이 방금 인디 해커를 죽였나요...?
무료로 Blacksmith를 사용해 GitHub Actions를 2배 더 빠르게 실행하세요. - https://www.blacksmith.sh/ Anthropic이 방금 Opus 5를 출시했으며 인디 해커의 꿈이 무너질 수도 있습니다. 자세히 살펴보겠습니다. #coding #programming 더 많은 Fireship을 원하시나요? 🗞️ 뉴스레터: https://bytes.dev 🧠 강좌: https://fireship.dev