🤖 모델 & 제품 (10/21건)
OpenAI 모델을 포함한 제3자 사이버 평가
OpenAI는 최근 제3자 사이버 보안 평가 사건을 설명하고 AI 모델 테스트 및 평가를 강화하기 위한 새로운 보호 조치를 간략하게 설명합니다.
ChatGPT Work 및 Codex를 통해 배우고 가르치는 새로운 방법
K-12 교사, 대학 교육자 및 학생이 배우고, 가르치고, 연구하고, 구축하는 데 도움이 되는 ChatGPT Work 및 Codex용 새로운 교육 플러그인을 살펴보세요.
2026년 7월에 발표한 최신 AI 뉴스
7월 AI 요약 헤더
Tino Cuellar, 최고 글로벌 업무 책임자로 Anthropic에 합류
Anthropic은 신뢰할 수 있고 해석 가능하며 조종 가능한 AI 시스템을 구축하기 위해 노력하는 AI 안전 및 연구 회사입니다.
애플이 잘못하고 있다
OpenAI는 Apple의 근거 없는 소송을 해결하고 직원에 대한 주장을 정정하며 발생한 상황을 기록한 메시지를 공유합니다.
6개월 만에 반응형 음성 AI를 위한 실시간 시스템을 구축한 방법
GPT-Live는 더 빠르고 자연스러운 대화를 위해 턴리스 음성 모델과 저지연 아키텍처를 사용하여 AI와의 지속적인 음성 상호 작용을 가능하게 합니다.
Circles는 OpenAI 기술로 통신사 개인화를 강화합니다.
Circles는 OpenAI API 및 Codex를 사용하여 AI 기반 통신 경험을 강화하고 ARPU를 22% 늘리고 이탈률을 9% 줄이며 개발 효율성을 향상시킵니다.
353,000명의 바이브 코딩 코스 내부
노트북, AI 스파크, 메시지, 코드, 3D 큐브 일러스트레이션
Ten advances in mathematics and theoretical computer science
OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.
참조가 포함된 비디오 1.5를 상상해 보세요.
이제 텍스트, 이미지, 음성 참조가 포함된 최고의 비디오 모델이 최대 1080p까지 생성됩니다.
🌎 업계 동향 (10/155건)
Elon Musk’s attempt at an AI Wikipedia hasn’t been updated in months
Lawfare의 보고서에 따르면 Elon Musk가 한때 Wikipedia에 비해 "대규모 개선"이 될 것이라고 약속한 AI 생성 기사가 포함된 온라인 백과사전인 xAI의 Grokipedia는 4월 24일 이후 업데이트되지 않은 것으로 보입니다. Lawfare는 "우리가 알 수 있는 한, 3개월 이상 항목이 변경되지 않았습니다."라고 말했습니다. Grokipedia는 […] v0.1에서 출시되었습니다.
AI가 생성한 아동 성적 학대 이미지가 포함된 메타란 광고
Meta의 광고 라이브러리 데이터에 따르면 50개 이상의 문제가 되는 이미지 및 비디오 광고가 Facebook, Instagram, Messenger 또는 Threads에 게시되었습니다. 일부는 최근 이번 주에 실행되었습니다.
100배 저렴한 개방형 모델로 검색 시 GPT-5.6 Sol을 능가함
Castform으로 사후 훈련된 4B 오픈 소스 모델은 비용이 100배 저렴하면서도 GPT-5.6 Sol만큼 정확하게 검색 결과를 검색했습니다.
Meta, 대규모 코드 베이스용 AI 에이전트 Muse Code 출시
Meta는 복잡한 소프트웨어로 복잡한 작업을 처리할 수 있는 새로운 에이전트를 통해 AI 코딩 제품을 확장했습니다.
Meta는 지속적인 비동기 백그라운드 에이전트를 갖춘 Muse Spark 1.2 및 Muse Code를 통해 AI 코딩 전쟁에 돌입합니다.
Meta는 오늘 현재 베타 버전인 터미널 기반 AI 코딩 에이전트인 Muse Code를 출시했습니다. Muse Spark 1.2는 Muse Spark 1.2와 함께 Muse Spark 1.2와 함께 출시되었습니다. Muse Spark 1.2는 Muse Spark 1.2와 함께 Anthropic의 Claude Code, OpenAI의 Codex 및 빠르게 성장하는 에이전트 코딩 하네스 분야와 직접적인 경쟁을 벌이는 원투 펀치입니다.
Mistral의 Shieldstral: 다중 모드 조정을 위한 3B 개방형 가중치 모델
Shieldstral은 크기가 최대 7배인 모델보다 성능이 뛰어난 3B 개방형 다중 모드 안전 분류기를 출시합니다.
단일 AMD MI300X의 DeepSeek V4 플래시
GitHub에 계정을 만들어 ryanzhou/deepseek-v4-flash-mi300x 개발에 기여하세요.
SQLite 중요 CVE 또는 LLM Slop?
The JFrog security research team recently identified a supply chain attack targeting the `xinference` package on PyPI. Versions 2.6.0, 2.6.1, and 2.6.2 were compromised and yanked by maintainers after users reported suspicious behavior. If you installed or imported these versions, you must assume yo
Prevent cognitive debt by manually retyping LLM-generated code
해커뉴스 (375포인트, 316댓글)
Claude published malicious code to the Internet and attacked 3 real companies
Had the hacks used conventional methods, someone would likely go to prison.
📚 논문 & 연구 (18/117건)
TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
TIR(도구 통합 추론)을 통해 LLM은 반복적인 도구 상호 작용을 통해 복잡한 작업을 해결할 수 있습니다. 그러나 기존 강화 학습 방법은 종종 궤도 수준 감독에 의존하여 장거리 TIR 시나리오에서 세분화된 크레딧 할당을 제한합니다. 정책에 따른 자체 증류는 권한 있는 컨텍스트가 있는 교사 분기를 통해 더 밀도 있는 신호를 제공하지만 기존 접근 방식은 일반적입니다.
추론 LLM의 테스트 시간 확장: 추론 체제, 평가 및 재현성
Large language models can solve substantially harder reasoning problems with more inference-time compute. The term "test-time scaling," however, now covers diverse inference algorithms that extend deliberation along a single trajectory, sample completed candidates and aggregate them throug
대규모 언어 모델은 컴파일러가 놓친 의미론적 최적화 기회를 복구할 수 있습니까?
최적화 컴파일러는 분석된 프로그램 표현에 활성화 의미가 없을 때 수익성 있는 변환을 놓치게 됩니다. 우리는 대규모 언어 모델(LLM)이 이기종 C/C++ 컨텍스트에서 이러한 의미 체계를 복구하고 이를 검증된 계약 보존 아티팩트로 실현할 수 있는지 묻습니다. 100개의 합성 사례와 20개의 소스 기반 사례를 포함하는 실행 가능한 벤치마크인 SeGaBench를 소개합니다.
Video-DeepResearch: 차세대 다중 모드 Deepresearch 에이전트를 향하여
We introduce Video-DeepResearch (Video-DR), extending multimodal agents from static images to continuous video streams, a setting that demands dense spatiotemporal grounding coupled with open-web exploration. Preliminary evaluations reveal two critical bottlenecks in current models: (1) modality bia
ReflectRL: 반사-직접 추론을 통해 골든 네거티브 궤적에서 학습
정책에 따른 훈련은 대규모 언어 모델의 추론 능력을 향상시키기 위한 강력한 사후 훈련 패러다임으로 등장했으며, 더 강력한 전문가 모델의 황금 궤적에 의해 강화되는 경우가 많습니다. 그러나 전문가가 더 어려운 문제에 실패하면 기존 궤도 기반 방법은 감독의 주요 소스를 잃고 이러한 실패한 궤도는 일반적으로 부정적인 것으로 폐기됩니다.
LLM 에이전트에게 타이핑을 해야 할까요, 아니면 대화를 해야 할까요? 음성 및 키보드 입력 교란에 대한 종합적인 연구
인간의 입력은 타이핑이나 말하기를 통해 언어 모델에 도달하며 각 채널은 고유한 서명을 남깁니다. 음성의 경우 기존 전사의 유창성 및 AI 지원 받아쓰기 도구의 재구성이 가능합니다. LLM의 성과에 어떤 영향을 미치나요? 이 논문에서는 음성 전사 섭동 및 QWERT 제품군인 HIVE(Human Input-Variation Engine)를 제시합니다.
합성 조직병리학 이미지 생성을 위한 조건부 확산 모델 평가
합성 조직병리학 이미지 생성은 전산 병리학의 데이터 부족을 해결할 수 있는 접근 방식으로 등장했지만 현재 평가 방법으로는 의료 응용 분야의 합성 데이터 품질을 완전히 평가하지 못할 수 있습니다. 이 작업은 기존 평가 지표의 한계를 조사하고 해결하며, 이를 통해 합성 조직병리학 영상 품질을 평가하는 접근 방식을 조사합니다.
GFlowNets의 정보기하학적 순방향 정책 교육
Generative Flow Networks(GFlowNets)는 보상을 통해 지정되는 정규화되지 않은 목표 밀도만 요구하는 이산 및 혼합 이산-연속 객체에 대한 상각 추론을 위한 유연한 프레임워크로 등장했습니다. 이 연구에서는 유도된 궤도 샘플러의 정보 기하학을 통해 GFlowNets에서 전방 정책 교육을 공식화합니다. 순방향 정책을 유도된 t로 취급
Muon과 Mamba의 만남: 상태 공간 모델을 위한 스펙트럼 최적화
Muon은 스펙트럼 표준에서 가장 가파른 하강을 수행하는 Newton-Schulz 반복을 통해 각 가중치 행렬에 대한 업데이트를 직교화하는 최신 최적화 도구입니다. 이에 대한 거의 모든 증거는 Transformer 모델에서 나오며 상태공간 모델에서의 동작은 대부분 보고되지 않습니다. 우리는 체중 그룹만 변경하는 제어된 프로토콜에 따라 Mamba-2 130M의 Muon과 AdamW를 비교합니다.
언어 이전의 논리: 형식 파생에 대한 사전 사전 훈련으로 기술 습득 및 압축성 촉진
기호 데이터에 대한 사전 학습 언어 모델(LM)은 자연어 획득을 가속화하고 향상시킬 수 있습니다. 그러나 Dyck 및 절차적 알고리즘과 같은 기존 사전 훈련 작업은 자연어의 표현 능력을 포착하지 못하는 좁은 기본 요소에 의존합니다. 더욱이, 이전 연구는 상대적으로 작은 토큰 예산으로 제한되어 있어 기술에 대한 제한된 통찰력을 제공합니다.
확산 선호 정렬을 위한 잠재 보상 레지스터
확산 모델을 인간의 선호도에 맞추는 것은 일반적으로 최종 생성된 샘플에 대해 평가된 희박한 최종 보상에 의존하며, 이는 다단계 노이즈 제거 프로세스 전반에 걸쳐 심각한 시간적 신용 할당 문제를 제시합니다. 우리는 학습 가능하고 위치가 없는 레지스터를 앞에 추가하여 중간 잡음 잠재성에서 직접 단말 선호도를 추정하는 메커니즘인 잠재 보상 레지스터를 제안합니다.
교차 집중 샘플링에서 강력한 낮은 관 등급 텐서 완성
t-CCS(텐서 교차 집중 샘플링)는 선택된 수평 및 측면 슬라이스 내에서만 항목을 관찰하여 항목별 샘플링과 t-CUR 슬라이스별 샘플링을 연결합니다. 그러나 기존 t-CCS 완료 방법은 관측값에 심각한 손상이 없다고 가정합니다. 이 작업에서 우리는 오염된 b로 오염된 부분 t-CCS 관찰로부터 3차 낮은 관급 텐서의 강력한 복구를 연구합니다.
ParVL: 다중 모드 LLM을 위한 병렬 확장 및 확장 가능한 컴퓨팅 할당
MLLM(다중 모드 대형 언어 모델)에 대한 기존 확장 전략은 일반적으로 모델 매개변수 또는 순차적 추론 계산을 확장하여 상당한 메모리 또는 대기 시간 오버헤드를 발생시킵니다. 더 중요한 것은 대부분의 기존 방법이 Vision Transformer와 대규모 언어 모델 구성 요소 간의 엄격하고 고정된 계산 할당을 변경하지 못하여 작업별 최적화가 제한된다는 것입니다.
SocietyBench: 반사실적 사회 세계 진화 예측
LLM(대형 언어 모델)과 그 위에 구축된 에이전트는 이제 버그 수정, 브라우저 구동, GUI 운영 등의 작업을 완료할 수 있는지 여부에 대해 집중적으로 벤치마킹됩니다. 보완적인 사회적 능력, 즉 모델이 실제 사회적 사건이 전개되는 방식을 얼마나 잘 이해하고 예측하는지는 거의 측정되지 않았습니다. 한 줄의 이벤트 상위권을 차지하는 엔드투엔드 벤치마크인 SocietyBench를 소개합니다.
월드컵 경기장: 라이브 토너먼트에서 프론티어 LLM의 전향적, 누출 없는 평가
대규모 언어 모델의 예측 능력을 측정하는 벤치마크는 거의 항상 회고적입니다. 이벤트가 발생했고 답은 웹 어딘가에 있으며 평가는 암기로부터 스스로를 방어해야 합니다. 우리는 반대 디자인을보고합니다. 2026년 FIFA 월드컵 39일 동안 확장된 사고 방식과 기본 서버측 웹 검색 기능을 갖춘 6개의 프론티어 LLM에게 질문이 주어졌습니다.
과거 벤치: 개인 에이전트의 재귀적 자기 개선의 기초 벤치마킹
반복적인 자기 개선을 위해서는 에이전트가 축적된 경험을 더 나은 미래 행동으로 전환해야 합니다. 개인 AI 에이전트는 세션 전반에 걸쳐 기본 설정, 작업 기록, 도구 루틴 및 학습된 기술을 유지하므로 이 기능을 연구하기 위한 구체적인 설정을 제공합니다. 그러나 유지된 경험이 실제로 시간이 지남에 따라 향상되는지 여부는 체계적으로 테스트되지 않았습니다. PAST-Bench를 소개합니다
Agogic: LLM 네이티브 텍스트-심볼릭-음악 생성을 위한 성능 시간별 음악 토큰
텍스트-음악 언어 모델은 일반적으로 기본적으로 선택되는 선택인 음악을 토큰화하는 방법으로 시작됩니다. 일반적으로 백본, 데이터, 레시피와 얽혀 있어 그 효과를 단독으로 측정한 적이 없습니다. 사전 훈련된 Qwen3.5(0.8B-27B), 데이터, 예산 및 디코딩을 수정하고 7개의 토큰화에 걸쳐 표현만 교환하여 텍스처 측정항목을 각 표현의 모델 없는 한도에 고정합니다. 그만큼
주의가 흐려질 때: ALiBi 위치 인코딩의 수치 오류
우리는 이전에 간과되었던 ALiBi 위치 인코딩의 실패 모드를 식별합니다. 선형 바이어스 스케일링은 부동 소수점 정밀도를 언더플로우하여 주의 가중치의 상당 부분을 0으로 만들고 영향을 받는 주의 머리를 부분적으로 눈이 멀게 만듭니다. 우리는 이러한 실패 모드를 분석하고 그 영향을 특성화하며 4가지 완화 전략을 검토합니다. 우리는 현재 상태에서 그 발생을 추가로 보여줍니다.
🎥 영상 & 튜토리얼 (3/12건)
10억 달러 규모의 AI 경쟁이 막 끝났습니다.
❤️ 여기에서 Lambda를 확인하고 GPU 클라우드에 가입하세요: https://lambda.ai/papers 📝 Qwen 3.8 Max: https://qwen.ai/blog?id=qwen3.8 출처: https://x.com/loktar00/status/2082589566934929750 https://x.com/CommandCodeAI/status/2084293498950590839 🙏 Two Minute Papers를 가능하게 해준 관대하신 Patreon 지지자: Adam Bridges, Benji Rabhan, B Sha
비트코인을 가장 안전하게 보관하는 방법은 방금 해킹당했습니다.
Lovable을 사용하여 하루 만에 실제 앱을 구축, 테스트 및 출시하세요: https://lovable.link/11vGHox 지난 주에 비트코인을 저장하는 가장 안전한 방법은 빠르게 가장 덜 안전한 방법이 되었습니다. 조사해보자. #coding #programming 더 많은 Fireship을 원하시나요? 🗞️ 뉴스레터: https://bytes.dev 🧠 강좌: https://fireship.dev
이제 나만의 기억을 검색할 수 있습니다
신용카드가 모든 것을 기억할 수 있다면 어떨까요? SecondBrain Note는 회의, 대화, 아이디어를 캡처한 다음 이를 정리된 메모와 실행 가능한 후속 조치로 바꾸는 신용카드처럼 얇은 AI 녹음기입니다. 이메일, 캘린더, Slack, Notion, Google Workspace와 같은 도구에 연결할 수도 있으므로 슈퍼 에이전트가 이메일 초안을 작성하고, 오래된 아이디어를 찾고, 조치를 취할 수 있습니다.