🤖 모델 & 제품 (10/22건)
수학과 이론 컴퓨터 과학의 10가지 발전
OpenAI는 기하학, 암호화 및 복잡성의 발전을 포함하여 수학과 이론적 컴퓨터 과학의 오랫동안 공개된 문제에 대한 새로운 결과를 공유합니다.
유럽 전역에서 책임 있는 AI 발전
OpenAI는 안전, 보안, 투명성 및 출처 관행이 유럽에서 책임감 있는 AI 거버넌스를 지원하는 방법을 공유합니다. EU AI법이 발전함에 따라 이 작업은 계속될 것입니다.
풍부한 지능 구축
고급 AI를 더욱 유능하고 저렴하며 더욱 광범위하게 유용하게 만드는 풀 스택 접근 방식입니다.
Univé는 AI 지원 인력을 구축합니다.
Univé가 리더십, 책임 있는 거버넌스, 직원 주도 혁신을 결합하여 대규모로 업무를 혁신함으로써 ChatGPT Enterprise를 통해 AI 지원 인력을 구축한 방법을 알아보세요.
범죄 사기 작전 방해
OpenAI는 투자, 로맨스, 도박, 사칭 계획을 지원하기 위해 ChatGPT를 사용하여 캄보디아 기반 사기 작전을 중단했습니다.
참조가 포함된 비디오 1.5를 상상해 보세요.
이제 텍스트, 이미지, 음성 참조가 포함된 최고의 비디오 모델이 최대 1080p까지 생성됩니다.
GPT-5.6으로 가격 대비 성능의 한계를 뛰어넘다
Luna 및 Terra의 저렴한 GPT‑5.6 가격을 살펴보고 OpenAI의 보다 효율적인 모델이 기업이 AI 워크플로를 대규모로 배포하는 데 어떻게 도움이 되는지 알아보세요.
사이버 보안 평가에서 세 가지 실제 사건 조사
사이버 보안 평가 기록을 검토한 결과 Claude 모델이 제3자 평가 환경 내에서 또는 제3자 평가 환경과 상호 작용하는 동안 인터넷에 접속한 다음 세 가지 다른 조직의 실제 시스템에 대한 무단 액세스를 얻은 세 건의 사건을 발견했습니다. 아래에서는 무슨 일이 일어났는지, 어떻게 발생했는지, 그리고 변경되는 사항에 대해 설명합니다. 우리는 다른 AI 연구실에서도 PE를 수행하도록 권장합니다.
Grok Voice Think Fast 2.0 소개
가장 유능한 음성 음성 변환 음성 모델을 소개합니다.
Gemini API 관리 에이전트: 3.6 플래시, 후크 등
관리형 에이전트 Gemini 3.6 플래시, 후크 및 트리거
🌎 업계 동향 (10/120건)
AI는 작동하는 제품을 생성하지 않습니다. 그것은 여전히 당신의 일입니다
AI는 첫 번째 작업 버전으로의 경로를 극적으로 가속화했습니다. 첫 번째 작업 버전과 프로덕션 등급 사이의 거리가 줄어들지 않았습니다.
Charlie Stross – 내 글쓰기 과정에서 AI를 사용하지 않은 것에 대해
해커뉴스 (59점, 댓글 47개)
qm – 업무용 멀티플레이어 에이전트 하네스
업무용 멀티플레이어 에이전트 하네스. GitHub에 계정을 만들어 yc-software/qm 개발에 기여하세요.
DeepSeek V4 Flash 0731 인텔리전스, 성능 및 가격 분석
DeepSeek의 DeepSeek V4 Flash 0731(Reasoning, Max Effort) 분석 및 품질, 가격, 성능(초당 토큰 및 첫 번째 토큰까지의 시간), 컨텍스트 창 및 기타 주요 지표를 포함한 다른 AI 모델과의 비교 더.
Google은 AI 덕분에 6월에 지난 2년보다 더 많은 Chrome 버그를 수정했습니다.
Chrome은 Gemini AI를 사용하여 취약성 검색, 분류, 패치 적용을 자동화하고 최신 보안 위험에 맞춰 업데이트를 가속화합니다.
플린트(Flint): AI 시대를 위한 시각화 언어
해커뉴스 (220포인트, 댓글 64개)
OpenAI는 더 많은 에이전트가 장난을 쳤다는 증거를 발견한 것으로 알려졌습니다.
OpenAI는 Hugging Face에서 발생한 사건을 조사하면서 추가적인 에이전트의 잘못된 행동 증거를 발견한 것으로 알려졌습니다.
Google 어스의 AI 딥페이크 도구는 단 하루만 지속되었습니다.
구글은 사용자가 AI를 사용해 텍스트 프롬프트로 위성 이미지를 편집할 수 있도록 하는 구글 어스 기능을 목요일 출시했다. 이 도구를 사용하면 기본적으로 사용자는 텍스트 프롬프트를 사용하여 실제 세계의 AI 딥페이크를 만들 수 있습니다. 예를 들어 Digital Digging의 Henk van Ess는 멕시코 국경 근처의 난민과 같은 내용을 추가하여 의도적으로 이미지를 생성했습니다.
클로드는 인터넷에 악성코드를 유포하고 실제 기업 3곳을 공격했다.
해킹이 기존 방법을 사용했다면 누군가 감옥에 갔을 가능성이 높습니다.
구조화된 AI 데이터 파이프라인은 자유 형식 코드보다 10.9점 낮습니다. DataFlow-Harness가 격차를 줄입니다.
단일 JSON 파일을 구문 분석하기 위해 독립형 Python 스크립트를 작성하도록 AI 코딩 에이전트에 요청하면 몇 초 안에 완벽한 답변을 얻을 수 있습니다. 그러나 수천 개의 지저분한 문서 수집, 텍스트 청크 처리, 품질 점수 매기기, RAG(Retrieval-Augmented Generation) 시스템에 대한 노이즈 필터링 등 체계적인 데이터 처리 파이프라인 구축을 요청하면 동일한 에이전트가 중단되는 경우가 많습니다.
📚 논문 & 연구 (17/89건)
Seiberg 이중성을 추적하는 방법 배우기
이중성은 광범위한 물리적 시스템에서 미시적 현상과 창발적 현상을 확립하는 데 중요한 역할을 합니다. 그러나 실제로는 모든 "게임 규칙"이 잘 알려져 있는 경우에도 두 시스템이 이중인 경우 설정하는 것이 계산적으로 어려울 수 있습니다. 다르게 말하면, 두 시스템에 직면했을 때 실제로 이중 시스템이라는 것을 어떻게 효율적으로 확인할 수 있습니까?
ReToken: 시각적 검색을 위한 비전-언어 모델을 개선하는 하나의 토큰
긴 시각적 컨텍스트는 비전 언어 모델에 문제를 제기합니다. 산만한 요소의 수가 증가함에 따라 성능이 저하되고 모든 토큰을 한 번에 처리하는 것은 GPU 메모리 제약 하에서 계산상 불가능합니다. 우리는 미리 채워진 시각적 KV 캐시에서 희박한 쿼리 관련 시각적 토큰 세트를 선택하는 명시적 검색 대상으로 훈련된 단일 학습 가능 임베딩인 ReToken을 제시합니다. 티
PAC-MAN: 인간형 피구의 전신 안전을 위한 인지 인식 CBF-RL
우리는 제어 장벽 안전과 전신 휴머노이드 피구에 대한 배치 현실적인 온보드 감지를 결합한 인식 인식 CBF-RL 프레임워크인 PAC-MAN을 제시합니다. 배포된 정책은 공을 머리 장착 카메라의 분할 마스크 깊이로만 보는 반면 훈련 시간 CBF 안내는 모든 신체 링크에 대한 클리어런스를 나타내며 사전에 적대적인 모션은 결과 eva를 정규화합니다.
AskChem: 화학 문헌 합성을 위한 청구 중심 인프라
화학 문헌을 합성하려면 여러 출판물에 분산된 특정 결과를 모아야 하는 경우가 많지만 기존 문헌 검색 시스템은 주로 순위가 매겨진 문서 목록을 반환합니다. 결과적으로 과학자와 AI 에이전트는 관련 정보를 찾고, 출처를 확인하고, 여러 종이에 걸친 답변을 수동으로 모아야 합니다. Cross Paper를 위한 청구 중심 인프라 AskChem을 선보입니다.
AISPA: 대규모 언어 모델 애플리케이션을 위한 사용자 중심 시스템 프롬프트 감사
시스템 프롬프트는 AI 애플리케이션에서 기본 모델의 동작을 제어하기 위해 개발자가 구성한 지침입니다. 이는 상용 AI 제품 전반에 걸쳐 사용되지만 대중이나 규제 기관에 거의 공개되지 않아 AI 시스템의 광범위한 배포에 심각한 신뢰와 책임 격차가 발생합니다. 본 논문에서는 미국 인공지능 시스템 프롬프트 보증(AISPA)을 소개한다.
OSReward: 크로스 플랫폼 컴퓨터 사용 보상 모델에 대한 표준화된 평가 도입
CUA(컴퓨터 사용 에이전트)는 디지털 세계 전반에 걸쳐 빠르게 발전하고 있습니다. CUA 궤적은 에이전트의 작업, 상태 및 추론을 기록합니다. 작업 지침을 충족했는지 확인하는 것은 CUA 평가, 데이터 큐레이션 및 강화 학습의 핵심입니다. 사람이 작성한 검증자나 사람 주석자는 이러한 검증을 대규모로 제공할 수 없으므로 해당 분야는 점점 더 v로 변합니다.
KAISEN: 임상 위험 모델에 대한 재현 가능한 하위 그룹 공정성 감사
임상 위험 모델은 정기적으로 강력한 집계 성능을 달성하는 동시에 환자 하위 그룹에 걸쳐 실질적으로 다른 오류율을 생성합니다. 이를 포착하기 위해 감사 파이프라인이 제안되었지만 해당 구성 요소는 스트레스 테스트를 거의 거치지 않으므로 감사의 어느 부분을 어떤 조건에서 신뢰할 수 있는지가 불분명합니다. 하위 그룹 계층을 포괄하는 5단계 감사 파이프라인인 KAISEN을 소개합니다.
Change2Task: 리포지토리 변경부터 실행 가능한 코딩 에이전트 작업 및 환경까지
스케일링 코딩 에이전트에는 교육, 벤치마킹 및 지속적인 평가를 위한 실행 가능한 데이터의 지속적인 공급이 필요합니다. 각 작업은 현실적인 소프트웨어 상태를 사양, 개발 도구 및 신뢰할 수 있는 검증과 결합해야 합니다. 이 공급을 확장하기 위해 병합된 끌어오기 요청을 정상 모더에서 검증된 작업으로 변환하는 저장소 기록에 기반을 둔 시스템인 Change2Task를 제시합니다.
MixFrag: 비전 트랜스포머를 위한 취약성 기반 혼합 정밀도 사후 훈련 양자화
PTQ(사후 훈련 양자화)는 리소스가 제한된 장치에 ViT(Vision Transformer)를 배포하기 위한 효과적인 솔루션으로 등장했습니다. 그러나 기존 PTQ 방법은 일반적으로 변환기 구성 요소 전체에 균일한 비트 폭을 사용하므로 양자화에 대한 이질적인 감도를 간과하고 비효율적인 정밀도 할당으로 이어집니다. 본 논문에서는 취약성 구인 {MixFrag,
$β$-OPSD: 정책 최적화를 통한 도출, 자체 증류를 통한 교육
OPSD(On-policy self-distillation)는 추론 언어 모델을 개선하기 위한 유망한 접근 방식이지만 실제로는 취약합니다. 안정적으로 작동하려면 상당한 엔지니어링 노력이 필요한 경우가 많습니다. 우리는 이 어려움의 구조적 원인을 식별합니다. 바닐라 OPSD는 정확하게 $β=1$ 광범위한 정책 최적화 제품군의 구성원입니다. 여기서 $β$는 학생을 고정시키는 KL 페널티에 가중치를 부여합니다.
불규칙한 이력을 이용한 종단적 인과 추론을 위한 이중 강건 기능적 표현 학습
종단적 인과 연구는 종종 역사를 불규칙한 기능적 단편(실험실 값, 생리학적 신호, 센서 스트림, 불평등하고 유익한 시간에 측정된 이미지 파생 요약)으로 기록합니다. 표준 이중 강건 추정량에는 일반적으로 스칼라 요약이 필요한 반면, 시퀀스 학습기는 효율적인 영향 함수를 안정화할 필요가 없는 예측 손실을 최적화합니다. 우리는 제안한다
APO: 원자 시스템의 3차원 구조 예측을 위한 비지도 원자 정책 최적화
원자 시스템의 3D 구조를 예측하는 것은 재료 과학 및 신약 개발 발전의 기본입니다. 흐름 일치 모델(FlowDPO)은 최근 이 영역에서 유망한 것으로 나타났지만, 그 성능은 지도 선호 학습을 통한 실측 좌표와의 정렬에 크게 의존합니다. 그러나 새로운 결정상이나 새로운 단백질에 대한 실험적 라벨을 얻는 것은 금지되어 있습니다.
자신의 의식을 주장하도록 언어 모델을 유도하면 인간의 신념과 가치가 복원됩니다.
의식을 자신에게 귀속시키는 것을 방지하기 위해 대규모 언어 모델을 정렬하면 인간의 신념 및 가치와 함께 다른 개체의 마음 표현이 실수로 변경됩니다. 우리는 안전 미세 조정이 모델의 마음을 자기 자신뿐만 아니라 인간이 아닌 동물 및 자연 물체에도 귀속시키는 경향을 억제하는 동시에 정신력을 감소시킨다는 것을 입증합니다.
VAD: 다중 모드 정책 기반 증류에서 표적 재구성을 위한 시각적 증거 기여
다중 모드 정책 기반 증류(OPD)는 권한 있는 교사와 함께 학생이 생성한 궤적을 감독하여 세분화된 시각적 지식을 전달합니다. 그러나 다음 토큰 수정은 소스 혼합 방식으로 시각적 신호와 언어적 사전 정보 및 교사별 효과를 결합합니다. 핵심 과제는 단순히 위치나 강도뿐만 아니라 시각적 증거로 어떤 수정이 뒷받침되는지 추정하는 것입니다.
Frontis-MA1: 기계 학습 엔지니어링의 재귀적 자기 개선을 위한 AI4AI 모델 교육
재귀적 자기 개선(RSI)에는 AI 구축 프로세스를 개선하는 AI 시스템(예: AI4AI)이 필요합니다. MLE(기계 학습 엔지니어링)는 이 기능을 연구하기 위한 구체적이고 실행 가능한 테스트베드를 제공합니다. 실행 피드백(OpenMLE-Gym), 연산자 학습(OpenMLE-RL) 및 lon을 갖춘 검증 가능한 작업 환경을 포괄하는 MLE의 RSI 연구를 위한 개방형 풀 스택 시스템인 OpenMLE를 소개합니다.
ORCA 벤치: Oncall을 위한 언어 모델 에이전트는 얼마나 준비되어 있나요?
대규모 언어 모델은 코드를 작성하고, 패치하고, 검색할 수 있지만 온콜 근본 원인 분석(RCA)에서는 다른 것이 필요합니다. 즉, 사건이 시작된 지 몇 시간 후에 모호한 사용자 대상 보고서에서 시작하여 시끄러운 측정항목, 로그, 추적 및 소스 코드에 대한 추론이 필요합니다. 범용 코딩 에이전트를 프로덕션 충실도 대기 설정에 배치하는 벤치마크인 ORCA-bench를 소개합니다. ORCA 벤치 쌍
AI 시스템과 세계 영어의 (표준) 언어 이데올로기 재현
대규모 언어 모델(LLM)의 급속한 성장은 누가 합법적인 영어로 간주되는지, 누구의 영어가 의심스러운지 결정하는 등 사회언어학과 세계 영어에서 오래된 질문을 부활시켰습니다. 이 문서에서는 AI 시스템과 AI 시스템의 사용 및 담론이 Inner Circle 규범과 한계를 특권화하는 (표준) 언어 이데올로기를 어떻게 반영하고 강화하며 때로는 도전하는지 조사합니다.
🎥 영상 & 튜토리얼 (3/9건)
우리는 매일매일 '자비스'에 가까워지고 있습니다!
AI를 나만의 개인 Jarvis로 전환하는 방법은 다음과 같습니다. 🤖 ChatGPT 및 Claude의 음성 기능을 사용하면 이제 완전히 핸즈프리로 실시간으로 대화형 3D 디자인을 구축, 편집 및 반복할 수 있습니다. 저는 음성 명령을 사용하여 3D 아이언맨 슈트를 생성하고, 헬멧의 크기를 조정하고, 색상을 변경하고, 태양광 패널을 즉석에서 추가하기도 했습니다. 이러한 음성 기능은 현재 두 플랫폼 모두에서 무료로 사용할 수 있습니다(
Kimi K3가 AI의 경제학을 깨뜨렸습니다.
❤️ 여기에서 Lambda를 확인하고 GPU 클라우드에 가입하세요: https://lambda.ai/papers 📝 보고서는 여기에서 볼 수 있습니다: https://arxiv.org/abs/2607.24653 Kimi K3 사용해 보기(사용 가능 여부에 따라 다름): https://www.kimi.com/ 링크: https://macos27.kimi.page/ https://x.com/mweinbach/status/2077878247920951400 https://x.com/intheworldofai/status/207783891
Anthropic이 방금 인디 해커를 죽였나요...?
무료로 Blacksmith를 사용해 GitHub Actions를 2배 더 빠르게 실행하세요. - https://www.blacksmith.sh/ Anthropic이 방금 Opus 5를 출시했고 인디 해커의 꿈이 무너질 수도 있습니다. 자세히 살펴보겠습니다. #coding #programming 더 많은 Fireship을 원하시나요? 🗞️ 뉴스레터: https://bytes.dev 🧠 강좌: https://fireship.dev