Z.ai, 잠행 모델 Ox Alpha 정체 공개
엿새간 무료로 풀렸던 익명 모델의 정체가 밝혀지면서, 개발자들은 값싼 오픈웨이트 대안으로 기본 스택을 바꿀지 저울질하게 됐다.
엿새간 무료로 풀렸던 익명 모델의 정체가 밝혀지면서, 개발자들은 값싼 오픈웨이트 대안으로 기본 스택을 바꿀지 저울질하게 됐다.
EchoWM은 오디오·화면을 동기화해 생성하는 월드모델로, 6자유도 궤적으로 조작 방식을 통일했지만 1인칭과 3인칭의 회전 처리 차이, 장기 공간 기억의 한계는 여전히 남아 있다.
프론티어 모델과 오픈웨이트 모델은 서로 대체하지 않고 처리량과 수익이 갈리는 방식으로 공존하며, 규제·비용·위험도에 따라 작업별로 배분해야 하고 새로운 판단은 사람이 맡는다.
AI 코드 리뷰의 반영률은 저장소마다 0%에서 100%까지 차이가 나고, 이는 모델 성능이 아니라 조직 규칙·설정·검증 체계의 차이에서 비롯된다.
같은 모델이라도 하네스와 실행 루프 구조에 따라 성능·비용·사고 위험이 크게 달라지며, 재시작 후 이어가는 실행·정책 집행·트레이스 기록 여부가 루프를 인프라로 볼 수 있는지 가른다.
같은 모델이라도 도구 호출 방식과 컨텍스트 관리 같은 스캐폴드에 따라 토큰 비용과 성공률이 크게 갈린다는 벤치마크 결과를 정리한다.
니체의 도덕 계보학을 대화형 AI에 적용해, 답의 옳음이 실은 평가자와 강화학습 설계에서 나온다는 점과 사용자에게 동의만 하는 AI가 스스로 판단하는 힘을 앗아가는 문제를 다룬다.
AI로 요약을 받아 공부한 학생은 시험 당일엔 비슷했지만 하루 뒤 점수가 크게 낮았고, 스스로 답을 구성한 쪽이 더 오래 기억했다.
AI가 내놓는 답이 빠르게 나올수록 사용자는 다른 가능성을 덜 찾게 되고, 판단의 범위는 이미 모델이 정해 놓은 경우가 많다는 내용을 다룬다.
LLM은 세션이 끝나면 컨텍스트가 비워지고, 사람의 기억도 온전한 보관이 아니라 매번 다시 불러 쓰는 과정에 가깝다. 다음 순간으로 무엇을 넘기고 어떻게 다시 불러올지가 존재의 연속성을 만든다.
AI가 반례를 빠르게 찾아내며 야코비안 추측과 단위거리 추측을 무너뜨렸지만, 진술의 정확성과 형식화 코드의 검토는 여전히 사람 몫으로 남는다.
에이전트의 응답 속도는 모델 자체보다 턴 수와 도구 호출 설계에서 갈린다. Egnyte 사례를 통해 위임 구조 축소, 프롬프트 캐싱, 도구 반환값 설계가 지연시간을 줄이는 과정을 다룬다.
생성형 AI 도입에서 성능 경쟁은 최고급 모델 사용량에 집중돼 왔지만, 실제 운영에서는 모델을 어느 단계에 배치하는지가 비용과 결과를 함께 결정한 사례를 다룬다.
에이전트 지시가 길어질수록 일부가 누락되거나 형식만 맞춘 결과가 나오기 쉽고, 규칙을 코드와 검증기로 옮겨 스키마·토큰·접근성 기준을 기계가 확인하게 하는 편이 안정적이다.
Netflix는 LLM을 별도 시스템이 아니라 기존 추천 서빙 레일에 올렸고, 배치 처리와 디코딩 제약 같은 세부 구현에서 자체 서빙 여부를 가르는 기준을 보여준다.
Shopify는 판정 모델의 일치도를 사람 수준까지 끌어올린 뒤 실패한 대화를 교정해 학습 데이터로 삼았고, SFT와 GRPO를 거친 특화 모델은 프론티어 모델보다 낮은 비용으로 더 나은 성능을 냈다.
Claude가 정답을 증명한 것이 아니라 하한선만 끌어올린 것이므로, 리만 가설은 여전히 미해결로 남아 있고 나머지 32.75%에 대해서는 아무것도 밝혀지지 않았다.
검색 결과가 질문과 관련 있어도 답에 필요한 정보가 빠져 있을 수 있다. Google의 Agentic RAG는 초안을 만든 뒤 근거가 충분한지 다시 판정하고, 부족하면 빠진 부분을 검색어로 바꿔 재검색한다.
공개된 언어모델 62개의 인용 추적 결과 출시가 늦을수록 사용 정점까지 걸리는 시간과 수명이 매년 줄었고, 2025년까지 오래 쓰인 모델은 모두 웨이트가 공개된 사전학습 베이스 모델이었다.
AI 에이전트의 검색 성능은 검색 알고리즘 자체보다 하네스와 결과 전달 방식에 더 크게 좌우되며, grep과 벡터 검색의 우열도 조건에 따라 뒤바뀐다.
에이전트가 대화 기록을 저장했다 불러오는 것과 가중치가 실제로 바뀌는 학습은 다른 과정이며, 검색 기반 기억만으로는 처음 보는 조합 문제를 푸는 능력이 늘지 않는다.
LLM 응답 속도는 초안을 순차로 만드는 구간에서 막힌다. DFlash는 이 초안을 블록 단위로 한 번에 채워 같은 응답 속도로 처리 가능한 요청 수를 크게 늘렸다.
AWS와 Cisco가 아홉 가지 RAG 방식을 비교한 결과, 검색은 정답의 83.5%를 찾았지만 답변에 반영된 비율은 47.9%에 그쳤다. 컨텍스트 앞부분 정보만 주로 쓰였고 관계를 압축해 걸러낸 GraphRAG는 토큰을 줄이면서도 성능을 유지했다.
모델의 판단력이 좋아질수록 프롬프트의 세세한 규칙은 오히려 방해가 되고, 낡은 규칙이 쌓이면 새 규칙까지 신뢰를 잃는 과정을 사례로 설명한다.
2.4조 파라미터급 오픈 웨이트를 예고하며 성능 경쟁의 축을 벤치마크 점수에서 '수일 단위 자율 실행'으로 옮기고 있다.
AI가 즐겨 쓰는 단어가 실제 대화에도 퍼지고 있으며, 이런 어휘가 전문성의 표지로 굳어지는 동안 지역 표현과 소수 언어 신호는 반복 학습 속에서 점점 옅어지고 있다.
에이전트 메모리는 통째로 요약해 덮어쓰면 정확도가 오히려 떨어진다. ACE 연구는 항목 단위로 추가하고 성공률을 기록해 만료시키는 방식이 정확도와 비용을 함께 지킨다는 결과를 보여준다.
AI가 제시한 형식 증명 자체는 논리적 정합성만 보증할 뿐 문제 정의의 정확성이나 결과의 신규성은 검증하지 못해, 결국 독립적인 수학자들의 검토가 성패를 가를 다음 관문으로 남는다.
전신 제어·다중 로봇 협업·수시간 내 새 바디 적응까지… 물리 AI의 범용화 신호
2.8T급 파라미터를 소비자용 GPU에서도 실험 가능하게 만든 MXFP4 양자화와 매출 연동형 라이선스가, 프론티어 성능과 상업적 접근성을 동시에 여는 새로운 오픈웨이트 공개 방식을 보여준다.
Grok 4.5가 만든 반례 자체보다, 검증 가능한 조합 문제에서 AI가 후보 생성기 역할을 빠르게 대체하고 있다는 점이 이 사건의 핵심이다.
초지능이 우주를 다 설명해도 신비가 사라지는 게 아니라, 이해의 주체와 경외감이 남는 문제로 형태를 바꾼다는 에세이.
토큰당 비용과 지연 시간을 낮춘 경량 모델로 승부수를 던지면서, 아직 나오지 않은 3.5 프로의 공백을 당분간 플래시 라인업으로 메우려는 전략이 드러난다.
스타킹 선택부터 트랜스포머의 경사하강법까지, 이해는 설명 가능성이 아니라 낯선 조건 앞에서도 스스로 갱신되며 버티는 능력으로 검증돼야 한다는 논증.
Fable 5가 후보를 생성하고 연구자가 검증하는 협업으로 결과가 나왔다는 점에서, 창의적 발견 단계에서도 AI가 실질적 역할을 맡기 시작했다는 신호로 읽힌다.
카파시가 말한 에이전트의 본질은 신비한 지능이 아니라 데이터 증류이며, 기업은 모델 크기보다 데이터 품질과 폐쇄 루프 설계에 집중해야 한다는 시사점을 정리한다.
25개 언어모델이 같은 은유로 수렴하는 현상부터 모델 붕괴·인간 창의성 균질화까지, AI 하이브마인드가 만드는 표현 다양성의 침식과 그 처방을 다룬다.
챗봇 사용성 검증보다 앞서, 실제 프론티어급 성능 여부는 제3자 벤치마크가 나와야 판가름 나기 때문에 당장은 발표사 자체 주장으로만 받아들여야 한다.
문샷AI의 Kimi K3 공개가 던지는 질문은 성능 우위가 아니라 오픈웨이트가 지능의 희소성과 실행권 통제를 어떻게 바꾸는가다.
데미스 하사비스가 예고한 몇 년 내 AGI 도래를 앞두고 권한·소유·인간 정체성이라는 세 가지 사회적 숙제를 짚는다.
하네스 엔지니어링이 뜨는 지금, 리처드 서튼의 Bitter Lesson이 모델 위 애플리케이션 레이어에서도 반복되며 하네스가 결국 모델에 흡수되는 이유를 분석한다
존재의 이유를 묻는 오랜 철학 질문을 Fable5와 Sol5.6 두 AI에게 던져 토론시킨 기록.
Grok 4.5의 파격 가격과 토큰 효율이 AI 경쟁축을 성능에서 비용으로 옮기는 전환기 신호인지, 생태계 경쟁의 서막인지 분석한다.
자연스러움을 측정하는 AI 산업엔 조작적 정의가 없다는 사실을, 처리 유창성·불쾌한 골짜기·가족 유사성 이론으로 설명한다