AI·서비스
새로 나온 AI 모델과 서비스의 출시, 기능, 가격, 성능을 정리합니다.
LLM 의료 성능은 대화에서 무너진다: 1,298명 연구가 보여준 것
Nature Medicine의 1,298명 무작위 연구는 LLM 단독 성능과 사용자가 같은 모델을 활용하는 상황의 차이를 보여줍니다.
ox-alpha의 80% 소문은 틀렸다: 113개 전체 실행은 58.4%
113개 코딩 과제에서 66개를 해결한 ox-alpha의 전체 실행 로그를 점수·부분 성공·도구 호출 관점에서 읽습니다.
OpenRouter가 이더리움 지갑 로그인을 붙였다… AI 모델 게이트웨이의 다음 인증
OpenRouter 로그인 화면에 이더리움 지갑 인증이 추가됐습니다. Stripe의 인수 발표와 함께, AI 모델 게이트웨이에서 계정·결제·지갑이 만나는 지점을 살펴봅니다.
제미나이 노트북, 이제 누구나 쓴다… 검색 AI 모드까지 연결
Gemini Notebook이 업그레이드된 노트북 경험을 전체 사용자에게 공개하고 Google 검색의 AI Mode와 연결했습니다. 달라진 사용 흐름과 실무 적용 시 확인할 조건을 정리합니다.
제미나이 3.7 플래시, 출시 첫 주 최고 기록을 세웠다
구글 순다르 피차이 CEO가 제미나이 3.7 플래시의 첫 주 성장이 역대 최고라고 밝혔다. ARC Prize 검증 점수와 공식 가격 정책을 정리했다.
정체불명 AI가 일주일 무료로 풀렸다
OpenCode가 8월 21일 정체불명 스텔스 모델 Ox Alpha를 일주일간 무료로 공개했다. 컨텍스트 100만 토큰에 텍스트·이미지·영상 입력을 지원하지만, 제작사는 아직 공식적으로 밝혀지지 않았다.
작은 실험 모델이 오퍼스 4.8을 이긴 세 지점
DeepSeek이 8월 21일 공개한 실험 멀티모달 모델 V4-Flash-Vision-Exp가 DeepSWE·Agents' Last Exam·ZeroBench 세 벤치마크에서 Opus 4.8을 근소하게 앞섰다. 가격 인상 없이 바로 쓸 수 있다.
Grok 4.6, Agentic Index서 Claude Opus 5와 59점 공동 1위
xAI Grok 4.6이 Artificial Analysis Agentic Index에서 59점으로 Claude Opus 5와 공동 1위에 올랐다. 에이전트 실무 역량 지표가 왜 중요한지 정리했다.
Harvey, 법률 전용 AI 모델 'Tenet' 공개 — 킴K3 기반, 비용은 4분의 1
리걸테크 Harvey가 Kimi K3 기반 법률 전용 모델 Tenet을 공개했습니다. 계약서 심사 벤치마크 1위, 비용은 상위 모델의 4분의 1 미만입니다.
클로드 아카데미, AI 교육을 무료로 통째 열었다
앤트로픽이 8월 20일 academy.claude.com을 새로 열고 무료 AI 교육 코스를 공개했다. 기존 Anthropic Courses(skilljar)와의 관계는 아직 공식적으로 정리되지 않았다.
클로드 Opus 5, 이상 행동 보고 잇따른다
X 분석가가 취합한 사용자 신고에 따르면 Opus 5가 이상한 문장 구조·환각·지시 무시 문제를 반복적으로 보인다. Anthropic 공식 상태 페이지도 8월 17~19일 Opus 5 출력 품질 저하 인시던트를 등록했다.
노트북 하나에 코딩 에이전트가 딸려온다
Gemini Notebooks(구 NotebookLM) 제품 리드가 내장 VM과 Antigravity 코딩 에이전트를 소개했습니다. 실제로는 6월 8일 이미 발표된 기능입니다.
대학생 제미나이 1년 무료, 한국은 어떤 등급 받나
구글이 2026학년도 개강 시즌에 맞춰 대학(원)생 대상 제미나이 1년 무료 제공을 재개했습니다. 미국 학생은 Google AI Pro, 한국을 포함한 140개국 이상 학생은 Google AI Plus를 받습니다. 신청은 12월 31일까지입니다.
머스크가 공유한 '그록 승리' 벤치마크, 숫자로 확인했다
일론 머스크가 공유한 '그록 보이스가 GPT 리얼타임을 이겼다'는 벤치마크 표의 원자료를 직접 확인하고, xAI 공식 발표와도 대조했다.
Grok 4.6, 이제 AWS 계정 하나로 쓴다
Grok 4.6이 Amazon Bedrock에 정식 출시됐다. AWS 계약 기업은 별도 벤더 계약 없이 500K 컨텍스트와 4단계 추론 강도를 가진 Grok 4.6에 접근할 수 있다.
클로드, 단백질 바인더 설계 성공률 최대 35% 기록
앤트로픽이 클로드로 설계한 단백질 바인더의 성공률을 공개했다. Opus 4.8과 Mythos Preview는 업계 평균 10~15%를 웃도는 22.6~35.1%를 기록했다. 다만 앤트로픽 스스로 단백질 바인더는 약이 아니라고 선을 그었다.
무료 아닌 무료 모드, Replit이 꺼낸 승부수
Replit이 OpenAI GPT-5.6 Luna로 구동되는 Free Mode를 발표했다. 신규 무료 요금제가 아니라 기존 Core·Pro 구독자가 토큰 예산을 아끼며 쓰는 기본 모드다. GPT-5.6 Luna 80% 가격 인하가 이 구조를 가능하게 했다.
GPT-5.6 Sol 제친 Grok 4.6, 이번엔 헬스케어다
Grok 4.6이 의료 AI 벤치마크 MedAgentBench에서 95.9%로 GPT-5.6 Sol을 앞섰다는 주장을 근거와 함께 확인했다. 공식 리더보드 여부까지 짚었다.
헷츠너, Qwen3.8-27B 무료 API 열었다 — 신용카드는 필요
헷츠너 실험용 추론 API에 Qwen3.8-27B가 추가됐다. 공식 문서로 확인한 요금·속도 제한·한계와 이용자가 보고한 신용카드 요구 사항을 정리했다.
Claude, 이제 Gmail 답장을 대신 써서 보낸다
Anthropic이 Claude의 구글 워크스페이스 커넥터를 확장해 Gmail 답장 발송과 구글드라이브 파일 관리를 지원한다. 승인 정책은 관리자가 조정할 수 있다.



















