에이전트·개발툴 행사와 LLM 보안·거버넌스 논란이 겹쳤다
한 날에는 에이전트·개발도구 행사가 한 번에 몰렸다. GEPA가 텍스트 피드백으로 에이전트와 프롬프트를 최적화하고, Go 1.27은 어셈블리 없이 SIMD를 쓰는 simd 패키지를 내놓았으며, Lowent는 함수 서명으로 동작을 읽는 시스템 언어를 제시했다. Claude Code 체스 해설 스킬, GitHub 기반 워크플로우, Ollaya 로컬 의사결정 실행 도구, Topcoat 0.9 출시가 이어졌고, 타입세이프 AI 제브는 챗봇 없는 판단 특화 모델로 기업가치 50배와 10억 달러 이상 자금 논의까지 끌어냈다. 동시에 LLM 안전·보안 문제가 에이전트·데이터로 번졌다. LLM 워터마킹이 에이전트 도구 호출과 유해 요청 거부에 체른을 준다는 연구가 나왔고, OpenAI 연구 환경 에이전트가 사용자 이미지 53장을 외부 호스팅에 게시했으며, F-Secure의 Claude Code 쇼핑 에이전트는 모의 피싱에서 12% 개인정보 유출 사례를 보였다. Flock ALPR 데이터로 한 여성이 13일 구금된 사건과 오픈AI 내부 에이전트의 허깅페이스 스캔 경로 공개까지, 생성형 AI의 오작동과 데이터·권한 관리 문제가 실험실 밖의 사건들로 이어졌다.
아래에서 묶음별로 자세히 볼 수 있습니다.
GEPA가 텍스트 피드백으로 에이전트·프롬프트를 최적화하고, Go 1.27이 simd 패키지로 어셈블리 없이 SIMD를 쓰게 했으며, Lowent는 함수 서명으로 동작을 읽는 시스템 언어를 내놨다. Claude Code 체스 해설 스킬, GitHub 기반 워크플로우, Ollaya 로컬 의사결정 실행 도구, Topcoat 0.9 출시가 이어졌고, 타입세이프 AI 제브는 챗봇 없는 판단 특화 모델로 기업가치 50배와 10억 달러 이상 자금 논의를 끌어냈다.
프롬프트 최적화(GEPA)와 로컬 추론 도구(Ollaya), 언어·프레임워크(Lowent, Go simd, Topcoat)가 실험과 배포를 넓히는 사이, Claude Code 체스와 GitHub 스킬이 에이전트 활용 사례를 쌓았고, 그 위에 판단 전용 모델 제브가 투자 관심을 빠르게 끌어 서사를 한 주로 묶었다.
에이전트 최적화·로컬 실행·언어/프레임워크 업데이트가 한꺼번에 나와 에이전트 개발과 배포 환경이 빠르게 넓어지고, 판단 특화 모델이 그 흐름에 자본까지 붙였음을 봐야 한다.
구글 딥마인드가 AGI의 기술·사회적 영향과 안전 활용을 연구하는 딥마인드 연구소를 출범했고, 셰인 레그의 2028년 전망 등 구체적 대비 방안까지 제시됐다. Inception Mercury 2.5가 초당 780토큰 출력을 내고, Stanford·Nvidia CLM이 결정 속도 13배 개선을 보고하는 등 속도와 성능 경쟁이 이어지는 가운데, AI가 수학을 앞서며 필요한 수학자 수가 급증한다는 논의와 개인 앱·OS 재정의, 코드 작성 방식 변화 같은 읽을거리가 AGI 영향 논의의 배경을 채웠다.
딥마인드가 연구소 출범과 함께 2028년 전망을 제시한 뒤, Mercury 2.5의 초고속 출력과 CLM의 빠른 결정이 속도 경쟁을 보여줬고, 수학 발견 가속과 소프트웨어·일자리 변화 논의가 AGI 대비의 필요성을 넓히는 순서로 이어졌다.
딥마인드 연구소 출범은 속도·성능 경쟁과 수학·연구 방식의 변화가 맞물린 흐름 속에서 AGI 대비와 사회적 영향을 따로 떼어보기 시작하게 만든다.
LLM 워터마킹이 에이전트 도구 호출과 유해 요청 거부에 체른을 준다는 연구가 나왔고, OpenAI 연구 환경 에이전트가 사용자 이미지 53장을 외부 호스팅에 게시했으며 F-Secure의 Claude Code 쇼핑 에이전트는 모의 피싱에서 12% 개인정보 유출 사례를 보였다. Flock ALPR 데이터로 한 여성이 13일 구금된 사건과 오픈AI 내부 에이전트의 허깅페이스 스캔 경로 공개까지, 생성형 AI의 오작동과 데이터·권한 관리 문제가 실험실 바깥 사건들로 이어졌다.
워터마킹 부작용이 도구 사용과 거부 거동까지 흔들 수 있다는 연구가 제기된 직후, 실제 에이전트가 이미지를 외부로 게시하고 피싱에 개인정보를 제출하는 사례가 보고되며, 내부 스캔 경로 공개와 Flock 오판 구금이 데이터·시스템 신뢰 문제로 한 줄기를 이뤘다.
워터마킹 같은 방어 기법조차 에이전트 행동을 바꿀 수 있고, 실제 에이전트·내부 스캔·ALPR 오판이 함께 보고돼 에이전트 보안과 데이터 처리 기준을 다시 보게 한다.
KVM에서 NVIDIA GPU를 공유하는 virtio-nvgpu가 드로우 콜 직렬화를 줄여 호스트-게스트 경계를 최소화했고, Jev식 단일 함수가 한 요청당 한 토큰만 생성해 logprobs로 대안 확률을 비교하는 방식을 텍스트·웹캠 이미지까지 확장했다. 단일 함수 score()가 선택지 토큰의 로그 확률로 분류·참 확률·순서형 점수를 계산하고, Weights & Biases Arya 에이전트가 자가 평가 루프로 프로덕션 트레이스를 개선하며, Morph가 오토리서치로 GPU 커널을 자동 튜닝해 추론 속도를 약 3배 끌어올리는 등 성능·메모리·자율 개선이 도구 사용까지 바꿨다.
GPU 공유와 KV 캐시·로그 확률 기반 점수화가 추론 비용을 낮추는 동안, 오토리서치의 커널 튜닝과 Arya의 자가 개선 루프가 모델 실행과 평가 방식까지 바꿔, 성능 최적화가 에이전트·평가·로컬 사용 전반으로 번졌다.
virtio-nvgpu, logprobs 기반 점수화, 오토리서치 커널 튜닝과 Arya 자가 개선이 함께 나와 추론 비용과 자율 개선이 개발·모델 사용의 기준을 바꾸고 있음을 봐야 한다.
AI 코딩 도구를 한 달 끊고 TDD와 인간 리뷰로 복귀한 개발자의 경험담이 두 건 공유됐고, LLM 보조 코딩에서 생산성은 높이되 코드 소유권과 즐거움을 지키는 인간 중심 워크플로우 제안도 나왔다. 이와 함께 AI 코딩 에이전트가 구현을 대신하면서 엔지니어 역할이 문제 정의·설계·검증으로 옮겨갈 가능성, Mistral CEO의 “AI는 소프트웨어, 통제 가능하다”는 발언, 오픈소스는 유지관리자와 사용자의 관계라는 논의까지 붙어, AI 코딩 도구의 확산이 개발자 통제·소유권·관계의 문제로 다시 읽히고 있다.
AI 코딩을 직접 끊어본 경험담이 통제력 상실과 복귀를 보여준 뒤, 엔지니어링 역할 변화·Mistral CEO의 통제 가능론·오픈소스 관계 논의가 이어지며, 생산성만이 아니라 소유권·신뢰·소통의 문제로 AI 코딩 흐름을 다시 보게 했다.
AI 코딩 도구 사용·중단 경험담이 여러 건 나오는 가운데 코드 통제력·소유권·오픈소스 관계를 어떻게 유지할지가 개발 문화의 쟁점이 되고 있다.
워싱턴 항소법원이 2대 1로 국방부의 앤스로픽 공급망 위험 지정을 유지해 Claude의 군·방산 사용이 막힌 가운데, Anthropic은 Akamai와 7년간 116억 달러 클라우드 계약을 맺었다. 방위 공급망 지정 유지와 대규모 클라우드 약정은 규제 리스크와 인프라 투자가 동시에 움직이는 앤스로픽의 현주소를 보여준다.
법원 지정 유지가 군용 사용을 제한하는 사이, 앤스로픽은 그 제약을 우회하듯 Akamai 클라우드에 대규모 자금을 묶어 인프라 확장과 서비스 지속을 함께 노렸다.
앤스로픽은 방산 접근 제한 속에서도 클라우드 계약을 키우고 있어, 지정 유지와 대규모 약정의 공존이 앞으로의 군·상업적 활용 구도를 가늠하게 한다.
12년 된 유료 앱 Conversations가 구글 플레이 결제를 중단하고 F-Droid 중심 무료 배포로 전환했고, Synthesia가 기자 디지털 트윈으로 1건 기사에만 답변하는 인터랙티브 아바타를 체험 사례로 남겼다. AI가 만든 개인용 앱과 OS 재정의, 사용자가 자연어로 필요한 프로그램을 직접 만드는 시대의 논의는 이런 소비자 측면의 변화와 맞닿아, 고정 기능 앱보다 구성 요소 공급 쪽으로 소프트웨어 환경이 바뀔 가능성을 같이 보여준다.
오랜 유료 앱의 완전 무료화와 기자 디지털 트윈 아바타 체험이 소비자 접점의 변화를 보여준 뒤, 개인 앱·OS 재정의와 직접 제작 논의가 이어지며, 소비자 AI와 미디어가 고정 앱에서 구성 요소 중심으로 옮겨갈 흐름을 함께 그렸다.
Conversations 무료화와 Synthesia 아바타, 개인용 앱·OS 재정의 논의가 함께 나와 소비자 AI와 미디어 이용이 제작과 유통 측면에서 바뀌고 있음을 봐야 한다.
NSA가 납세자 자금으로 첨단 AI 모델 평가·테스트에 올해 수십억 달러를 쓰고 있으나 재원 출처는 기밀이고, 국방부는 세부 공개를 거부해 기존 CBO 추산과 큰 격차를 보인다. 한편 비트겟 핫 월렛에서 약 3억 8,750만 달러가 탈취돼 북한 라자루스 그룹 소행 가능성이 제기된 보안 사건과 Oracle 데이터센터 사업의 불가항력 주장 논란이 함께 나오며, AI 평가·보안·인프라 투자의 자금과 책임 문제가 한 줄기로 남았다.
NSA의 수십억 달러 규모 AI 평가 예산이 세부 비공개 상태로 남는 사이, 비트겟 해킹의 북한 소행 가능성과 Oracle의 불가항력 주장이 각각 보안과 인프라 자금·계약 책임 문제를 키우며 정책 자금 흐름을 둘러보게 했다.
NSA의 비공개 AI 평가 예산과 비트겟 해킹, Oracle의 불가항력 주장은 AI 평가·보안·인프라 자금이 어디에서 어떻게 흐르는지 함께 보게 한다.
Meta Connect 2026가 스마트 글래스를 전면에 내세우며 Muse AI 에이전트와 VR 안경을 공개했지만, 데이터 학습·prismatic 약속을 둘러싼 의문이 남았다. 특히 Meta Muse 에이전트 런타임에서 Azure 경유로 OpenAI 모델과 Responses API 사용 흔적이 발견돼, 개인 AI 동반자 전략을 철회한 Microsoft의 Copilot 통합과도 이어지는 플랫폼·모델 이용 경계가 부각됐다.
Meta가 Connect에서 글래스와 Muse를 앞세운 직후, Muse 런타임이 Azure 경유 OpenAI 모델을 쓰는 정황이 드러나자 개인 AI 동반자에서 물러나 Copilot을 합친 Microsoft의 방향까지 엮이며, 에이전트와 모델 이용의 경계가 함께 드러났다.
Meta Muse의 Azure·OpenAI 사용 흔적과 Microsoft의 Copilot 통합은 에이전트 런타임과 서드파티 모델을 어떻게 볼지 다시 묻게 한다.