AI 연구 스포트라이트: OpenSeeker-v2 검색 판도 변화, CropVLM 농업 진출, 에이전트 벤치마크
OpenSeeker-v2: 만 개 샘플의 파괴
검색 신생 기업이 수십억 달러 훈련 예산 없이도 경쟁할 수 있다는 것을 증명했다. OpenSeeker-v2가 1만 개 데이터 샘플에 대한 SFT 훈련만으로 검색 리더보드 정상에 올랐다 — 빅테크의 조 단위 토큰 훈련이 비교적 낭비로 보일 정도다. 전체 논문은 학술팀이 어떻게 이를 달성했는지 상세히 설명하며, 모델은 이제 완전 오픈소스로 공개됐다.
시사점은 기존 업체에게 불편하다: 1만 개의 큐레이션된 샘플로 소규모 팀이 웹스케일 데이터로 훈련된 모델을 능가할 수 있다면, 수십억의 컴퓨팅 비용은 정확히 무엇을 위한 것일까?
CropVLM: AI가 농장으로
대부분의 AI 연구가 챗봇과 코드 생성에 집중하는 동안, CropVLM은 더 현실적인 문제를 다룬다: 작물 분석. 모델은 시맨틱 정렬을 통해 30개 이상의 작물 품종을 마스터했으며, 70% 이상의 분류 정확도를 달성했다 — 드론 영상에서 밀밭의 질병을 탐지하려 할 때 중요한 숫자다.
GitHub의 HOS-Net 프레임워크는 모델이 명시적으로 훈련받지 않은 작물 유형의 제로샷 탐지를 가능하게 한다. 대규모 식물 형질 측정인 표현형 분석이 전통적인 컴퓨터 비전으로는 불가능했던 방식으로 실용화되고 있다.
ClawMark: 에이전트가 생각보다 나쁘다
에이전트 데모에 감명받았다면 ClawMark가 현실을 깨줄 것이다. 동적 오피스 시나리오에서 AI 동료 모델을 위해 특별히 설계된 이 벤치마크는 스크립트 기반 객관적 채점으로 100개 이상의 전문 태스크를 다룬다. 결과: 주류 모델은 긴 워크플로우에서 고작 20%의 성공률을 기록한다.
데모와 현실의 격차는 극명하다. 세 단계 태스크에서 유능해 보이는 에이전트가 분기 결정이 있는 20단계 워크플로우에서는 무너진다. 능력이 아닌 적응력이 병목이다.
AniMatrix: 물리보다 예술
AniMatrix는 비디오 생성에 의도적으로 다른 접근법을 취한다. 엄격한 물리 시뮬레이션을 강제하는 대신 예술적 표현을 우선시한다 — 애니메이션에 생명을 불어넣는 역동적이고 과장된 움직임이다. AniCaption 시스템은 카메라 움직임, 캐릭터 표정, 씬 페이싱 같은 제작 변수를 자동으로 추출한다. 팀은 예술 모션 점수가 비교 가능한 모델을 훨씬 능가하며, 곧 가중치를 오픈소스로 공개하겠다고 약속했다.
Microsoft의 자기 설명 에이전트
Microsoft Research는 에이전트 모델이 자율적으로 반복하여 정확하고 사람이 읽을 수 있는 회귀자를 생성하는 새로운 해석 가능성 프레임워크를 제안했다. 소규모 모델이 텐서를 계산하는 대신 문자열 표현을 읽어 정밀한 예측을 달성하며, 수십 개의 데이터셋에서 전통적인 통계 모델을 크게 능가하고 BLADE 벤치마크에서 최고를 기록했다.

종합하면, 이 다섯 편의 논문은 일관된 이야기를 말한다: 프론티어가 “더 큰 모델”에서 더 똑똑한 훈련, 특화 도메인, 정직한 평가, 해석 가능한 출력으로 이동하고 있다.