번역이 포함된 일일 선별된 AI 연구 논문
고령 성인이 약 복용을 놓친 후, 소프트웨어 에이전트는 추가 알림을 보낼 수 있고 구현 에이전트(Embodied Agent)는 약을 가져다줄 수 있다. 그러나 어느 쪽도 그 사람이 단순히 잊었는지, 혼란스러운지, 부작용이 있는지, 아니면 의도적으로 거부했는지를 설명하지 못하며, 어떤 지원이 적절한지도 제시하지 못한다. 이는 에이전틱 AI(Agentic AI)의 구조적 공백을 드러낸다. 디지털 에이전트는 주로 소프트웨어 상태를 변환하고, 구현 에이전트는 물리적 상태를 변환하지만, 어느 쪽도 변화하는 인간의 상태와 행위 주체성(agency)을 모델링, 개입, 평가의 일차적 대상으로 삼지 않는다. 우리는 결합 에이전트(Combodied Agents)를 제안한다. 이는 소프트웨어 도구, 센서, 웨어러블, 로봇, 인간 서비스를 최종 목표가 아닌 행동 채널로 활용하여, 시간에 따른 개인의 인간 상태 궤적을 인지하고 모델링하며 예측하고 지원하는 인간 중심 패러다임이다. 우리는 개인 비서, 건강 에이전트, AI 동반자, 적응형 인간-AI 시스템에 걸쳐 파편화된 역량들을 하나의 폐루프(closed loop)로 통합한다. 즉, 사건 기반 다중 양식 인식(event-based multimodal perception)이 의미 있는 개인 사건을 재구성하고, 종단적이며 수정 가능한 기억이 시간적 맥락을 제공하며, 개인 세계 모델(Personal World Models)이 대안적 결정과 개입 하에서의 미래 개인 상태와 결과를 추정하고, 허용 가능한 개입 정책(admissible intervention policy)이 동의, 불확실성, 안전성, 가역성, 사용자 통제 하에 비례적 지원을 선택한다. 개인과 환경으로부터의 피드백은 루프를 갱신한다. 이 프레임워크는 포괄적인 인간 디지털 트윈(Human Digital Twin)을 요구하지 않으며, 목적에 한정되고 불확실성을 인지하며 사용자가 수정할 수 있는 표상을 사용한다. 우리는 인간 상태 목표, 관계적 맥락, 에이전트 역할에 따라 설계 공간을 조직화하고, 시나리오 중심 평가, 행위 주체성 보존 지표, 벤치마크 요구사항, 엣지 네이티브 개인 모델, 거버넌스 방향을 제안한다. 결합 에이전트는 에이전틱 AI를 외부 과업 완수에서 지속적 인간 이익으로 전환한다.
에이전트 시스템은 배포 이후에도 개선될 것으로 점점 더 기대되고 있지만, 단일 개체의 자기 진화는 고정된 작업과 피드백과 같은 정적 학습 맥락에 의해 종종 제약을 받는다. 본 서베이는 에이전트 시스템에서의 공진화를 중점적으로 다루는데, 이는 다중 구성 요소 형태의 자기 진화로서 여러 에이전트와 그 환경이 서로에게 적응적 압력을 가하는 방식이다. 기존 논문들을 체계화하기 위해, 우리는 시스템이 인간이 설계한 제약을 점진적으로 벗어나는 과정을 추적하는 점진적 3단계 분류 체계를 제안한다. 에이전트-에이전트 공진화는 에이전트가 적대적, 협력적, 조직적 적응을 포함한 역동적 동료를 통해 적응하는 방식을 연구한다. 에이전트-환경 공진화는 이러한 루프를 에이전트와 함께 변화하는 적응적 작업, 피드백, 상호작용 공간으로 확장한다. 메타 공진화는 진화 메커니즘 자체를 진화 가능하게 만드는 가능성을 더 탐구한다. 우리는 또한 이러한 시스템을 평가하고, 여러 구성 요소에 걸쳐 확장하며, 점점 더 자율적인 진화 과정을 안전하고 통제 가능하게 유지하는 데 있어서의 미해결 과제들을 논의한다. 본 서베이는 고정된 인간 설계 경로를 넘어 개선될 수 있는 강건하고 개방형 에이전트 시스템을 구축하기 위한 통합적 기반을 제공한다.
4D 생성은 텍스트나 이미지와 같은 조건으로부터 동적 3D 장면을 합성한다. 기존 방법들은 생성된 RGB 비디오를 별도의 4D 모델로 재구성하거나, 특정 비디오 생성기를 변형하여 기하 구조를 직접 예측한다. 전자는 분포 불일치와 오류 전파 문제를 겪는 반면, 후자는 4D 예측을 특정 생성기에 종속시키며 생성기나 조건 설정 방식이 변경될 때 재훈련이 필요할 수 있다. 본 연구는 변분 오토인코더(VAE)를 공유하는 비디오 모델들의 최종 노이즈 제거 잠재 변수가 명시적 4D 예측을 위한 재사용 가능한 인터페이스를 제공할 수 있는지 묻는다. 이러한 통찰을 바탕으로, 본 연구는 RGB를 우회하여 비디오 잠재 변수를 사전 훈련된 4D 디코더의 토큰 그리드에 정렬하고 프레임별 및 전역 시공간 어텐션을 통해 이를 정제하는 직접 잠재-대-4D 생성을 도입하고, 이를 Latent-to-4D로 구현한다. 약 1K개의 기존 재구성 클립으로 훈련된 단일 체크포인트는 동일한 VAE 계열 내의 여러 비디오 확산 트랜스포머에 걸쳐 변경 없이 전이된다. Text4D-200 및 I4D-200에서 Latent-to-4D는 동일 잠재 변수를 사용하는 Wan+4RC 캐스케이드를 프로젝션 기반 DINO-F1에서 각각 2.88–3.45점 및 5.81점 능가하며, 기하 구조, 시간적 안정성, 전반적 품질 측면에서 인간 평가자들의 선호도 또한 더 높았다.
대화형 디지털 트윈을 구축하려면 객체가 어떻게 관절 운동을 수행하는지를 결정하는 3D 기하 구조와 운동학적 구조를 모두 복원해야 한다. 그러나 기존의 관절 객체 재구성 방법은 여러 관절 상태에서 명시적으로 관찰 가능한 움직임을 요구한다. 우리는 단일 닫힌 상태에서 관절 객체를 재구성하는 정지 상태 기반 정식화를 도입한다. 이는 기하·의미·움직임 사전이 움직임 단서의 부재를 보완해야 하는 본질적으로 ill-posed한 설정이다. 본 프레임워크는 명시적 메시를 교차 모델 검증 및 융합을 위한 중간 표현으로 사용하여, 비전-언어 모델과 분할 모델의 잡음이 많은 출력을 공간적으로 일관된 부품 구조로 조정한다. 관찰된 움직임 없이 관절 파라미터를 추정하기 위해, 비디오 확산 모델을 활용하여 관절 운동 가설을 합성하고 기하학적 일관성을 통해 이를 검증한다. 우리의 접근 방식은 정확한 부품 분해와 물리적으로 타당한 관절 운동을 달성하며, 움직임 관찰 기반 재구성 방법, 생성 기반 방법, 모듈형 사전 훈련 모델 기준선과 경쟁력 있는 성능을 보인다.
프레셰 거리(Fréchet distance)는 최근 생성기 사후 학습(generator post-training)을 위한 효과적인 분포 수준 목적 함수로 부상하면서, 기존의 샘플 수준 확산(diffusion) 및 플로우 매칭(flow-matching) 손실을 보완하고 있다. 그러나 프레셰 목적 함수를 직접 최적화하면 프레셰 해킹(Fréchet hacking)이 발생할 수 있다. 목표 지표는 지속적으로 개선되지만, 시각적 품질과 다른 특징 공간에서의 프레셰 정합성은 정체되거나 악화될 수 있다. 우리는 이러한 실패의 원인을 기존 프레셰 손실들이 사용하는 정적 사전 학습 특징 공간(static pretrained feature space)에서 찾는다. 이러한 특징 공간은 실제 분포와 생성 분포 간의 차이에 대해 불완전하고 고정된 관점만을 제공한다. 이 한계를 해결하기 위해 우리는 적대적 프레셰 거리(AdvFD, Adversarial Fréchet Distance)를 제안한다. AdvFD는 FD 손실의 정적 표현 목표를 보정된(calibrated) 적대적 학습 표현으로 보완한다. AdvFD는 기존의 정적 프레셰 목적 함수에 학습 가능한 표현을 추가하여, 해당 표현이 실제 샘플과 생성 샘플 간의 프레셰 불일치를 적대적으로 최대화하도록 하고, 생성기는 결과적으로 얻어진 적응형 특징 공간에서 동일한 불일치를 최소화하도록 한다. 적대적 표현이 특징 증폭(feature amplification)을 통해 목적 함수를 사소하게 증가시키는 것을 방지하기 위해, 우리는 실제 특징 백색화(real-feature whitening)를 추가로 도입하여 척도와 공분산 기하 구조를 정규화하고 최소-최대 최적화를 안정화한다. 광범위한 실험을 통해 AdvFD가 JiT 및 pMF 백본과 다양한 모델 규모에 걸쳐 단일 단계 생성기 사후 학습을 일관되게 개선함을 보여준다.
자기 개선형 코딩 에이전트들은 자신의 소스 코드를 반복적으로 재작성하며 코딩 작업에서 인상적인 성능을 입증해 왔다. 그러나 기존 방법들은 일반적으로 한 번에 하나의 실패 궤적에서만 자기 수정을 도출하며, 에이전트가 축적해 온 과거 시도 기록에서 얻을 수 있는 풍부한 비교 신호를 간과한다. 우리는 멘델의 통제된 유전 원리에 따라 멘델 괴델 기계(MGM)를 제안한다. 일반적인 단일 궤적 클론 돌연변이 외에도, MGM은 축적된 증거를 더 잘 활용하는 두 가지 새로운 자기 수정 유형을 포함한다. 반응 규범 돌연변이는 여러 작업에 대한 에이전트의 궤적을 동시에 기반으로 에이전트를 편집하며, 계통 간 교잡은 동일한 작업에서 다른 계통의 참조 에이전트 궤적을 사용하여 에이전트를 편집한다. 우리는 가산적 적합도 풍경 모델 하에서 새로운 전략들이 단일 궤적 기준선들보다 더 빠르고 더 나은 수렴을 촉진함을 이론적으로 증명하고, 통제된 대리 시뮬레이션을 통해 입증한다. SWE-bench와 Polyglot 실험은 MGM이 성능, 효율성, 일반화 가능성에서 일관된 개선을 보인다는 것을 확인한다.
대규모 언어 모델(LLM) 에이전트는 점점 더 개인 비서로 배포되고 있다. 그러나 기존 평가들은 대부분 정적 환경에서 짧고 독립적인 요청을 사용한다. 일상생활 지원은 상황이 다르다. 작업은 몇 분이 아니라 몇 주에 걸쳐 진행된다. 에이전트가 프롬프트를 받지 않는 동안에도 세계는 계속 변화한다. 많은 제약 조건은 명시적으로 언급되지 않는다. 눈앞의 요청에 단순히 응답하는 에이전트는 그러한 과제에서 실패할 것이다. 대신 필요한 것은 능동적이고 일관성 있는 에이전트다. 언제 행동하고, 언제 질문하고, 언제 침묵할지를 스스로 결정한다. 아무도 알리지 않은 변화를 감지한다. 첫날부터 마지막 날까지 하나의 계획을 일관되게 유지한다. 현재 어떤 벤치마크도 이를 측정하지 않는다. 우리는 10개의 일상생활 영역에 걸친 200개의 장기 과제로 구성된 벤치마크인 VibeLifeBench를 소개한다. 각 과제는 22개의 모의 서비스로 구성된 시뮬레이션 세계에서의 스크립트 기반 다주간 타임라인이다. 세계는 자체 시계에 따라 진행되며, 많은 변화는 알림 없이 발생하므로 세계를 다시 점검하는 에이전트만이 이를 발견할 수 있다. 각 과제는 에이전트가 실제로 남긴 것만을 확인하는 세분화된 가중치 기반 검사로 평가되며, 최종 상태, 행동의 적시성, 암묵적 제약 조건의 준수 여부를 포함한다. 우리는 7개의 프론티어 모델을 평가했다. 모든 모델이 낮은 점수를 기록했으며, 이는 현재 에이전트들이 실제 생활을 지원하는 데 얼마나 부족한지를 보여준다. 우리는 모든 과제, 환경, 평가 프레임워크를 오픈소스로 공개할 예정이다.
옴니모달 대화 모델은 멀티모달 입력을 이해하고 음성 응답을 합성할 수 있지만, 그 응답은 시각적으로 구현되지 않은 상태로 남아 있다. 본 논문에서는 텍스트, 개인화된 음성, 참조 조건부 비디오로 구성된 조정된 응답을 생성하는 옴니모달 대화 프레임워크인 Ex-Omni-2D를 소개한다. 멀티모달 질의, 참조 이미지, 참조 오디오가 주어지면 모델은 장면, 감정, 동작을 설명하는 구조화된 시각적 사고 계획(VTP)을 예측하고, 이어서 응답 텍스트와 네이티브 다중 코드북 음성 유닛을 생성한다. 이러한 유닛은 공유 음향-시간적 인터페이스를 형성하여 음성으로 디코딩되고 비디오 프레임과 온라인으로 정렬된다. 이 인터페이스를 통해 응답 및 아바타 경로를 이종 음성, 대화, 아바타 비디오 데이터로부터 학습할 수 있어 대규모 질의-텍스트-음성-비디오 지도 학습 데이터가 필요하지 않다. 전체 시퀀스 비디오 생성기가 주요 교사(Teacher) 역할을 한다. 효율적인 증분 생성을 위해 이를 소수의 스텝으로 구성된 블록 인과적 스트리밍 학생(Student)으로 추가 증류하며, 해당 학생의 프리픽스 스트리밍 메커니즘은 연속된 청크 간에 깨끗한 잠재 표현을 전달하여 누적 후반 청크 성능 저하를 줄인다. 4스텝 추론을 통해 전체 4-GPU 파이프라인은 400×720/720×400 해상도에서 엔드투엔드 RTF 1.293을 달성하여 실용적인 품질-효율성 운영 지점을 제공한다.
대규모 언어 모델 평가는 일반적으로 정상 조건에서의 성능에 초점을 맞추며, 이는 모델이 좁고 최적화된 생성 통로를 안정적으로 걷는 듯한 능력에 대한 착각을 만들어낸다. 그러나 실제 배포 환경에서는 복잡한 시스템 프롬프트, 안전 가드레일, 구조적 제약이 지속적으로 모델을 이러한 정상 경로에서 벗어나게 하여, 벤치마크 점수와 배포 성능 간의 괴리를 유발한다. 이러한 문제를 해결하기 위해 우리는 런타임에서 로짓 공간에 직접 개입하여 모델을 정상 경로에서 강제로 이탈시키는 제로 프롬프트 진단 스트레스 테스트인 Decoding-Level Taboo를 도입한다. 단어 경계에서 주요 후보 토큰을 동적으로 마스킹함으로써, Taboo는 기계의 우회 표현을 강제한다. 여러 오픈 가중치 모델 제품군에 걸쳐 Taboo를 평가한 결과, 오프패스 강건성은 파라미터 규모와 사후 훈련 명령어 정렬에 의해 크게 영향받으며, 강건성은 일반적으로 모델 크기와 정렬 수준이 증가함에 따라 개선되는 것으로 나타났다. 본 논문에서 제시된 결과를 넘어, Taboo는 다양한 합성 데이터셋 생성, 런타임 안전 가드레일 스트레스 테스트, 실제 배포 전 모델 신뢰성 감사를 위한 새로운 프리미티브를 제공한다.
장기 지평 연구 에이전트는 반복적 검색, 집계, 종합을 통해 개방형 작업을 해결하지만, 컨텍스트는 빠르게 증가하는 반면 추가 증거의 한계 가치는 종종 감소한다. 이는 불필요한 토큰 비용, 더 높은 지연 시간, 최종 보고서 생성을 위한 입력의 잡음 증가를 초래한다. 본 연구는 심층 연구 에이전트에서 컨텍스트 관리를 위한 한계 가치 추정을 다루며, 파이프라인 전반에 걸친 가지치기 전략의 첫 번째 체계적인 단계별 비교를 제시한다. 우리는 검색 전, 검색 후, 종합 전 단계에서 경량 휴리스틱 기준과 학습된 가치 모델을 평가한다. 결과에 따르면 가지치기 효과는 특정 점수 규칙보다 가지치기가 적용되는 위치에 더 크게 의존한다. 초기 가지치기는 가장 큰 종단 간 절감을 가져오는 반면, 후기 가지치기는 주로 최종 종합 컨텍스트를 정제한다. 경량 휴리스틱은 품질 저하가 거의 없이 토큰 사용량을 최대 73%까지 줄이며, 학습된 가지치기는 선택된 절충 측면에서 경쟁력을 유지한다. 품질, 효율성, 충실성 전반에 걸쳐 어떤 단일 방법도 지배적이지 않다. 이러한 발견은 효율적인 장기 지평 에이전트 시스템을 설계하기 위한 실용적 지침을 제공한다.
자기 진화 에이전트는 성공적인 절차와 실패 수정을 추가함으로써 재사용 가능한 스킬을 축적한다. 시간이 지나면서 동일한 요구사항은 여러 분기, 예제, 경고에서 반복 기술되는 경우가 많고, 공통 동작 시퀀스는 재사용되지 않고 복사된다. 그 결과 생성된 스킬은 주입 비용이 높아지고 유지 관리가 어려워진다. 일반적인 프롬프트 압축은 이러한 상황에 적합하지 않다. 스킬은 평평한 단락이 아니기 때문이다. 스킬의 이름과 설명은 적용 시점을 정의하고, 워크플로는 실행을 제어하며, 도구 및 출력 계약은 유효성을 제한하고, 드문 예외는 샘플링된 작업이 활성화하지 않더라도 필수적일 수 있다. 평가 기반 압축은 이러한 동작을 테스트할 수 있지만, 롤아웃, 비용, 압축 시점 평가 세트에 대한 의존성을 도입한다. 본 논문에서는 스킬의 가장 짧은 충실한 구조적 설명을 찾아 압축하는 평가 없는 방법인 SkillZip을 제시한다. 그 직관은 '한 번 설명하고 여러 번 참조'하는 것이다. 즉, 반복되는 규칙을 적용되는 범위에서 한 번 기술하고, 반복되는 동작 시퀀스를 공유 절차로 분해하며, 차이만 명시적 예외로 유지한다. 우리는 이 직관을 스킬 계약과 잔차에 대한 타입 기반 최소 설명 길이 목적으로 공식화하며, 추출된 모든 트리거, 워크플로 엣지, 도구 요구사항, 의무, 출력 필드에 대해 하드 커버리지 제약을 적용한다. 이 공식은 단순한 공유 임계값을 제공하고, 구조적으로 고유한 드문 규칙을 보존하며, 효율적인 로컬 업데이트를 지원한다. SkillZip은 한 번의 구조화된 추출 호출과 결정적 최적화를 사용하는 원샷 모드와, 작업을 재생하거나 전체 이력을 다시 파싱하지 않고 각 자기 진화 패치를 통합하는 지속적 Zip-on-Write 모드를 제공한다. 포괄적인 실험 평가를 통해 우리는 SkillZip의 압축 성능, 일반화 가능성, 비용 오버헤드 측면에서 효율성과 우수성을 입증한다.
희소 혼합 전문가(Sparse mixture-of-experts, MoE) 계층은 조건부 연산을 통해 추천 용량을 확장하지만, 훈련된 체크포인트는 여전히 전체 전문가 뱅크를 저장하고 그 위에서 라우팅을 수행한다. 우리는 배포 문제를 연구한다: 명시적 전문가 예산 하에서 해당 체크포인트를 더 작은 표준 MoE로 변환하되, 압축 전용 온라인 모듈을 추가하지 않는 것이다. 이 문제를 해결하기 위해, 우리는 제약된 그래프 축소 문제로 정식화된 훈련 후 압축 프레임워크인 UniMoMo를 제안한다. UniMoMo는 파라미터 거리에 의존하지 않고, 라벨이 없는 보정 집합을 사용하여 공유된 추천 상태에 대해 전문가들이 얼마나 유사하게 반응하는지를 측정함으로써 기능적 유사성에 기반해 전문가들을 그룹화한다. 성능 저하를 방지하기 위해, 우리는 라우팅 노출도에 기반하여 트래픽이 높은 전문가들의 병합을 제한하는 계층 적응형 보호 메커니즘을 도입한다. 2, 4, 6개의 MoE 블록을 갖춘 Amazon Beauty, KuaiRec, TenRec 데이터셋 전반에 걸쳐, 최종 4-전문가 체크포인트는 원본 대비 5회 실행 평균 NDCG@10 비율 99.92%~102.30%를 달성하고, 측정된 A100 속도 향상은 1.28배~1.63배이다. 공격적인 2-전문가, top-1 운영 지점은 98.36%~104.24%의 비율과 1.47배~2.21배의 속도 향상을 달성한다. 이러한 최종 결과는 완전한 변환 및 적응 워크플로우를 평가하며, 훈련된 추천 MoE가 여러 서빙 예산으로 내보내질 수 있음을 보여준다.
시각 문서 검색(VDR)은 수십억 파라미터 규모의 모델이 주도하고 있으며, 이러한 모델은 전체 코퍼스 규모에서 인덱싱 속도가 느리고 서빙 비용이 높다. 기존 압축 방식들은 더 작은 멀티-벡터 인코더를 처음부터 학습시키거나 쿼리 측만 증류하는 데 그쳐, 어느 쪽도 엔드-투-엔드로 경량화된 단일-벡터 검색기를 산출하지 못한다. 본 논문에서는 점별 코사인 정렬 손실 하에 단일 80억 파라미터 비전-언어 교사 모델로부터 양방향으로 증류된 5억 2,400만 파라미터 규모의 엔드-투-엔드 VDR 시스템인 DistilVDR을 제시한다. 모든 지도 신호는 동결된 교사 모델의 임베딩 공간에서 비롯되며, 이 임베딩 공간 자체가 관련성 지도로 학습되었으므로 학생 모델의 목적 함수에는 관련성 레이블, 네거티브 샘플링, 대조 항이 필요 없다. 본 연구는 VDR의 텍스트 쿼리-이미지 문서 입력 비대칭성을 비대칭 인코더 전용 학생 모델로 대응하며, 이는 시각적 용량을 문서 측에 집중시키고 쿼리 측은 7,000만 파라미터로 유지한다. 동일한 인코더와 학습 방식을 공유하되 문서 인코더의 비주얼 타일 예산만 다른 두 가지 변형 모델을 공개한다. DistilVDR-HiRes는 ViDoRe v1+v2+v3에서 평균 NDCG@5 61.74를 달성하여 80억 파라미터 교사 모델 대비 86.9%의 성능을 보이며, 고해상도에 민감한 v3 벤치마크에서 재현된 모든 10억 파라미터 미만 기준 모델을 능가한다. DistilVDR-Fast는 3배 더 작은 비주얼 토큰 예산으로 59.98을 달성한다. 두 변형 모델 모두 백만 개 문서를 가장 강력한 10억 파라미터 미만 멀티-벡터 기준 모델보다 15.6배 더 작은 인덱스에 저장하며, 코퍼스 인덱싱 속도는 한 자릿수 더 빠르다. 코드는 https://github.com/Ryenhails/NanoVDR에서 이용 가능하다.
대규모 언어 모델(LLM)은 점점 더 모바일 어시스턴트로 배포되고 있으며, 이때 핵심 과제는 여러 애플리케이션(앱)에 분산된 개인 정보를 활용하여 사용자 지시를 완수하는 것이다. 그러나 전용 벤치마크가 부족하여 그 역량은 제대로 이해되지 못하고 있다. 이러한 격차를 해소하기 위해 우리는 다섯 가지 인지 능력(즉, 추론, 모호성 해소, 통합, 선호도 추론, 다중 의도 분해)에 기반을 둔 인간 직접 선별 벤치마크인 SPIEval을 소개한다. SPIEval은 10개의 앱에 분산된 4,335개의 개인 기록을 포괄하는 250개의 작업으로 구성되며, 21개의 도구를 통해 다중 턴 상호작용을 지원한다. 분석 결과, 이 벤치마크는 다양한 시나리오, 도전적인 작업, 분산된 정보, 통제 가능한 환경, 검증 가능한 결과를 나타낸다. 우리는 아홉 개의 대표적인 LLM을 평가했으며 상당한 개선 여지가 있음을 발견했다. 가장 우수한 성능을 보인 모델인 GPT-5.5(xhigh)는 57.3%의 정확도에 그쳤고, 가장 낮은 성능의 모델은 16.4%에 불과했다. 추가 분석에 따르면 실패의 79%는 부정확한 정보 위치 파악에서 비롯되며, LLM은 검증을 위해 검색을 계속하는 대신 그럴듯하지만 틀린 정보에 집착하는 경향이 있다. 또한 검색 행동 중 2% 미만만이 고급 검색 방법을 사용하며, 모델 간 검색 효율에도 상당한 차이가 있음을 발견했다. 이러한 결과는 현재 LLM 기반 모바일 어시스턴트의 근본적인 한계를 드러내며, 이 방향의 향후 연구를 촉진한다. 데이터와 코드는 https://huggingface.co/datasets/Junjie-Ye/SPIEval에서 확인할 수 있다.
우리는 오픈 대형 언어 모델을 활용한 다국어 기계 번역의 참조-자유 사후 학습을 연구한다. 지도 미세 조정된 MiLMMT-46-v0.1 모델에서 시작하여, 두 개의 참조-자유 품질 추정 모델의 평균을 보상으로 사용하고 언어 식별에 의해 게이팅되는 Group Relative Policy Optimization(GRPO)을 적용한다. 그런 다음 지도 미세 조정(SFT)과 강화 학습(RL) 모델 체크포인트를 선형 보간하여 MiLMMT-46-v1.0을 얻는다. 46개 언어 전반에 걸쳐, 결과 모델은 SFT 대응 모델에 비해 번역 품질을 일관되게 향상시키며, Seed-X, HY-MT2, TranslateGemma를 포함한 최근의 강력한 오픈 베이스라인을 능가하고, Google Translate, Gemini 3 Pro, GPT-5와 같은 평가된 독점 시스템에 대해 최고 수준의 참조-자유 점수를 달성한다. 우리는 또한 온-폴리시 증류를 추가로 조사하며, 이것이 체크포인트 보간을 통한 RL이 달성한 품질 최전선에 도달하지만 능가하지는 않음을 발견한다. 향후 연구를 지원하기 위해 모델과 코드를 공개한다.
장문서 이해는 시각적으로 풍부한 많은 페이지에 대해 추론을 수행해야 하는 경우가 많아, 추론 비용이 높아지고 컨텍스트 손상(context rot)에 취약하다. 본 연구에서는 시각 해상도를 적응형 추론 시간 자원으로 간주하는 에이전트 기반 시각 지각 프레임워크인 InSight-doc을 제안한다. InSight-doc은 저해상도에서 시작하여 보다 정밀한 증거를 얻기 위해 고해상도 영역으로 선택적으로 확대하며, 외부 검색기에 의존하지 않는다. 이러한 에이전트를 훈련하기 위해, 영역 수준 확대 궤적이 포함된 17.9K개의 고품질 SFT 예제와 19.2K개의 고난도 RL 예제로 구성된 능동 지각 코퍼스(active-perception corpus)를 구축하였다. SFT+RL을 통해 InSight-doc-8B는 문서 VQA 벤치마크에서 기준 대비 4.3~16.4 정확도 포인트를 향상시킨다. 장문서의 경우 정확도 우위를 유지하면서 환각을 40% 이상 줄이고 추론 지연 시간을 41%~68% 단축한다. 코드, 데이터셋, 모델은 https://github.com/m-Just/InSight-doc 에서 공개한다.
우리는 360도 비디오로 구축된 사실적인 환경에서 체화된 에이전트(embodied agent)의 도시 탐색 능력을 평가하기 위한 벤치마크인 360CityArena를 제시한다. 기존의 야외 벤치마크는 충분한 사실성이나 복잡성을 갖추지 못하여 실제 도시 환경과 상당한 격차를 보인다. 360CityArena는 85개 거리를 포함하는 602개의 360도 비디오 세그먼트를 사용하여 일본 도쿄의 아키하바라 지역을 사실적으로 재구성한 환경 위에 구축되었으며, 사람이 정교하게 설계한 175개의 태스크로 구성된다. 이 벤치마크는 환경 이해, 경로 추론, 공간 추론의 세 가지 태스크 범주를 포함하며, 위치 파악, 랜드마크 탐색, 경로 계획, 관계적 공간 추론 등 도시 탐색에 필요한 기본 능력을 다룬다. 이를 통해 사실적인 도시 장면에서 포괄적인 평가가 가능하다. 최첨단 LMM(대규모 다중모달 모델) 기반 에이전트를 사용한 평가에서 가장 강력한 모델인 Gemini 2.5 Flash조차 인간 수준(인간: 77.3% vs. Gemini 2.5 Flash: 17.1%)에 훨씬 못 미치는 성능을 보였으며, 이는 도시 규모의 체화된 내비게이션과 추론에 상당한 도전 과제가 남아 있음을 보여준다. 360CityArena는 사실적인 도시 지역 내비게이션과 공간 추론을 위한 필요하고 도전적인 테스트베드를 제공한다.
쿼리 기반 마스크 트랜스포머는 최종 계층의 쿼리 예측 간 픽셀 단위 경쟁을 통해 분할 출력을 구성하지만, 이러한 추론 과정은 훈련 중에 명시적으로 최적화되지 않는다. 우리는 두 가지 주요 불일치를 식별한다: 가장 높은 확률-마스크 점수를 가진 쿼리가 반드시 가장 정확한 마스크를 생성하는 것은 아니며, 최종 계층 디코딩은 중간 계층의 우수한 예측을 버릴 수 있다. 이러한 문제를 해결하기 위해 우리는 일반 마스크 트랜스포머를 위한 일반적인 훈련 프레임워크인 추론 인지 학습(iFAN)을 제안한다. iFAN은 쿼리 경쟁을 예측된 마스크 품질과 정렬하고 높은 신뢰도지만 부정확한 경쟁자를 억제하는 조정된 확률-마스크 순위(APMR)를 도입한다. 또한 교차 계층 자기 증류(CLSD)를 통해 더 강력한 중간 예측을 최종 계층으로 전달한다. 순위 및 증류 목적은 훈련 전용이며, 추론 시에는 효율적인 최종 계층 디코딩을 유지한다. COCO, ADE20K 및 Cityscapes에서의 실험은 파놉틱, 인스턴스 및 시맨틱 분할과 다양한 아키텍처, 백본 규모, 입력 해상도에 걸쳐 일관된 성능 향상을 보여준다. 전반적으로 iFAN은 무시할 수 있는 수준의 추가 파라미터, FLOPs 및 추론 지연 시간만으로 평균 1.20 PQ, 1.30 AP, 0.63 mIoU의 성능 향상을 달성한다.
직소 퍼즐 해결은 시각적 내용과 기하학적 제약 조건에 대한 공동 추론을 요구하지만, 기존 벤치마크는 텍스처가 반복되는 영역에서 모호한 정답을 만들어내는 직사각형 절단을 사용한다. 본 논문에서는 탭-앤-블랭크(tab-and-blank) 방식으로 맞물리는 조각으로 구성된 벤치마크 \ours{}를 소개한다. 이 벤치마크에서 기하학적 제약은 강한 국소적 호환성 요구사항을 제공하며, 이는 시각적 내용과 결합하여 모호하지 않은 정답을 산출한다. 4×4에서 16×16까지의 네 가지 격자 밀도에 걸친 95,000개 인스턴스에서, 제로샷 VLM(시각-언어 모델)은 대체로 기하학적 추론이 부족함을 확인했다. 다섯 개의 최첨단 모델 중 오직 하나(GPT-5.5)만이 4×4 퍼즐에서 무작위 기준선을 초과했으며, 나머지 모든 모델은 우연 수준의 성능을 보였다. 지도 미세 조정은 4×4에서 97% 이상을 달성하지만, 모든 모델은 더 큰 격자에서 붕괴한다: GPT-5.5는 8×8에서 70%에서 거의 무작위 수준으로 떨어지고, 미세 조정된 모델조차 12×12에서 5% 미만으로 떨어진다. 이러한 "스케일링 절벽(scaling cliff)"은 현재 아키텍처가 조각 수가 증가함에 따라 일관된 제약 조건 충족을 유지할 수 없음을 시사한다. \ours{}는 확장 가능한 기하학적 추론을 시각-언어 모델의 열린 과제로 확립한다.
실제 세계의 데이터 과학은 데이터 정제, 탐색, 모델링, 시각화, 검증에 걸친 장기적 워크플로우를 수반하며, 실제 운영 환경에서 노트북, IDE, 터미널, 브라우저, 데이터베이스와 같은 도구들의 조율된 사용을 요구한다. 그러나 기존 벤치마크는 실제 컴퓨터와의 상호작용이 부족하고 에이전트가 현실적인 컴퓨팅 환경에서 완전한 종단간 데이터 과학 워크플로우를 실행할 수 있는지 평가하지 않아, 데이터 과학 실무의 다단계·다중 도구적 특성을 포착하지 못한다. 본 논문은 에이전트가 실제 컴퓨터 환경 내에서 전체 데이터 과학 워크플로우를 자동화할 수 있는지 평가하는 최초의 벤치마크인 DSAgentBench를 소개한다. DSAgentBench는 데이터 과학 수명주기 전체를 아우르는 275개의 다양한 작업으로 구성되며, 실무에서 요구되는 복잡성과 도구 조율을 반영한다. 각 작업은 중간 산출물에 근거한 의사결정과 조율된 도구 사용을 요구하며, 코드 실행 여부만이 아닌 분석적 정확성, 시각적 출력, 모델 성능을 검증하는 결정론적 평가기를 포함한다. 15개의 폐쇄형 및 오픈소스 모델을 대상으로 한 광범위한 실험에서 가장 강력한 에이전트인 Claude-4.6-Sonnet조차 56.70%의 작업 성공률만을 달성했으며, 모든 오픈소스 에이전트는 1% 미만에 머물러 도구 조율, OS 환경 기반 추론(grounding), 다단계 추론에서 빈번하게 실패했다. 이러한 결과는 현재의 에이전트 시스템과 실제 데이터 과학 워크플로우 사이의 상당한 능력 격차를 드러내며, DSAgentBench를 실제 환경에 기반하며 검증 가능하고 자율적인 데이터 과학 에이전트 개발을 위한 토대로 자리매김하게 한다. DSAgentBench는 https://github.com/vis-nlp/DSAgentBench에서 공개한다.
인공지능(AI)의 급속한 발전은 시계열 분석 연구, 특히 예측, 분류 및 생성 작업에 있어 상당한 진전을 가져왔다. 최근 모델, 특히 파운데이션 모델은 미세 조정을 위한 소스 데이터셋 선택에서 중요한 역할을 하는 시계열 데이터셋 유사성의 이점을 활용한다. 그러나 시계열 데이터셋 유사성 방법을 벤치마킹하기 위한 기존 구현들은 분산되어 있고 확장하기 어려운 경우가 많다. 이러한 문제를 해결하기 위해 우리는 통합 프레임워크인 TSDS-Toolbox(Time-Series Dataset Similarity Toolbox)를 제시한다. 우리의 작업은 (1) 시계열 데이터셋 유사성 방법의 체계적이고 재현 가능한 비교, (2) 사용자가 맞춤형 데이터셋, 유사성 방법 및 다운스트림 시계열 작업을 추가할 수 있는 유연한 확장성, (3) 통합된 시계열 데이터셋 축소기를 통한 데이터셋 수준 및 시계열 수준 유사성 방법의 일관된 평가를 가능하게 한다. TSDS-Toolbox의 효과성은 다양한 실험 설정에서의 포괄적인 실험을 통해 검증된다. 우리의 도구는 공개적으로 제공된다.
멱법칙 디코더 표현 기반 대규모 언어 모델(PLDR-LLM)과 그 어텐션인 멱법칙 그래프 어텐션(PLGA)은 스케일링된 점곱 어텐션(SDPA)의 고정 이중선형 형식을 학습된 입력 생성 이중선형 연산자 \(G_{LM}\)으로 대체하며, 이는 양의 텐서 \(A_{LM}\)으로부터 요소별 멱법칙에 의해 구성된다. 아키텍처는 완전히 명세화되었으며 고정된 참조 릴리스에 대해 검증되었다. 주장들은 정리, 조건부 정리, 측정, 또는 추측으로 분류된다. 무조건적으로 성립하는 사실은 다음과 같다. PLGA는 \(G_{LM}=I\)에서 정확히 SDPA를 포함한다. \(A_{LM}\)과 \(A_P\)는 엄격히 요소별 양수이며, \(A_{LM}\)은 페론-프로베니우스 구조를 가진다. DAG 정규화기는 NOTEARS 보행 계수 형태를 가지며, 양수성은 정확한 비순환성을 저해한다. 또한 비공명 조건(표준 회전 주파수로 충족됨) 하에서 교환자 기준은 어떤 연산자가 상대 위치 의존성을 보존하는지를 식별한다. 추론 붕괴 정리: 연역적 출력의 정확한 입력 불변성은 추론을 상수 연산자를 가진 일반화된 SDPA로 붕괴시킨다. 측정된 불변성: \(10^{-6}\) 이하의 상대 변동. 섭동 경계는 캐시된 추론을 정량화하지만 보증하지는 않으며, 구성된 프록시는 디코딩 마진을 포착하지 못한다. 조건부 3단계 메커니즘(회전 트월, 집중, 행 사상 수축)이 공개된 체크포인트에서 측정되었다. 전역 그램 하에서의 블록별 훈련 및 점수화는 명시적 대상 노출과 함께 제시된다. 테스트된 샘플에서 블록 및 순차 점수화는 동일한 답변을 선택하며, 공개된 TruthfulQA 확률 질량 지표에서 항목당 \(5\times 10^{-5}\) 이내로 일치한다. 자기조직화 임계성은 내재적 질서 변수를 가진 현상학적 프레임워크로 도입되며, 미해결 주장들은 반증 가능한 추측이 된다. 선별된 증명 핵심부는 Lean 4에서 기계 검증되었다.
최근 Retrieval-Augmented Generation(RAG)에 대한 최적화 연구들은 청크 단위 KV 캐시 재사용을 활용하여 길게 검색된 컨텍스트를 처리하지 않음으로써 효율성을 높이고자 하였으나, 거친 입자의 청크에는 여전히 상당한 정보 중복과 노이즈가 존재한다. 본 논문은 CoinRAG(Contextualized Information Nugget KV Cache Reuse for Long-Context RAG)을 제안하여 낮은 프리필(prefill) 지연 시간 제약 조건에서의 파레토 최적 경계(Pareto frontier)를 최적화하면서 정확도를 극대화한다. 그 이름은 우리의 핵심 메커니즘을 은유적으로 반영한다. 작은 토큰(또는 "동전")들을 조합하여 더 큰 가치를 축적하는 것과 유사하게, CoinRAG는 오프라인에서 계산된 세밀한 너겟(nugget) 캐시를 구성적으로 재사용하여 의미적으로 더 관련성이 높으면서도 더욱 압축된 방식으로 학습된 컨텍스트 표현을 효율적으로 형성한다. 구체적으로, 전체 청크를 인코딩하는 대신 CoinRAG는 두 단계 검색을 통해 검색된 청크 내에서 쿼리와 관련된 의미 단위를 식별하고, 이들의 슬라이스된 KV 표현을 청크 수준 컨텍스트와 원활하게 조합한다. LongBench 다중 홉 질의응답 작업에 대한 광범위한 평가는 CoinRAG가 운영 비용을 크게 줄이고, 표준적인 고속 프리필 지연 시간 예산 하에서 새로운 파레토 최적 경계와 평균 5.3%의 답변 품질(F1) 상대적 개선을 달성하여 다른 기준선들을 능가함을 보여준다.