arXiv cs.AI 주간 리포트
기간: 2026년 9월 21일(월) ~ 9월 25일(금)
주간 신규 등재: 1,202편 (월~금 확정치)
분석 표본: 352편 (주간의 29.3%) — 초록 보유 188편, 본문 정독 0편
생성일: 2026-09-28
이번 리포트는 원래 9월 25일(금)에 자동 실행할 예정이었다. 그날 사용자 컴퓨터와의 연결이 끊겨 작업을 마치지 못했고, 9월 28일(월)에 이어서 썼다. 대상 주간은 그대로 9월 21일~25일이다.
이번 주 트렌드 요약
이번 주 표본을 채운 것은 에이전트와 그것을 재는 잣대다. Agent & Planning이 표본의 33.5%(118편)를 차지해 지난주 28.6%보다 늘었다. 제목에 'agent'를 단 논문은 352편 중 112편, 31.8%다. 더 크게 뛴 쪽은 평가다. Benchmark & Evaluation이 지난주 12.8%에서 20.2%로 뛰었고, 제목에 'bench'를 단 논문이 21편, 그중 'audit'을 내건 논문만 10편이다. 에이전트를 쏟아내는 속도를 감사와 평가가 뒤쫓는 모양이다. 표본이 지난주 203편에서 352편으로 늘었으니 이 변화의 일부는 표본 확대 효과일 수 있다. 그와 별도로 사회과학 쪽에서 눈에 띄는 결과가 나왔다. LLM으로 사회를 흉내 내는 연구 세 편이 서로 다른 방법으로 같은 문제에 부딪혔다. 정렬(alignment) 후처리를 거친 모델은 사람들의 실제 의견 분포보다 좁게 수렴한다는 것이다.
주제별 논문 분포 (표본 352편)
| 주제 | 논문 수 | 비중 |
|---|---|---|
| Agent & Planning | 118 | 33.5% |
| Benchmark & Evaluation | 71 | 20.2% |
| Safety & Alignment | 40 | 11.4% |
| Reasoning & Logic | 33 | 9.4% |
| Science & Domain Application | 28 | 8.0% |
| Multimodal | 18 | 5.1% |
| Other | 12 | 3.4% |
| Efficiency & Compression | 11 | 3.1% |
| Foundation Model | 9 | 2.6% |
| Knowledge & Memory | 9 | 2.6% |
| Robotics & Embodied AI | 3 | 0.9% |
합 352편, 백분율 합 100.0%. 이 분포는 제목 키워드 1차 분류에 사람 검토를 얹은 값이다. Other 64편 중 52편을 다른 주제로 옮겼고, 자동 분류 규칙이 "sim-to-real"이라는 어구만 보고 로봇공학으로 잘못 넣은 논문 한 편(2609.25010, 실제로는 마케팅 시뮬레이션 연구)을 Science & Domain Application으로 바로잡았다. 전수 수작업 분류는 아니다.
제목에 'agent'가 든 논문이 352편 중 112편, 31.8%다(지난주 30.5%). 'bench' 21편(6.0%), 'audit' 10편(2.8%), 'memory' 10편(2.8%), 'harness' 6편(1.7%), 'skill' 8편(2.3%)이다.
주목할 트렌드
감사(audit)가 하나의 장르가 됐다
Benchmark & Evaluation 71편 중 10편이 제목에 'audit'을 달았다. 지난주 리포트가 짚은 감사 독립성 문제(내부 감사가 결함의 5.9%만 건졌다는 결과)가 남긴 여운이 이어지는 모양이다. 이번 주에는 대상이 넓어졌다. 도구 호출 실패를 감사한 논문(2609.26836), 정렬 개입이 실제로 남는지를 감사한 논문(2609.27333), 자원 배분에서 LLM의 공정성을 감사한 논문(2609.29692), 생성형 검색의 출처 위험을 감사한 논문(2609.29145)까지 대상이 도구·정렬·배분·검색으로 흩어졌다. 감사는 이제 한 하위 분야가 아니라 여러 하위 분야에 걸친 방법론이 되어간다.
사회를 흉내 낸 모델이 의견을 좁힌다
세 편이 다른 각도에서 같은 현상을 건드린다. 「The Limits of Simulated Societies」(2609.25760)는 세계가치관조사(World Values Survey) 12개국 응답을 LLM으로 재현시켰다. 정렬 후처리를 거칠수록 사람들의 실제 의견 분산이 사라졌다. 저자는 이를 "합의 붕괴(consensus collapse)"라 부른다. 「Do Synthetic Personas Predict Real Audience Response?」(2609.25010)는 실제 광고 클릭률 데이터로 검증했다. 페르소나를 부여하지 않고 그냥 물은 예측이, 인구통계를 반영한 페르소나 패널의 예측보다 나았다. 페르소나가 예측을 돕기는커녕 편향과 잡음을 보탰다는 뜻이다. 「Social Influence and the Allocation of Scientific Attention in AI Populations」(2609.22408)는 AI 에이전트 1,000개에게 논문을 고르게 했다. 앞선 선택을 볼 수 있을 때 에이전트들은 더 적은 논문에 몰렸다. 세 편을 묶으면 방향이 하나로 모인다. LLM으로 사회를 모사하려는 시도는 사람들 사이의 실제 이질성을 지우는 쪽으로 기운다. 사용자가 눈여겨보는 기술과 사회 다양성의 관계를 다루는 실증 사례다.
에이전트 비중은 늘고 추론 비중은 준다
Agent & Planning이 28.6%에서 33.5%로 오르는 동안 Reasoning & Logic은 13.8%에서 9.4%로 내렸다. Science & Domain Application도 10.8%에서 8.0%로 내렸다. 표본이 늘어난 주에 특정 범주만 상대적으로 줄었다면 표본 확대보다 실제 쏠림을 의심할 근거가 된다. 다만 이번 주는 화·수요일 이틀 몫이 유난히 많이 들어왔고(뒤쪽 요일별 표 참고) 그 이틀의 성격이 평균을 끌어당겼을 가능성도 있다. 다음 주 표본과 견주어야 확실해진다.
크레딧 할당(credit assignment)이 강화학습 에이전트 논문의 반복어가 됐다
Agent & Planning 표본 안에서 "credit assignment", "credit misattribution" 같은 표현을 쓰는 논문이 여럿이다(2609.24174, 2609.28963, 2609.29007, 2609.29050). 여러 단계를 거치는 에이전트의 행동 중 어느 단계가 결과에 책임이 있는지를 강화학습으로 되짚는 문제다. 같은 용어를 여러 팀이 서로 인용 없이 쓰는 것은 개념이 굳어가는 신호다. 이번 표본만으로 유행의 크기를 단정하기는 이르다.
주요 논문 심층 분석
중요도 12점 이상 5편. 모두 초록과 공개 정보만으로 분석했다. 본문 전문은 이번 실행에서 받지 못했다(아래 분석 메모 참고).
[1] The Limits of Simulated Societies: How Post-Training and Survey Fine-Tuning Erase Cross-Cultural Variance
arXiv ID: 2609.25760
저자: Rojin Ziaei
분류: cs.AI / Foundation Model
중요도: 14/15 (참신성 5, 영향력 5, 완성도 4)
분석 수준: 초록 및 공개 정보
핵심 기여
LLM으로 인구 집단의 의견을 흉내 낼 때, 기존 평가는 평균 응답의 정확도만 본다. 저자는 정확도 옆에 "분산 유지율(dispersion retention, dr)"이라는 지표를 세운다. 예측 응답의 표준편차를 실제 인구 표준편차로 나눈 값이다. 정확한데도 분산이 사라지는 실패를 "합의 붕괴(consensus collapse)"라 이름 붙였다.
방법론
세계가치관조사(World Values Survey) 12개국, 6개 대륙, 응답자-질문 쌍 1만 개를 놓고 제로샷 모델 11개와 SFT·DPO·GRPO로 파인튜닝한 변형 5개를 비교했다. Llama 3.1 70B 베이스에서 Tulu 3 체크포인트로 이어지는 후처리 단계마다 정확도와 분산 유지율을 함께 쟀다.
실험 결과
지도 미세조정(SFT) 한 단계만으로 분산의 절반이 사라졌다(dr 1.22→0.59). 정확도는 0.9점포인트 느는 데 그쳤다. 이후 단계는 분산을 되돌리지 못했다. WVS 데이터로 파인튜닝한 모델 중 가장 정확한 Tulu 3 70B-DPO(정확도 57.9%)는 전체 분산의 절반(dr=0.50)을 지켰지만, 나이지리아 응답에서는 11%(dr=0.36)만 남았다. 서구·선진국(WEIRD) 국가는 0.70~0.87을 유지했다. 샘플링 온도를 1.0으로 올려도 인간 분포와의 거리(Wasserstein-1)는 변하지 않았다. 정렬 안 된 모델과 섞으면 dr이 0.51에서 0.62로 오르지만 나이지리아는 0.36에 머물렀다.
한계 및 향후 연구
저자는 정확도 지표 하나로는 이런 실패를 잡아낼 수 없다고 직접 밝힌다. 분석자가 보태면, 단일 저자 연구이고 WVS라는 한 설문에 한정된다. 다른 설문·다른 문화권 데이터로 재현되는지는 확인되지 않았다.
왜 중요한가
사용자가 관심을 두는 기술과 인구·문화 다양성의 관계를 정면으로 다룬다. 여론조사를 LLM 시뮬레이션으로 대체하려는 흐름이 있는데, 이 연구는 그 대체가 비서구권 의견의 다양성을 특히 더 지운다는 것을 수치로 보여준다. 정책 시뮬레이션이나 시장 조사에 LLM 페르소나를 쓸 때 이 비대칭을 모르면 소수 의견이 통계에서 조용히 사라진다.
[2] Social Influence and the Allocation of Scientific Attention in AI Populations
arXiv ID: 2609.22408
저자: Maxim Chupilkin
분류: cs.AI / econ.GN / Benchmark & Evaluation
중요도: 13/15 (참신성 5, 영향력 4, 완성도 4)
분석 수준: 초록 및 공개 정보
핵심 기여
사회학의 고전 실험인 뮤직랩(Music Lab) 설계를 AI 에이전트 집단에 옮겼다. 사람이 아니라 AI가 논문을 고르는 시장에서도 사회적 정보(남들이 무엇을 골랐는가)가 쏠림을 만드는지 물었다.
방법론
1차 실험에서 AI 에이전트 1,000개가 2025년 American Economic Review에 실린 논문 114편의 제목과 초록만 보고 읽을 논문을 고른다. 독립 선택 공동체 5개와 사회적 정보 공동체 5개로 나눴다. 사회적 정보 공동체의 에이전트는 앞선 100명의 선택을 볼 수 있다. 2차 실험은 에이전트 200개, 20개 공동체로 규모를 줄이고, 특정 논문에 인위적으로 초기 선택 5건을 배정해 그 효과를 쟀다.
실험 결과
사회적 정보 공동체는 에이전트당 논문을 17.2% 더 적게 골랐고, 선택이 더 적은 논문에 몰렸다. 독립 공동체는 114편 중 90편을 다뤘지만 사회적 정보 공동체는 73편에 그쳤다. 공동체 간 편차도 사회적 정보 조건에서 더 컸다. 2차 실험에서는 초기 선택 5건을 인위로 배정받은 논문의 이후 선택률이 45.55%포인트 올랐다(95% 신뢰구간 41.20~49.90). 에이전트의 선택은 실제 인용 수와는 약하게, 다운로드 수와는 거의 무관하게 맞아떨어졌다.
한계 및 향후 연구
저자가 명시한 대로 대상 논문군이 한 저널, 한 해에 국한된다. 분석자가 보태면, 에이전트가 실제 연구자의 판단을 어느 정도 대리하는지는 별도로 검증되지 않았다.
왜 중요한가
AI가 논문·뉴스·콘텐츠를 추천하고 소비하는 참여자로 늘어나는 지금, 알고리즘이 만드는 쏠림이 사람 사회의 정보 폭포(information cascade)와 같은 모양으로 재현된다는 실증이다. 공론장의 관심 배분이 소수의 초기 신호에 좌우될 위험을 AI 시스템 안에서도 확인한 셈이다.
[3] Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation
arXiv ID: 2609.25010
저자: Alexandre Cristovão Maiorano
분류: cs.AI / cs.CL / cs.CY / Science & Domain Application
중요도: 13/15 (참신성 4, 영향력 4, 완성도 5)
분석 수준: 초록 및 공개 정보
핵심 기여
마케팅 업계는 LLM에 인구통계 페르소나를 부여해 광고 반응을 예측하려 한다. 이 논문은 그 가정을 실제 클릭률로 검증하고, 페르소나 없이 그냥 묻는 방법과 견준다. 결과는 통념과 반대다.
방법론
Upworthy Research Archive의 실제 트래픽 기반 헤드라인 A/B 테스트를 정답으로 삼았다. 실제 인구통계를 반영한 10개 페르소나 패널과, 페르소나 없이 "전형적인 독자가 클릭할 확률"을 묻는 제로샷 기준선을 비교했다.
실험 결과
A/B 테스트 대부분은 통계적으로 우열을 가릴 수 없어, 신뢰할 수 있는 부분집합(399건)에서만 검증했다. 페르소나 없는 기준선의 순위 예측력(켄달 타우 0.361, 상위 1개 정답률 49.2%)이 페르소나 패널(타우 0.084, 정답률 34.6%)보다 뚜렷이 높았고 신뢰구간이 겹치지 않았다. 이 결과는 독립된 Upworthy 세 분할에서 재현됐고, 다른 도메인의 뉴스 데이터셋에서도 방향이 같았으며, 시드·프롬프트 문구·모델(제미나이 세 등급, GPT-4.1)을 바꿔도 유지됐다.
한계 및 향후 연구
저자는 헤드라인 A/B 테스트라는 한 과제 유형에 결과가 국한된다는 점을 언급한다. 분석자가 보태면, "왜" 페르소나가 잡음을 보태는지에 대한 메커니즘 설명은 이 논문의 범위 밖이다.
왜 중요한가
음성 결과(negative result)다. 업계에 널리 퍼진 방법이 오히려 해가 된다는 것을 재현 가능한 방식으로 보였다. 위 두 논문과 함께 읽으면, 사람의 다양성을 흉내 내려는 시도(페르소나·정렬 후처리·사회적 정보 관찰)가 번번이 실제보다 좁고 획일적인 결과로 수렴한다는 하나의 그림이 그려진다.
[4] Alignment Inertia: Auditing the Durability of Training Data Influence Through Policy Override Resistance
arXiv ID: 2609.27333
저자: Renata Barreto 외 2인
분류: cs.AI / Benchmark & Evaluation
중요도: 12/15 (참신성 4, 영향력 4, 완성도 4)
분석 수준: 초록 및 공개 정보
핵심 기여
플랫폼 운영자는 시스템 프롬프트와 파인튜닝으로 모델 행동을 바꾸려 한다. 이 논문은 그 개입이 실제로 사전 학습된 행동을 얼마나 덮어쓰는지를 재는 지표(Override Success Rate)와 "정렬 관성(alignment inertia)" 개념을 제시한다.
방법론
Llama와 Mistral에 제로샷 프롬프팅과 LoRA 파인튜닝을 각각 적용해 의료 허위정보와 혐오 발언 두 영역에서 개입 성공률을 쟀다. 관성이 약한 적응 신호와 관련 있는지 보려고 TRAK이라는 귀속(attribution) 기법도 함께 썼다.
실험 결과
정렬 관성은 두 모델 모두에서 나타났지만 모델·영역·정책 방향에 따라 크기가 달랐다. Mistral의 혐오 발언 제한 조건에서는 LoRA 파인튜닝이 오히려 관성을 46.5%포인트 키웠다. 개입이 기존 행동을 지우기는커녕 강화한 셈이다. TRAK은 여덟 조건 중 일곱에서 AUC 0.85 이상을 기록해, 모델 확신도·TF-IDF 유사도·임베딩 유사도보다 관성을 잘 예측했다.
한계 및 향후 연구
저자들은 이 결과를 "운영자 대상 감사"로 규정하며, 실제 배포 환경에서의 정책 위반 빈도가 아니라 개입이 뚫히는 지점을 보여준다고 선을 긋는다. 분석자가 보태면, 두 모델·두 영역에 한정된 결과라 다른 모델군에서도 같은 폭의 역전 현상이 나오는지는 확인되지 않았다.
왜 중요한가
"파인튜닝으로 안전하게 만들었다"는 운영자의 주장과 실제로 덮이는 행동 사이의 간극을 수치로 드러낸다. 규제·감사 맥락에서 정렬 개입의 실효성을 검증할 때 참고할 수 있는 구체적 방법론이다.
[5] Silent Failures in Agent-Tool Interaction: An Audit of ToolUniverse
arXiv ID: 2609.26836
저자: Shreya Gopalan 외 2인
분류: cs.AI / cs.SE / Benchmark & Evaluation
중요도: 12/15 (참신성 4, 영향력 4, 완성도 4)
분석 수준: 초록 및 공개 정보
핵심 기여
에이전트가 도구를 호출했을 때 겉으로는 성공한 것처럼 보이지만 실제로는 정보나 기능 일부가 빠지고, 그 사실을 아무에게도 알리지 않는 실패를 "침묵 실패(silent failure)"라 이름 붙였다.
방법론
생물학 에이전트 워크플로우 환경 ToolUniverse에 통합된 과학 도구 15개와 그 API·문서를 감사했다. 실패가 일어나는 지점을 일곱 곳으로 나누고, LLM으로 후보를 찾은 뒤 사람이 직접 검증하고 자동 테스트로 확인했다.
실험 결과
검증된 침묵 실패가 91건 나왔다. 가장 흔한 유형은 데이터·필드 누락과 검색·필터·순위 기준의 불일치였다. 91건 중 51건이 API 계층에서, 25건이 래퍼 계층에서 일어났다. 실패는 상류에서 시작해 하류로 전파되며, 겉보기에는 정상적인 과학적 산출물로 이어졌다.
한계 및 향후 연구
저자들은 ToolUniverse를 연구 대상이 아니라 실험 환경으로 썼다고 밝힌다. 즉 결과가 이 환경 자체의 결함이 아니라 도구 통합 방식 일반의 문제일 가능성을 열어둔다. 분석자가 보태면, 과학 도구 15개, 생물학 영역 한정이라 다른 영역의 에이전트-도구 상호작용에도 같은 비율로 나타나는지는 별개로 확인해야 한다.
왜 중요한가
에이전트가 도구를 계속 늘려가는 지금, 실패가 소리 없이 하류로 전파된다는 지적은 신뢰성 논의에서 놓치기 쉬운 지점이다. 저자들이 제안한 "맥락적 신뢰성(contextual reliability)" 개념은 이번 주 감사 계열 논문들과 같은 방향을 가리킨다.
주제별 주요 논문
각 주제의 상위 논문만 싣는다. 전체 목록은 CSV로 나간다.
Agent & Planning (전체 118편 중 8편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | The Wisdom of Artificial Deliberative Crowds | 2609.22497 | 여러 에이전트가 숙의를 거쳐 판단을 모으는 구조를 다룬다 |
| 2 | Trustworthy Agentic AI: Failure Modes, Mitigation Strategies, and a Lifecycle Framework | 2609.22712 | 자율 LLM 시스템의 실패 유형과 완화책을 생애주기 관점에서 정리한다 |
| 3 | AgentRouter: Heterogeneous Model Routing for Cost-Optimal Multi-Step Agentic Workflows | 2609.22951 | 여러 모델에 단계별로 작업을 나눠 비용을 최적화하는 라우팅을 다룬다 |
| 4 | AutoGym: Blueprint-First Generation of Verifiable Agent Gyms | 2609.22592 | 에이전트 학습 환경을 설계도 기반으로 자동 생성하는 방법을 제안한다 |
| 5 | Self-Organizing Agent Teams Learn to Reason Together | 2609.22682 | 에이전트 팀이 스스로 조직을 짜며 함께 추론하는 방식을 실험한다 |
| 6 | Rollout Efficiency in Reinforcement Learning for Reasoning LLMs | 2609.25463 | 추론 LLM 강화학습에서 롤아웃 효율을 분류하고 방향을 짚는다 |
| 7 | Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents | 2609.27307 | GUI 에이전트가 자기 상호작용 기록으로 스스로를 가르치게 한다 |
| 8 | Augur: A Synthetic Decision Lab for Rehearsing Reactions to Product and Policy Changes | 2609.29952 | 제품·정책 변화에 대한 반응을 미리 시연해보는 합성 실험실을 만든다 |
Benchmark & Evaluation (전체 71편 중 8편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | Silent Failures in Agent-Tool Interaction: An Audit of ToolUniverse | 2609.26836 | 심층 분석 [5] 참고 |
| 2 | Alignment Inertia: Auditing the Durability of Training Data Influence | 2609.27333 | 심층 분석 [4] 참고 |
| 3 | Social Influence and the Allocation of Scientific Attention in AI Populations | 2609.22408 | 심층 분석 [2] 참고 |
| 4 | Do Not Trust the Benchmark: Limitations of General LLM Rankings | 2609.23201 | 종합 벤치마크 순위의 다섯 가지 한계를 짚고 과제별 평가를 주장한다 |
| 5 | Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus | 2609.22512 | LLM 평가자들이 합의해도 오류가 독립적이지 않을 수 있음을 짚는다 |
| 6 | Fair Like Us? Auditing LLM Alignment in Resource Allocation | 2609.29692 | 자원 배분 상황에서 LLM의 공정성 정렬을 감사한다 |
| 7 | The Delegation Blind Spot: Auditing Product Decisions from Agent Choices | 2609.26642 | 에이전트에게 위임한 제품 결정을 감사하는 사각지대를 다룬다 |
| 8 | PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations | 2609.30094 | 대화 주제가 바뀔 때 사용자 비밀 정보가 새는지를 감사한다 |
Safety & Alignment (전체 40편 중 6편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | CART: Closed-Loop Adaptive Red Teaming for Large Language Models | 2609.27336 | 결과를 보고 다음 공격을 정하는 폐루프형 레드티밍을 제안한다 |
| 2 | Which Objectives Need a Dial? Steerable Pluralistic Alignment | 2609.26929 | 상충하는 목표들을 하나의 모델로 조절 가능하게 만드는 조건을 찾는다 |
| 3 | Optimizing the Score, Losing Sight of the Task: Reward Hacking | 2609.25848 | 가중치·선택·프롬프트 전반에 걸친 보상 해킹을 다룬다(초록 없음, 제목 기준) |
| 4 | Are Human-Aligned Models Models of Humans? A Turing-Test Gap in Preference Alignment | 2609.23640 | 선호 정렬 모델이 실제 인간을 얼마나 대리하는지 튜링테스트 관점에서 묻는다 |
| 5 | RAG-NAROK: Retrieval-Aware Knowledge Corpus Poisoning in RAG | 2609.25469 | RAG 지식 코퍼스를 표적 공격으로 오염시키는 취약점을 다룬다 |
| 6 | A Global Comparison of Schemas, Transparency, and Interoperability in Public-Sector AI Registers | 2609.24883 | 각국 공공부문 AI 등록부의 투명성·상호운용성을 비교한다(초록 없음, 제목 기준) |
Reasoning & Logic (전체 33편 중 5편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | From Decorative to Load-Bearing: Task Difficulty Shapes the Causal Role of Chain-of-Thought | 2609.25366 | 과제 난이도에 따라 사고흐름이 장식적인지 실제로 결과를 좌우하는지 갈린다고 본다 |
| 2 | Are Stated Reasoning Steps Causally Load-Bearing? | 2609.27038 | 모델이 말한 추론 단계가 실제 답에 인과적으로 기여하는지 검증한다 |
| 3 | Math Reasoning in LLMs is Organized by Approach, Not Topic | 2609.27041 | 수학 추론이 주제가 아니라 풀이 접근법 단위로 조직된다고 주장한다 |
| 4 | Lean Pool: An AI-Maintained Archive of Formalized Mathematics | 2609.25199 | AI가 유지 관리하는 형식화 수학 아카이브를 구축한다 |
| 5 | When Verifiers Vote Backwards under Verdict Substitution | 2609.26144 | 검증자 다수결이 상관된 자기일관성 아래서 뒤집히는 조건을 분석한다 |
Science & Domain Application (전체 28편 중 5편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | Do Synthetic Personas Predict Real Audience Response? | 2609.25010 | 심층 분석 [3] 참고 |
| 2 | Didactic Knowledge or Clinical Cases? How Data Types Shape Medical LLMs | 2609.22161 | 교과서형 데이터와 임상 기록형 데이터가 의료 LLM에 다르게 기여한다고 밝힌다 |
| 3 | Hapi: A Multivariable Land-Surface Transformer for Hydrological Forecasting | 2609.22702 | 대륙 규모 수문 예보를 위한 트랜스포머 모델을 제시한다 |
| 4 | An Accurate and Interpretable Hyper Graph Neural Network for GBM Survival Prediction | 2609.25088 | 교모세포종 생존 예측을 해석 가능한 하이퍼그래프 신경망으로 시도한다 |
| 5 | Functional Architecture of European Electricity Trading Markets: AI Supported Trading under Regulatory Constraints | 2609.29108 | 유럽 전력 거래 시장에 AI를 규제 준수 형태로 넣는 기능 구조를 설계한다 |
Multimodal (전체 18편 중 4편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | An Affordable AI-Integrated Smart Cane for Multimodal Mobility Assistance | 2609.22277 | 88달러대 오프라인 스마트 지팡이로 시각장애인 이동을 돕는다 |
| 2 | When Should a VLM Look? Paying Only for Visual Calls That Were Needed and Used | 2609.22910 | 시각 언어 모델이 정말 필요한 순간에만 이미지를 보게 해 비용을 줄인다 |
| 3 | Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings | 2609.25165 | 여러 양식을 아우르는 범용 임베딩의 한계를 넓힌다 |
| 4 | Same Evidence, Different Judgments: Evidence Noncommutative in Vision/Speech-Text Conflicts | 2609.26986 | 시각·음성·텍스트 증거가 충돌할 때 제시 순서가 판단을 바꾼다고 본다 |
Efficiency & Compression (전체 11편 중 3편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | From Inference Engine to Inference Control Plane: vLLM, llm-d 연동 | 2609.23130 | 분산 LLM 서빙을 제어 평면 관점에서 재구성한다 |
| 2 | Learning the Cost of Reliable Inference | 2609.28322 | 신뢰할 수 있는 추론에 드는 비용 자체를 학습 대상으로 삼는다(초록 없음, 제목 기준) |
| 3 | Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring | 2609.28859 | 비용을 고려해 AI 채점과 사람 개입을 선택적으로 섞는다 |
Foundation Model (전체 9편 중 3편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | The Limits of Simulated Societies | 2609.25760 | 심층 분석 [1] 참고 |
| 2 | Functional Architecture of European Electricity Trading Markets | 2609.29108 | 위 Science & Domain Application 목록 참고 |
| 3 | Learned Cross-Task Relationships in Multi-Task Models | 2609.28776 | 다중 과제 모델 안에서 과제 간 관계가 어떻게 학습되는지 분석한다 |
Knowledge & Memory (전체 9편 중 3편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | Sequential Knowledge Editing Breaks a Model's Ability to Tell Good Evidence from Bad | 2609.29587 | 순차적 지식 편집이 정확도는 지키면서 증거 판별력을 무너뜨린다고 본다(초록 없음, 제목 기준) |
| 2 | A Hierarchy of Faithfulness Criteria for Knowledge Base Completion | 2609.27863 | 지식베이스 완성 결과의 충실성을 층위별 기준으로 정리한다(초록 없음, 제목 기준) |
| 3 | ArticleMiner: Ontology-Guided Knowledge Graph Construction from Scientific Publications | 2609.25607 | 온톨로지를 이용해 논문에서 지식 그래프를 뽑아낸다 |
Robotics & Embodied AI (전체 3편)
| # | 제목 | arXiv ID | 한줄 요약 |
|---|---|---|---|
| 1 | PAANI: On Device Visual Evidence Fusion and Explainable Guidance for River Robot Simulation | 2609.22353 | 하천 로봇 시뮬레이션에서 온디바이스 시각 증거 융합과 설명 가능한 안내를 다룬다 |
| 2 | Real-Time Hand Gesture Recognition for OpenXR | 2609.25466 | 확장현실 환경의 실시간 손동작 인식을 트랜스포머로 구현한다 |
| 3 | SlackDrive: Reclaiming Runtime Slack for Adaptive Driving Inference | 2609.28064 | 자율주행 추론의 런타임 여유 자원을 적응적으로 회수해 쓴다(초록 없음, 제목 기준) |
arXiv 서브카테고리별 분포
주분류는 전부 cs.AI다(352편, 100%) — 이번 리포트가 cs.AI 목록만 수집한 결과이지, 다른 분야가 없다는 뜻은 아니다.
교차분류(cross-listed) 상위 항목은 다음과 같다.
| 교차분류 | 논문 수 |
|---|---|
| cs.CL (계산언어학) | 43 |
| cs.LG (기계학습) | 41 |
| cs.MA (다중 에이전트 시스템) | 16 |
| cs.CY (컴퓨터와 사회) | 14 |
| cs.IR (정보 검색) | 13 |
| cs.CV (컴퓨터 비전) | 12 |
| cs.SE (소프트웨어공학) | 12 |
| cs.CR (암호·보안) | 10 |
| cs.HC (인간-컴퓨터 상호작용) | 5 |
| cs.CE (전산공학·과학) | 5 |
| cs.RO (로보틱스) | 4 |
| stat.ML (통계적 기계학습) | 4 |
| eess.SY (시스템·제어) | 4 |
| cs.DB (데이터베이스) | 3 |
| cs.DC (분산·병렬 컴퓨팅) | 3 |
cs.GT(게임이론), cs.NE(신경·진화 컴퓨팅) 같은 분야는 표본에 거의 잡히지 않았다. 표본이 주간의 29.3%에 그치는 만큼 이 공백을 실제 부재로 단정하지 않는다.
요일별 등재량
| 요일 | 날짜 | 등재량 | 표본 | 초록 확보 |
|---|---|---|---|---|
| 월 | 9/21 | 125 | 0 | 0 |
| 화 | 9/22 | 384 | 99 | 49 |
| 수 | 9/23 | 240 | 100 | 50 |
| 목 | 9/24 | 193 | 59 | 45 |
| 금 | 9/25 | 260 | 94 | 44 |
| 합 | 1,202 | 352 | 188 |
수요일(9/23)이 아니라 화요일(9/22)이 한 주 중 가장 많다(384편). 초록의 학회 채택 표기를 훑어봐도 특정 학회 마감과 겹친다는 표시는 뚜렷하지 않았다. 월요일은 일일 수집 작업이 그날 원본을 받지 못해 표본이 0이다. 등재량 384는 다른 날짜의 캐시에서도 반복 확인된 수치라 신뢰할 수 있지만, 그날 무엇이 올라왔는지는 표본으로 볼 수 없다.
분석 메모
표본과 한계. 이번 주 캐시에는 화·수·목·금 나흘치 /new 원본이 쌓였고 월요일치가 빠졌다. 화~금 나흘 표본은 352편으로 주간 총량 1,202편의 29.3%다. 그중 초록을 확보한 것이 188편(53.4%)이고, 본문까지 읽은 것은 0편이다. 이번 실행 5단계에서 /list/cs.AI/recent를 한 번 받았고, 심층 분석 1순위 논문(2609.25760)의 초록 페이지를 확인해 서지사항을 검증했다. 그 직후 본문 요청에서 HTTP 429(요청 한도 초과)를 받아, 스킬 지침에 따라 그 자리에서 본문 수집을 멈췄다. 그래서 심층 분석 5편 모두 "초록 및 공개 정보" 수준이고 본문 정독은 하나도 없다. 월요일 표본이 없는 것은 본문 접근과 무관하게 애초 일일 수집 캐시의 공백이다.
이번 실행은 원래 9월 25일(금) 예약대로 자동 실행됐으나, 사용자 컴퓨터와의 연결이 끊겨 캐시 점검 단계에서 중단됐다. 9월 28일(월) 사용자가 재개를 요청해 이어서 완성했다. 대상 주간과 수치는 9월 21일~25일 기준 그대로다.
분류에 관하여. Other로 떨어진 64편 중 52편을 사람이 검토해 다른 주제로 옮겼다. 옮긴 뒤에도 12편은 이론적이거나 여러 주제에 걸쳐 있어 Other로 남겼다. 별도로 자동 분류가 "sim-to-real"이라는 어구만 보고 마케팅 시뮬레이션 논문(2609.25010)을 로봇공학으로 잘못 넣은 사례를 발견해 바로잡았다. 방법론 키워드가 도메인 키워드보다 먼저 걸리는 구조에서 나온 오류다. 이 밖의 계통적 오류는 추가로 찾지 못했지만 전수 검토는 아니다.
다음 주에 볼 것. 첫째, Benchmark & Evaluation의 상승과 감사(audit) 장르화가 다음 주에도 이어지는지 본다. 표본 확대 효과인지 실제 흐름인지는 두 주 이상 지켜봐야 갈린다. 둘째, 이번 주 사회 시뮬레이션 세 편이 짚은 "합의 붕괴" 현상을 다른 팀이 다른 설문·다른 방법으로 재현하는지 살핀다. 셋째, 크레딧 할당 계열 논문이 늘어나는지, 그리고 이번 주 비지 않은 월요일 캐시로 다음 주 표본이 얼마나 넓어지는지 확인한다.
본 리포트는 arXiv cs.AI 자동 분석 스킬로 생성했다.
본문 정독 0편 / 초록 정독 188편 / 제목·분류 확인 352편 / 주간 전체 등재 1,202편