ChatPaper.ai
メニューを開く
ホーム
今日の論文
arXiv
HuggingFace
料金プラン
アカウント
ワークスペース
🇯🇵
日本語
Loading...
•
•
•
•
•
•
•
•
•
•
AI研究論文デイリー
翻訳付きの日次キュレーションされたAI研究論文
December 16th, 2024
ObjectMate:オブジェクト挿入と主体駆動生成のための再現事前確率
ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation
Daniel Winter, Asaf Shul, Matan Cohen, Dana Berman, Yael Pritch, Alex Rav-Acha, Yedid Hoshen
•
Dec 11, 2024
•
11
2
TraceVLA:ビジュアルトレースプロンプティングは、一般的なロボットポリシーの空間的時間的認識を向上させます。
TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies
Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang, Jianfeng Gao, Hal Daumé III, Andrey Kolobov, Furong Huang, Jianwei Yang
•
Dec 13, 2024
•
2
2
FluxSpace: 正規化フロー変換器における分離された意味編集
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers
Yusuf Dalva, Kavana Venkatesh, Pinar Yanardag
•
Dec 12, 2024
•
10
2
SynerGen-VL: ビジョンエキスパートとトークン折り畳みを用いたシナジスティックな画像理解と生成に向けて
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
Hao Li, Changyao Tian, Jie Shao, Xizhou Zhu, Zhaokai Wang, Jinguo Zhu, Wenhan Dou, Xiaogang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai
•
Dec 12, 2024
•
38
4
GenEx: 探索可能な世界の生成
GenEx: Generating an Explorable World
Taiming Lu, Tianmin Shu, Junfei Xiao, Luoxin Ye, Jiahao Wang, Cheng Peng, Chen Wei, Daniel Khashabi, Rama Chellappa, Alan Yuille, Jieneng Chen
•
Dec 12, 2024
•
97
2
GReaTer: 推論上の勾配が小さな言語モデルを強化する プロンプト最適化器
GReaTer: Gradients over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
Sarkar Snigdha Sarathi Das, Ryo Kamoi, Bo Pang, Yusen Zhang, Caiming Xiong, Rui Zhang
•
Dec 12, 2024
•
5
3
明示的なブリッジと検索拡張を備えたマルチモーダル音楽生成
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
Baisen Wang, Le Zhuo, Zhaokai Wang, Chenxi Bao, Wu Chengjing, Xuecheng Nie, Jiao Dai, Jizhong Han, Yue Liao, Si Liu
•
Dec 12, 2024
•
7
4
FireFlow: 画像意味編集のための整流されたフローの高速反転
FireFlow: Fast Inversion of Rectified Flow for Image Semantic Editing
Yingying Deng, Xiangyu He, Changwang Mei, Peisong Wang, Fan Tang
•
Dec 10, 2024
•
11
3
InstanceCap:インスタンス感知構造化キャプションを介したテキストからビデオへの生成の改善
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
Tiehan Fan, Kepan Nan, Rui Xie, Penghao Zhou, Zhenheng Yang, Chaoyou Fu, Xiang Li, Jian Yang, Ying Tai
•
Dec 12, 2024
•
19
3
大規模なアクションモデル:発端から実装まで
Large Action Models: From Inception to Implementation
Lu Wang, Fangkai Yang, Chaoyun Zhang, Junting Lu, Jiaxu Qian, Shilin He, Pu Zhao, Bo Qiao, Ray Huang, Si Qin, Qisheng Su, Jiayi Ye, Yudi Zhang, Jian-Guang Lou, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang
•
Dec 13, 2024
•
35
5
Prompt2Perturb(P2P):テキストによる誘導を受けた拡散ベースの乳房超音波画像への敵対的攻撃
Prompt2Perturb (P2P): Text-Guided Diffusion-Based Adversarial Attacks on Breast Ultrasound Images
Yasamin Medghalchi, Moein Heidari, Clayton Allard, Leonid Sigal, Ilker Hacihaliloglu
•
Dec 13, 2024
•
1
2
SmolTulu:学習率とバッチサイズの比率が高いと、SLMにおいてより良い推論が可能になる可能性があります。
SmolTulu: Higher Learning Rate to Batch Size Ratios Can Lead to Better Reasoning in SLMs
Sultan Alrashed
•
Dec 11, 2024
•
4
2
SCBench:長文脈メソッドのKVキャッシュ中心分析
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
Yucheng Li, Huiqiang Jiang, Qianhui Wu, Xufang Luo, Surin Ahn, Chengruidong Zhang, Amir H. Abdi, Dongsheng Li, Jianfeng Gao, Yuqing Yang, Lili Qiu
•
Dec 13, 2024
•
10
2
BiMediX2: 多様な医療モダリティ向けのバイオメディカル専門家LMM
BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities
Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Sara Pieri, Saeed Yahya Alseiari, Shanavas Cholakkal, Khaled Aldahmani, Fahad Khan, Rao Anwer, Salman Khan, Timothy Baldwin, Hisham Cholakkal
•
Dec 10, 2024
•
28
2
残差ベクトル量子化ベースのトークンを用いた効率的な生成モデリング
Efficient Generative Modeling with Residual Vector Quantization-Based Tokens
Jaehyeon Kim, Taehong Moon, Keon Lee, Jaewoong Cho
•
Dec 13, 2024
•
19
2
アポロ:大規模なマルチモーダルモデルにおけるビデオ理解の探求
Apollo: An Exploration of Video Understanding in Large Multimodal Models
Orr Zohar, Xiaohan Wang, Yann Dubois, Nikhil Mehta, Tong Xiao, Philippe Hansen-Estruch, Licheng Yu, Xiaofang Wang, Felix Juefei-Xu, Ning Zhang, Serena Yeung-Levy, Xide Xia
•
Dec 13, 2024
•
146
13
LinGen: 高解像度の1分間テキストからビデオへの生成に向けて、線形計算複雑性を持つ
LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity
Hongjie Wang, Chih-Yao Ma, Yen-Cheng Liu, Ji Hou, Tao Xu, Jialiang Wang, Felix Juefei-Xu, Yaqiao Luo, Peizhao Zhang, Tingbo Hou, Peter Vajda, Niraj K. Jha, Xiaoliang Dai
•
Dec 13, 2024
•
10
4
FreeScale: チューニング不要のスケール融合による拡散モデルの解像度解放
FreeScale: Unleashing the Resolution of Diffusion Models via Tuning-Free Scale Fusion
Haonan Qiu, Shiwei Zhang, Yujie Wei, Ruihang Chu, Hangjie Yuan, Xiang Wang, Yingya Zhang, Ziwei Liu
•
Dec 12, 2024
•
20
2