Submitted 19 Jul 2026

ResearchStudio-Reel: 論文からポスター、ビデオ、ブログまで、研究成果のラストマイルを自動化

Microsoft ResearchA*STARNTU
+12 more

Abstract

自動化が進んでいるにもかかわらず、論文をまとまりのあるポスター、講演動画、ブログ記事にすることは、依然として手間のかかる「ラストマイル」であることが多い。最近のシステムは複数の普及フォーマットを生成するようになっているが、実用的なワークフローでは、出力がネイティブツールで編集可能であること、そして改訂や再利用のために一つのナビゲート可能な成果物にまとめられていることも必要である。 本稿では、ResearchStudio-Reelを提案する。これは、その3つの成果物を体験レベルで一つのインタラクティブな成果物に結びつける、ネイティブ編集可能な普及ワークスペースである。これはClaude CodeとCodexで実行可能な5つのスキルとして実装されている。具体的には、1つの共有エクストラクタ、3つの編集可能な成果物ジェネレータ、そして1つのインタラクティブな統合レイヤーである。共有アセットバンドルは、PowerPointポスターと動画デッキ、さらにバイリンガルなWordブログに情報を提供する。Paper2Reelは、論文を4番目のフォーマットに再レンダリングするのではなく、既に生成されたこれらの成果物を体験レベルで統合し、ポスターの領域、動画のセグメント、ブログの文章を一つのインタラクティブなビューアに結びつける。成果物固有のリリースチェックにより、このデリバリー契約はテスト可能になり、Paper2Posterはさらに測定されたフィルループを使用する。 Paper2Posterベンチマークにおいて、我々のClaude Code構成は、自動化されたシステムの中で、3つの美的サブ基準すべてで最高のスコアを達成し、3つの情報サブ基準のうち2つで最高または同等のスコアを達成した。2人のVLMジャッジの評価の下、平均的な美的感覚において著者のポスターを上回り(3.56 vs 3.03)、2人のジャッジによる100本の論文のうち74本と95本で総合的な品質で勝利した。フルパイプラインはさらに、ネイティブ編集可能なソース成果物と、それらと整列したビューアをパッケージ化する。プロジェクトはこのURLで利用可能である: this https URL

AI Overview

Our new overview generator adds more detail and page citations

研究普及のラストマイルを自動化する

研究論文の完成は、研究者の道のりの終わりであることはほとんどありません。論文が受理された後、著者は「普及モード」に移行しなければなりません。これは、研究の「ラストマイル」と称されるフェーズです。このフェーズでは、密度の高い公式なPDFを、印刷可能な学会ポスター、ナレーション付きプレゼンテーションビデオ、一般公開用の専門的なブログ記事といった二次的な成果物群に変形させます。このプロセスは従来、手作業で、労働集約的であり、学会のわずか数週間前という時間的制約のある中で行われるのが一般的でした。

ResearchStudio-Reel システム概要 図1:ResearchStudio-Reel パイプラインは、研究論文PDFを共有アセットバンドルに順次変換し、その後編集可能なポスター、ビデオ、ブログを生成し、最終的にそれらを統一されたインタラクティブビューアに統合します。

ResearchStudio-Reelは、この移行を自動化するために新たに導入されたシステムです。静的な要約や無関係なファイルを生成するこれまでの自動化ツールとは異なり、このシステムは、共有基盤、ネイティブな編集可能性、エクスペリエンスレベルの収束という3つの核となる原則に焦点を当てています。普及プロセスを一連の孤立したタスクではなく、統合されたワークフローとして扱うことで、研究者はすべてのフォーマットで一貫性を保ちながら、プロフェッショナルで編集可能な資料を生成できます。

問題:分断された硬直的なワークフロー

研究普及を自動化する現在の取り組みは、しばしば3つのギャップのいずれかに陥ります。第一に、共有基盤の欠如があります。ポスターとビデオを生成するために異なるツールが使用されると、それらはしばしば図、キャプション、メタデータを独立して抽出します。この重複は不整合につながります。たとえば、ビデオがポスターで省略された図を参照したり、用語が成果物の間でずれたりする可能性があります。

第二に、ほとんどの自動化システムはネイティブな編集可能性を欠いています。それらはしばしば、静的なPDFや固定されたMP4ビデオのような最終出力物を生成します。著者がわずかな誤植を見つけたり、図を交換したいと思ったりした場合、AIが他のセクションを変更しないことを期待して成果物全体を再生成するか、専門的でしばしば扱いにくい編集ソフトウェアを使用するかのどちらかを強いられます。ResearchStudio-Reelは、ポスターやビデオ用にPowerPoint (.pptx)、ブログ用にWord (.docx) のようなネイティブのソースファイルを生成することで、この問題に対処します。

最後に、エクスペリエンスレベルの収束の欠如があります。著者が必要なファイルをすべて生成したとしても、それらは分離された文書の集合体のままです。読者がそれらの間を簡単にナビゲートする方法はありません。たとえば、ポスターのセクションをクリックして、プレゼンテーションビデオの対応するセグメントを見るような方法です。ResearchStudio-Reelは、これらの成果物を単一のインタラクティブな体験に結びつける収束層を導入します。

Paper2Assets:共有基盤の確立

このシステムは、すべての下流ジェネレーターにとっての「単一の情報源」として機能する共有抽出層であるPaper2Assetsから始まります。各ジェネレーターがPDFを個別に解析するのではなく、Paper2Assetsは一度包括的な抽出を実行します。

共有アセット抽出 図2:Paper2Assets層は、テキスト、高解像度図、メタデータ、構造化された要約を抽出し、パイプライン全体で使用される安定したセクション識別子を割り当てます。

このレイヤーは、論文の全文テキストを取り込み、周囲のPDF残渣を除去して図の画像をクリーンアップし、正確なキャプションを抽出します。決定的に重要な点として、構造化された9セクションの要約(問題、動機、貢献、手法など)を生成し、すべてのコンテンツに安定したセクション識別子SIDS_{\text{ID}}を割り当てます。これにより、「手法」セクションに特定のIDが割り当てられた場合、ポスターとビデオの両方がまったく同じ基礎コンテンツを使用し、情報発信スイート全体で絶対的な一貫性を維持します。

Paper2Poster: レイアウト収束問題の解決

会議ポスターの生成は、「塗りつぶし」の問題があるため困難です。ポスターは視覚的に完全に見える必要があり、詰め込みすぎでも、空きすぎでもいけません。従来のAI生成では、境界をオーバーフローするか、不自然な空白を残す「単一ショット」のレイアウトが生成されることがよくあります。

ResearchStudio-Reelは、これを段階的な塗りつぶしループで解決します。ポスターの各セクションiiについて、システムは以下のように定義される塗りつぶし比率rir_iを計算します。

ri=Content AreaCard Arear_i = \frac{\text{Content Area}}{\text{Card Area}}

システムは、0.90≤ri≤0.980.90 \leq r_i \leq 0.98となる特定の塗りつぶし比率rtargetr_{\text{target}}を目標とします。セクションが希薄すぎるか、オーバーフローする場合、専用のサブエージェントがテキストを繰り返し編集します。つまり、詳細を追加したり、余分な部分を削除したりして、コンテンツが完璧に収まるようにします。

ポスターの段階的な塗りつぶしループ 図3:段階的な塗りつぶしループは、コンテンツの密度を繰り返し測定および調整し、ポスターセクションがオーバーフローすることなく視覚的に満たされるようにします。

Paper2Posterのもう一つの重要な機能は、エクスポートメカニズムです。ポスターはWeb技術(HTML/CSS)を使用して構成されますが、最終出力はネイティブのPowerPointファイルに変換されます。すべてのテキストボックス、数式、図はネイティブのPowerPointオブジェクトであり、著者は既に知っているツールで最終的な手動調整を行うことができます。

Paper2Video: ナラティブ計画と注意誘導

Paper2Videoモジュールは、論文をナレーション付きの講演ビデオに変換します。自動ビデオ生成における主な課題は、再生時間の制御です。会議では、多くの場合、厳格な時間制限(例:1分間の「ライトニングトーク」や5分間のプレゼンテーション)があります。

システムは、メディアがレンダリングされる前に再生時間計画を実装します。目標の長さLtargetL_{\text{target}}に基づいてナレーション時間を推定し、推定時間が制限を超過する場合は、スクリプトのセマンティックな書き換えを実行します。スクリプトが完成したら、高品質のテキスト読み上げ(TTS)を使用して音声を生成します。

自動ビデオ生成 図4:ビデオジェネレーターは、ナレーションの長さを計画し、音声を合成し、話されるテキストと同期する視覚的なハイライト(レーザーポインターなど)を追加します。

視聴者のエンゲージメントを高めるために、システムは「注意誘導」の視覚的キューを追加します。ナレーションが特定の図や数式に言及する場合、ビデオジェネレーターは自動的に、そのスライド上の領域にスポットライトやレーザーカーソルなどのハイライト効果を「焼き付け」ます。これは、人間がプレゼンテーション中に画面を指し示す動作を模倣しています。

Paper2Blog: 編集の一貫性とプロフェッショナルなレイアウト

広報活動のために、Paper2Blogモジュールはバイリンガル記事(英語と中国語)を生成します。これは単純な翻訳タスクではありません。システムは、異なるプラットフォームに合わせて文章の「レジスター」またはトーンを調整する必要があります。たとえば、WeChat公式アカウント向けの中国語のブログ記事は、企業の研究ブログ向けの英語の投稿とは異なる編集スタイルを必要とします。

バイリンガルブログ生成 図5:ブログジェネレーターは、レイアウトを考慮した図の配置と、言語間で一貫した事実証拠を持つバイリンガルのWordドキュメントを生成します。

この���ステムは、「エビデンスマップ」を構築し、ヘッドラインの数字や主要な主張といった核となる事実が両言語間で同一であることを保証します。また、「レイアウトゲート」も含まれており、Word文書の最終版でページ末尾の「孤立行」やテキストフローに合わない図などの一般的な問題をチェックします。

Paper2Reel: インタラクティブなコンバージェンス層

パイプラインの最終段階は、経験レベルの収束のギャップを埋めるPaper2Reelです。これは、研究のためのインタラクティブなダッシュボードとして機能する自己完結型HTMLビューアを作成します。

インタラクティブなリールビューア 図6:リールビューアでは、ポスターの任意のセクションをダブルクリックすると、対応するビデオセグメントとブログテキストにすぐにジャンプできます。

ビューアはalignment.jsonファイルを使用して、すべての成果物を同期します。すべての成果物は、最初のPaper2Assets段階から同じSIDS_{\text{ID}}を共有するため、ビューアはビデオのどの秒とブログのどの段落がポスターの各ブロックに対応するかを正確に把握しています。ユーザーはポスターの「メソッド」セクションにカーソルを合わせ、ダブルクリックすると、そのメソッドを説明するビデオの正確なセグメントを再生するモーダルが開かれ、ブログテキストもそれに合わせてスクロール表示されます。

定量的評価とパフォーマンス

このシステムは、100の研究論文のセットであるPaper2Posterベンチマークを使用して評価されました。人間が作成したポスターと、AI審査員と読解プローブを使用してResearchStudio-Reelによって生成されたポスターを比較しました。

その結果、システムが生成したポスターは、多くの場合、著者のオリジナルポスターよりも美的品質が高いと評価されました。5点満点で、システムは平均美的スコア3.563.56を達成し、著者の正解ポスターの3.033.03と比較されました。一対一の比較では、AI生成ポスターは、ある審査員によると100論文中7474で、別の審査員によると100論文中9595で全体的な品質において「勝利」しました。

指標ResearchStudio-ReelP2P (ベースライン)
美的全体 (1-5)3.563.562.642.64
情報全体 (1-5)3.813.814.224.22
PaperQuiz 正確度56.79%56.79\%75.40%75.40\%

評価により明確なトレードオフが明らかになりました。美的要素と読みやすさを優先するシステム(ResearchStudio-Reelなど)は、PaperQuizのような情報密度テストではスコアがわずかに低くなります(56.79%56.79\% vs 75.40%75.40\%)。これは、システムの「段階的充填ループ」が、プロフェッショナルな外観を維持するために過剰なテキストを積極的に削除するのに対し、より密度の高いベースラインは視覚的な魅力を犠牲にして論文のほぼすべてを含んでいるためです。

PDFから統合されたリールビューアまでのエンドツーエンドの全プロセスには、約8989分の計算時間がかかります。これは単純な要約よりも長いですが、研究者がこれらの成果物を手動で作成するのに費やす数日または数週間に比べると、大幅な時間節約になります。

意義と実世界への影響

ResearchStudio-Reelは、研究発表の自動化を単純な「並列生成」から、統合された「経験レベル」のワークフローへと移行させます。その重要性は、研究者の実用的なニーズに焦点を当てている点にあります。

  1. ワークフローの効率性: ドラフト作成とレイアウトの重労働を自動化することで、著者は高レベルのメッセージングと微調整に集中できます。
  2. 専門的な一貫性: 共有アセットバンドルにより、論文の核となる主張の変更がポスター、ビデオ、ブログ全体に正確に反映されることが保証されます。
  3. アクセシビリティの向上: バイリンガルブログとインタラクティブビューアにより、研究が世界の聴衆や異なるメディア形式(視覚、聴覚、テキスト)を好む人々にとって、よりアクセスしやすくなります。
  4. 編集可能性: ネイティブのPowerPointおよびWord形式へのこだわりは、システムが研究者を「ブラックボックス」に閉じ込めることなく、手動での介入と磨き上げを可能にします。

研究の「ラストマイル」に取り組むことで、このシステムは、技術的な発見と一般へのコミュニケーションの間のギャップを埋めるのに役立つ、包括的なワークスペースを提供します。

Paper2poster: 論文からのマルチモーダルなポスター自動化に向けて
この引用は、本論文のPaper2Posterシステムが定量的に測定されるためのベンチマーク、評価プロトコル、および中核となるベースラインを提供するものであるため、極めて重要です。本論文の実験結果および性能に関する主張は、この先行研究の枠組みの中で大きく位置づけられます。
[1] Wei Pang, Kevin Qinghong Lin, Xiangru Jian, Xi He, and Philip Torr. Paper2poster: Towards multimodal poster automation from scientific papers. Advances in Neural Information Processing Systems, 38, 2026.
オムニプレゼント:学術論文から一貫性のあるプレゼンテーションスイートを生成する
この論文は、単一の論文から一連��プレゼンテーション資料を生成するという、同じ核心的な問題に取り組む重要な並行研究として引用されています。これは、ResearchStudio-Reelの貢献、特にネイティブ編集可能な成果物とインタラクティブなビューアに焦点を当てている点が、他の多成果物生成システムに対してどのように位置付けられるかを明確にする上で不可欠です。
[12] Qianli Ma, Jipeng Xiao, Siyu Wang, Zhiheng Tian, Wangyu Feng, Shibo Wang, Chang Guo, Shuochen Chang, Qingyang Liu, and Zhipeng Zhang. Omnipresent: Generating coherent presentation suites from scientific papers. arXiv preprint arXiv:2607.02590, 2026.
Paper2video: 科学論文からの自動動画生成
本論文の主要な3つの成果物の一つが発表動画であるため、この引用は、論文からの自動動画生成という特定の領域における先行技術と重要なベンチマークを確立している点で、極めて関連性が高いです。これは、本論文のPaper2Videoスキルに直接的な背景を提供します。
[4] Zeyu Zhu, Kevin Qinghong Lin, and Mike Zheng Shou. Paper2video: Automatic video generation from scientific papers, 2025. URL https://arxiv.org/abs/2510.05096.
論文から投稿記事へ:対話型LLM駆動のソースアウトラインを用いた詳細な長文要約支援
主論文は、本研究を「最も近いブログ執筆の先行研究」であると位置づけています。このため、Paper2Blogコンポーネントの貢献を理解する上で極めて重要な参考文献となり、研究者が自身の研究の公開向け要約を作成するのを支援するツール群の中で、その位置付けを理解するためにも不可欠です。
[7] Marissa Radensky, Daniel S Weld, Joseph Chee Chang, Pao Siangliulue, and Jonathan Bragg. Papers-to-posts: Supporting detailed long-document summarization with an interactive llm-powered source outline. arXiv preprint arXiv:2406.10370, 2024.

Audio

Audio summaryTwo hosts talking through the paper's ideas, methods and results.

Similar papers

Show more

Discussion