獨立補充

研究更新與原始論文

這一頁把基礎教材與外部更新分開。清單優先連到原始論文頁。年份較新不代表證據較強,閱讀時仍需檢查資料、基線、消融與可重現性。

10筆 2026 研究

6篇已接受會議論文

3篇 preprint

2026-07-20最後人工複核

返回課程

研究雷達

2026:分清楚發表狀態再讀結論

會議論文、工作坊立場論文與 arXiv preprint 分開標示;「2026」只代表複核範圍,不代表品質排序。

20262026 研究雷達arXiv preprint尚待正式審查

Alignment of Diffusion Model and Flow Matching for Text-to-Image Generation

從 reward-weighted distribution 統一比較 diffusion 與 flow matching 的引導。這是把「生成」和「偏好對齊」連起來的 2026 案例,但仍需分開計算成本與泛化主張。

主題:diffusion、generative、flow-matching、alignment

最後複核:2026-07-20

20262026 更新ICLR 2026 Poster已接受會議論文

Can Speech LLMs Think while Listening?

ICLR 2026 Poster。把語音推理的準確率與回應延遲放在同一個可量測的取捨中,適合連結多模態模型與即時系統。

主題:llm、reasoning、audio、multimodal、systems

最後複核:2026-07-20

20262026 安全更新ICLR 2026 Poster已接受會議論文

Fewer Weights, More Problems: A Practical Attack on LLM Pruning

ICLR 2026 Poster。展示剪枝可能啟動未剪枝模型中被抵銷的惡意行為,提醒部署前需重新評估壓縮後模型,不能沿用原模型結論。

主題:compression、pruning、llm、evaluation、security

最後複核:2026-07-20

20262026 討論ICML 2026 Workshop position paper工作坊立場論文

Position: Interpretability Can Be Actionable

ICML 2026 機制可解釋工作坊立場論文。主張不只問解釋是否漂亮,還要驗證它能否支持具體決策與介入。

主題:evaluation、explainability、llm、responsible-ai

最後複核:2026-07-20

20262026 研究雷達arXiv preprint尚待正式審查

Reinforcement World Model Learning for LLM-based Agents

將 agent 預測的下一狀態與環境實際回傳狀態對齊。閱讀時要區分世界模型誤差、任務成功獎勵與 LLM 裁判的不同失敗模式。

主題:llm、agents、world-model、reinforcement、evaluation

最後複核:2026-07-20

20262026 更新ICLR 2026 Poster已接受會議論文

SliderQuant: Accurate Post-Training Quantization for LLMs

ICLR 2026 Poster。以不同層對量化的敏感度差異,說明低比特量化不應把每層當成完全相同的對象。

主題:compression、quantization、llm、systems

最後複核:2026-07-20

20262026 更新ICLR 2026 Poster已接受會議論文

Value Flows

ICLR 2026 Poster。不把未來回報壓成單一平均值,而是以 flow matching 建模回報分布,用來討論不確定性與探索。

主題:reinforcement、flow-matching、uncertainty、exploration

最後複核:2026-07-20

演化路徑

基礎工作與近年方法

先讀建立問題與方法的核心來源,再把 2026 更新放回它們所延伸的脈絡。

2025更新

Qwen3 Technical Report

提供多語言、稠密與混合專家模型,以及思考模式切換的近期案例。

主題:llm、multilingual、reasoning、post-training

2024更新

The Llama 3 Herd of Models

可用於討論現代大型語言模型的資料、縮放、後訓練與評估管線。

主題:llm、nlp、data、post-training

2024更新

DeepSeek-V3 Technical Report

適合補充混合專家模型、負載平衡、低精度訓練與訓練成本報告方式。

主題:llm、moe、optimization、systems

2017核心

Attention Is All You Need

用原始 Transformer 建立查詢、鍵、值與多頭注意力的基準概念。

主題:attention、transformer、nlp