搜尋 arXiv、依引用數排序、挑你要的再摘要。
先試 完整片語 比對(精準,適合 retrieval augmented generation
這種專有名詞)。片語一筆都沒有時,自動放寬成 每個詞都要出現,跟 arxiv.org
網站一樣。要強制嚴格比對,把關鍵字用雙引號包起來。
「取前幾名」是在候選池裡依引用數取前 N 篇,不是只搜 N 篇。 要不要漏掉高引用論文,看的是進階選項裡的「候選池大小」。
候選池=我們實際看過幾篇論文。流程是:
符合關鍵字 5,757 篇 → 按 arXiv 相關度抓回前 800 篇 → 查這 800 篇的引用數 →
依引用數排序 → 顯示前 10 篇
所以是的,沒被抓進池子的那 4,957 篇,不管引用數多高你都看不到, 因為我們根本沒查過它們的引用數。這不是刻意藏起來,是 arXiv 沒有依引用數排序的搜尋。
調高「取前幾名」只是把池子裡已排好的多顯示幾篇;要讓更多論文有機會被看到, 要調的是候選池。代價是變慢(每 100 篇多打一次 arXiv),不花錢。 實測從 100 調到 400,原本那 100 篇一篇都沒掉,只會增加不會弄丟。
選分類通常比調大池子更有效:retrieval augmented generation
不設分類是 5,757 篇、原始 RAG 論文排第 637;限 cs.CL 之後母體剩 2,995 篇、
名次升到 396。分類縮小的是母體,池子只是多撈幾篇。
「最低引用數」不會縮小抓取範圍,它是在池子抓回來之後才過濾的。