[v5,38/39] mm: Add large page readahead

Message ID	20200529025824.32296-39-willy@infradead.org (mailing list archive)
State	New, archived
Headers	show Return-Path: <SRS0=ONGt=7L=kvack.org=owner-linux-mm@kernel.org> DMARC-Filter: OpenDMARC Filter v1.3.2 mail.kernel.org 6C86B2145D From: Matthew Wilcox <willy@infradead.org> To: linux-fsdevel@vger.kernel.org Cc: "Matthew Wilcox (Oracle)" <willy@infradead.org>, linux-mm@kvack.org, linux-kernel@vger.kernel.org Subject: [PATCH v5 38/39] mm: Add large page readahead Date: Thu, 28 May 2020 19:58:23 -0700 Message-Id: <20200529025824.32296-39-willy@infradead.org> In-Reply-To: <20200529025824.32296-1-willy@infradead.org> References: <20200529025824.32296-1-willy@infradead.org> MIME-Version: 1.0 Content-Transfer-Encoding: quoted-printable Sender: owner-linux-mm@kvack.org Precedence: bulk
Series	Large pages in the page cache \| expand [v5,00/39] Large pages in the page cache [v5,01/39] mm: Move PageDoubleMap bit [v5,02/39] mm: Simplify PageDoubleMap with PF_SECOND policy [v5,03/39] mm: Allow hpages to be arbitrary order [v5,04/39] mm: Introduce thp_size [v5,05/39] mm: Introduce thp_order [v5,06/39] mm: Introduce offset_in_thp [v5,07/39] fs: Add a filesystem flag for large pages [v5,08/39] fs: Do not update nr_thps for large page mappings [v5,09/39] fs: Introduce i_blocks_per_page [v5,10/39] fs: Make page_mkwrite_check_truncate thp-aware [v5,11/39] fs: Support THPs in zero_user_segments [v5,12/39] bio: Add bio_for_each_thp_segment_all [v5,13/39] iomap: Support arbitrarily many blocks per page [v5,14/39] iomap: Support large pages in iomap_adjust_read_range [v5,15/39] iomap: Support large pages in invalidatepage [v5,16/39] iomap: Support large pages in read paths [v5,17/39] iomap: Support large pages in write paths [v5,18/39] iomap: Inline data shouldn't see large pages [v5,19/39] iomap: Handle tail pages in iomap_page_mkwrite [v5,20/39] xfs: Support large pages [v5,21/39] mm: Make prep_transhuge_page return its argument [v5,22/39] mm: Add __page_cache_alloc_order [v5,23/39] mm: Allow large pages to be added to the page cache [v5,24/39] mm: Allow large pages to be removed from the page cache [v5,25/39] mm: Remove page fault assumption of compound page size [v5,26/39] mm: Fix total_mapcount assumption of page size [v5,27/39] mm: Remove assumptions of THP size [v5,28/39] mm: Avoid splitting large pages [v5,29/39] mm: Fix truncation for pages of arbitrary size [v5,30/39] mm: Handle truncates that split large pages [v5,31/39] mm: Support storing shadow entries for large pages [v5,32/39] mm: Support retrieving tail pages from the page cache [v5,33/39] mm: Support tail pages in wait_for_stable_page [v5,34/39] mm: Add DEFINE_READAHEAD [v5,35/39] mm: Make page_cache_readahead_unbounded take a readahead_control [v5,36/39] mm: Make __do_page_cache_readahead take a readahead_control [v5,37/39] mm: Allow PageReadahead to be set on head pages [v5,38/39] mm: Add large page readahead [v5,39/39] mm: Align THP mappings for non-DAX

Message ID

20200529025824.32296-39-willy@infradead.org (mailing list archive)

State

New, archived

Headers

DMARC-Filter: OpenDMARC Filter v1.3.2 mail.kernel.org 6C86B2145D
From: Matthew Wilcox <willy@infradead.org>
To: linux-fsdevel@vger.kernel.org
Cc: "Matthew Wilcox (Oracle)" <willy@infradead.org>,
	linux-mm@kvack.org,
	linux-kernel@vger.kernel.org
Subject: [PATCH v5 38/39] mm: Add large page readahead
Date: Thu, 28 May 2020 19:58:23 -0700
Message-Id: <20200529025824.32296-39-willy@infradead.org>
In-Reply-To: <20200529025824.32296-1-willy@infradead.org>
References: <20200529025824.32296-1-willy@infradead.org>
MIME-Version: 1.0
Content-Transfer-Encoding: quoted-printable
Sender: owner-linux-mm@kvack.org
Precedence: bulk

Series

Large pages in the page cache | expand

Commit Message

Matthew Wilcox (Oracle) May 29, 2020, 2:58 a.m. UTC

From: "Matthew Wilcox (Oracle)" <willy@infradead.org>

If the filesystem supports large pages, allocate larger pages in the
readahead code when it seems worth doing.  The heuristic for choosing
larger page sizes will surely need some tuning, but this aggressive
ramp-up seems good for testing.

Signed-off-by: Matthew Wilcox (Oracle) <willy@infradead.org>
---
 mm/readahead.c | 93 ++++++++++++++++++++++++++++++++++++++++++++++----
 1 file changed, 87 insertions(+), 6 deletions(-)

diff --git a/mm/readahead.c b/mm/readahead.c
index 74c7e1eff540..ac16e96a8828 100644
--- a/mm/readahead.c
+++ b/mm/readahead.c
@@ -149,7 +149,7 @@  static void read_pages(struct readahead_control *rac, struct list_head *pages,
 
 	blk_finish_plug(&plug);
 
-	BUG_ON(!list_empty(pages));
+	BUG_ON(pages && !list_empty(pages));
 	BUG_ON(readahead_count(rac));
 
 out:
@@ -428,13 +428,92 @@  static int try_context_readahead(struct address_space *mapping,
 	return 1;
 }
 
+#ifdef CONFIG_TRANSPARENT_HUGEPAGE
+static inline int ra_alloc_page(struct readahead_control *rac, pgoff_t index,
+		pgoff_t mark, unsigned int order, gfp_t gfp)
+{
+	int err;
+	struct page *page = __page_cache_alloc_order(gfp, order);
+
+	if (!page)
+		return -ENOMEM;
+	if (mark - index < (1UL << order))
+		SetPageReadahead(page);
+	err = add_to_page_cache_lru(page, rac->mapping, index, gfp);
+	if (err)
+		put_page(page);
+	else
+		rac->_nr_pages += 1UL << order;
+	return err;
+}
+
+static bool page_cache_readahead_order(struct readahead_control *rac,
+		struct file_ra_state *ra, unsigned int order)
+{
+	struct address_space *mapping = rac->mapping;
+	unsigned int old_order = order;
+	pgoff_t index = readahead_index(rac);
+	pgoff_t limit = (i_size_read(mapping->host) - 1) >> PAGE_SHIFT;
+	pgoff_t mark = index + ra->size - ra->async_size;
+	int err = 0;
+	gfp_t gfp = readahead_gfp_mask(mapping);
+
+	if (!mapping_large_pages(mapping))
+		return false;
+
+	limit = min(limit, index + ra->size - 1);
+
+	/* Grow page size up to PMD size */
+	if (order < HPAGE_PMD_ORDER) {
+		order += 2;
+		if (order > HPAGE_PMD_ORDER)
+			order = HPAGE_PMD_ORDER;
+		while ((1 << order) > ra->size)
+			order--;
+	}
+
+	/* If size is somehow misaligned, fill with order-0 pages */
+	while (!err && index & ((1UL << old_order) - 1))
+		err = ra_alloc_page(rac, index++, mark, 0, gfp);
+
+	while (!err && index & ((1UL << order) - 1)) {
+		err = ra_alloc_page(rac, index, mark, old_order, gfp);
+		index += 1UL << old_order;
+	}
+
+	while (!err && index <= limit) {
+		err = ra_alloc_page(rac, index, mark, order, gfp);
+		index += 1UL << order;
+	}
+
+	if (index > limit) {
+		ra->size += index - limit - 1;
+		ra->async_size += index - limit - 1;
+	}
+
+	read_pages(rac, NULL, false);
+
+	/*
+	 * If there were already pages in the page cache, then we may have
+	 * left some gaps.  Let the regular readahead code take care of this
+	 * situation.
+	 */
+	return !err;
+}
+#else
+static bool page_cache_readahead_order(struct readahead_control *rac,
+		struct file_ra_state *ra, unsigned int order)
+{
+	return false;
+}
+#endif
+
 /*
  * A minimal readahead algorithm for trivial sequential/random reads.
  */
 static void ondemand_readahead(struct address_space *mapping,
 		struct file_ra_state *ra, struct file *file,
-		bool hit_readahead_marker, pgoff_t index,
-		unsigned long req_size)
+		struct page *page, pgoff_t index, unsigned long req_size)
 {
 	DEFINE_READAHEAD(rac, file, mapping, index);
 	struct backing_dev_info *bdi = inode_to_bdi(mapping->host);
@@ -473,7 +552,7 @@  static void ondemand_readahead(struct address_space *mapping,
 	 * Query the pagecache for async_size, which normally equals to
 	 * readahead size. Ramp it up and use it as the new readahead size.
 	 */
-	if (hit_readahead_marker) {
+	if (page) {
 		pgoff_t start;
 
 		rcu_read_lock();
@@ -544,6 +623,8 @@  static void ondemand_readahead(struct address_space *mapping,
 	}
 
 	rac._index = ra->start;
+	if (page && page_cache_readahead_order(&rac, ra, compound_order(page)))
+		return;
 	__do_page_cache_readahead(&rac, ra->size, ra->async_size);
 }
 
@@ -578,7 +659,7 @@  void page_cache_sync_readahead(struct address_space *mapping,
 	}
 
 	/* do read-ahead */
-	ondemand_readahead(mapping, ra, filp, false, index, req_count);
+	ondemand_readahead(mapping, ra, filp, NULL, index, req_count);
 }
 EXPORT_SYMBOL_GPL(page_cache_sync_readahead);
 
@@ -624,7 +705,7 @@  page_cache_async_readahead(struct address_space *mapping,
 		return;
 
 	/* do read-ahead */
-	ondemand_readahead(mapping, ra, filp, true, index, req_count);
+	ondemand_readahead(mapping, ra, filp, page, index, req_count);
 }
 EXPORT_SYMBOL_GPL(page_cache_async_readahead);

[v5,38/39] mm: Add large page readahead

Commit Message

Patch