]> git.ipfire.org Git - thirdparty/kernel/linux.git/commitdiff
dma-contiguous: add kconfig option to setup numa cma area if not configured explicitly
authorFeng Tang <feng.tang@linux.alibaba.com>
Tue, 12 May 2026 08:55:09 +0000 (16:55 +0800)
committerMarek Szyprowski <m.szyprowski@samsung.com>
Fri, 22 May 2026 05:57:40 +0000 (07:57 +0200)
There was a report on a multi-numa-nodes arm64 server that when IOMMU
is disabled, the dma_alloc_coherent() function always returns memory
from node 0 even for devices attaching to other nodes, while they can
get local dma memory when IOMMU is on with the same API.

The reason is, when IOMMU is disabled, the dma_alloc_coherent() will
go the direct way and call dma_alloc_contiguous(). The system doesn't
have any explicit cma setting (like per-numa cma), and only has a
default 64MB cma reserved area (on node 0), where kernel will try
first to allocate memory from.

Robin Murphy suggested to setup pernuma cma or disable cma, which did
solve the issue. While there is still concern that for customers
which don't have much kernel knowledge, they could still suffer from
this silently as some architectures enable cma area by default (not
an issue for X86 though, which set CONFIG_CMA_SIZE_MBYTES to 0 by
default) for most Linux distributions.

One thought is to follow the current cma reserving policy for platform
with 'CONFIG_DMA_NUMA_CMA=y', that if the numa cma (either the 'numa cma'
or 'cma pernuma' method) is not explicitly configured, and the platform
really has multiple NUMA nodes, set it up according to size of default
'dma_contiguous_default_area'. This way, the default behavior of
platform with one NUMA node is kept unchanged (say embedded/small
devices don't need to allocate extra memory), while the general dma
locality is improved.

Add a new bool kernel config CONFIG_CMA_SIZE_PERNUMA to control whether
to enable it. Even when the config is enabled, user can still disable
it by kernel-cmdline setting like "numa_cma=0:0" or "cma_pernuma=0".

Reported-by: Changrong Chen <chenchangrong.ccr@alibaba-inc.com>
Suggested-by: Ying Huang <ying.huang@linux.alibaba.com>
Suggested-by: Robin Murphy <robin.murphy@arm.com>
Signed-off-by: Feng Tang <feng.tang@linux.alibaba.com>
Link: https://lore.kernel.org/r/20260512085509.83002-1-feng.tang@linux.alibaba.com
Link: https://lore.kernel.org/all/20260520222742.GA1607511@ax162/
[mszyprow: squashed changes from both links, added __initdata attribute
           to the numa_cma_configured variable]
Signed-off-by: Marek Szyprowski <m.szyprowski@samsung.com>
kernel/dma/Kconfig
kernel/dma/contiguous.c

index bfef21b4a9ae7dbaec2dca36b14f0deed325f6ab..c9fa0a922cba94ab43dd2690c7970ff5baca0fd3 100644 (file)
@@ -181,6 +181,16 @@ config DMA_NUMA_CMA
          or set the node id and its size of CMA by specifying "numa_cma=
          <node>:size[,<node>:size]" on the kernel's command line.
 
+config CMA_SIZE_PERNUMA
+       bool "Default CMA area per NUMA node"
+       depends on DMA_NUMA_CMA
+       default y
+       help
+         On systems with more than one NUMA node, the selected CMA
+         area size will be also allocated on each additional node,
+         so that most devices may have benefit from better DMA
+         locality without an explicit command-line opt-in.
+
 comment "Default contiguous memory area size:"
 
 config CMA_SIZE_MBYTES
index 03f52bd1712062ca0db1ea87d7d4239559aae86d..799f6e9c88bd6ca784621f16736e42ac95edb04f 100644 (file)
@@ -136,6 +136,7 @@ static struct cma *dma_contiguous_numa_area[MAX_NUMNODES];
 static phys_addr_t numa_cma_size[MAX_NUMNODES] __initdata;
 static struct cma *dma_contiguous_pernuma_area[MAX_NUMNODES];
 static phys_addr_t pernuma_size_bytes __initdata;
+static bool numa_cma_configured __initdata;
 
 static int __init early_numa_cma(char *p)
 {
@@ -164,6 +165,7 @@ static int __init early_numa_cma(char *p)
                        break;
        }
 
+       numa_cma_configured = true;
        return 0;
 }
 early_param("numa_cma", early_numa_cma);
@@ -171,6 +173,7 @@ early_param("numa_cma", early_numa_cma);
 static int __init early_cma_pernuma(char *p)
 {
        pernuma_size_bytes = memparse(p, &p);
+       numa_cma_configured = true;
        return 0;
 }
 early_param("cma_pernuma", early_cma_pernuma);
@@ -199,6 +202,11 @@ static void __init dma_numa_cma_reserve(void)
 {
        int nid;
 
+       if (IS_ENABLED(CONFIG_CMA_SIZE_PERNUMA) &&
+           !numa_cma_configured && dma_contiguous_default_area &&
+           nr_online_nodes > 1)
+               pernuma_size_bytes = cma_get_size(dma_contiguous_default_area);
+
        for_each_node(nid) {
                int ret;
                char name[CMA_MAX_NAME];
@@ -255,8 +263,6 @@ void __init dma_contiguous_reserve(phys_addr_t limit)
        phys_addr_t selected_limit = limit;
        bool fixed = false;
 
-       dma_numa_cma_reserve();
-
        pr_debug("%s(limit %08lx)\n", __func__, (unsigned long)limit);
 
        if (size_cmdline != -1) {
@@ -312,6 +318,8 @@ void __init dma_contiguous_reserve(phys_addr_t limit)
                if (ret)
                        pr_warn("Couldn't queue default CMA region for heap creation.");
        }
+
+       dma_numa_cma_reserve();
 }
 
 void __weak