惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
云风的 BLOG
云风的 BLOG
博客园 - 聂微东
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
P
Proofpoint News Feed
GbyAI
GbyAI
WordPress大学
WordPress大学
NISL@THU
NISL@THU
V
Vulnerabilities – Threatpost
T
The Exploit Database - CXSecurity.com
D
DataBreaches.Net
F
Full Disclosure
Recent Commits to openclaw:main
Recent Commits to openclaw:main
V
Visual Studio Blog
Last Week in AI
Last Week in AI
L
LangChain Blog
AWS News Blog
AWS News Blog
Martin Fowler
Martin Fowler
V
V2EX
The Hacker News
The Hacker News
Scott Helme
Scott Helme
T
Troy Hunt's Blog
G
GRAHAM CLULEY
L
Lohrmann on Cybersecurity
Cloudbric
Cloudbric
C
Cyber Attacks, Cyber Crime and Cyber Security
O
OpenAI News
月光博客
月光博客
博客园_首页
Blog — PlanetScale
Blog — PlanetScale
B
Blog RSS Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Google Online Security Blog
Google Online Security Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
G
Google Developers Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
IT之家
IT之家
C
Cisco Blogs
Google DeepMind News
Google DeepMind News
T
Tenable Blog
Jina AI
Jina AI
T
Tor Project blog
The Cloudflare Blog
Y
Y Combinator Blog
Spread Privacy
Spread Privacy
L
LINUX DO - 热门话题
Cyberwarzone
Cyberwarzone
Microsoft Security Blog
Microsoft Security Blog
Stack Overflow Blog
Stack Overflow Blog
A
Arctic Wolf

I'm OWenT

国产大模型(GLM 5.1、Kimi K2.6)真实场景效果和 Coding Plan 额度测试 新版本libatapp的连接管理——从etcd服务发现到拓扑驱动的自动重连 新版本libatbus的设计变更——从树形路由到拓扑驱动 Protobuf又一坑 - C++标准和ABI兼容性 AI真好用-给Blog主题统一加mermaid,chart.js,excalidraw,draw.io的多种引入方式支持 给内网部署Squid-通用HTTP下载缓存 UE使用CodeChecker和clang-tidy生成静态分析报告 找出UE的循环依赖 游戏服务的可观测性能力建设(C++生态) 指标上报的多线程优化和多拉取源点优化 协程(libcopp)的Channel功能和CPU命中率优化 通用RPC代码生成器 实现strong_rc_ptr(比shared_ptr更快的引用计数智能指针) 手夯一个STL allocator和对象内存分析组件 std::condition_variable 的信号丢失问题 踩坑一处(GCC)STL std::async 实现BUG导致的crash问题 GCC 14的一个warning to error BUG 给xresloader(Excel导表工具)增强UE读表支持(包含蓝图,Blueprint) Opentelemetry社区在gRPC的几个链接问题(静态库和动态库混用,musl工具链,符号裁剪) Excel转表工具(xresloader)的新验证器(验证外部Excel和文本数据,唯一性和自定义规则) protobuf v22和gRPC v1.55版本升级的依赖变化和upb适配 关于protobuf近期版本(v20/v3.20+)和 gRPC v1.54版本在某些编译环境下的一些链接和编译问题 xresloader-Excel导表工具链的近期变更汇总 打通游戏服务端框架的C++20协程改造的最后一环 Opentelemetry-cpp的Logs模块标准更新(涉及近期版本:1.8-1.9的BREAK CHANGES) 给cmake-toolset和工具链(curl等)加HTTP/2和HTTP/3支持 又开新坑之 coredns 插件: nftables和filter 关于opentelemetry-cpp社区对于C++ Head Only组件单例和符号可见性的讨论小记 填个转表工具 xresloader 去年的坑(数组尾部裁剪) 集成 upb 和 lua binding 的踩坑小记 libcopp对C++20协程的接入和接口设计 再度优化GCC、LLVM、Clang、libc++、libc++abi等套件的构建脚本 游戏服务的分布式事务优化(二)- 事务管理 游戏服务的分布式事务优化(一)- Write Ahead Log(WAL) 模块 记录一些bazel适配用编译选项 测试现代化硬件C++浮点数性能和一致性 适配Boringssl和OpenSSL 3.0 近期cmake-toolset的一些适配问题 C++20 Text Formatting/fmtlib 适配问题小记 再次重构LLVM+Clang+libcxx+libc++abi+其他相关工具的构建流程 重构基于CMake的构建工具链 新版GCC和LLVM+Clang终于Release啦 折腾一下nftables下的双拨 [C++20] Module partitions和符号交叉引用(声明和实现分离) [Rust] 实现一个线程安全且迭代器可以保存的链表 基于protobuf的代码生成 几个使用protobuf中C++接口的Arena的坑 Amazon Aurora DB存储引擎论文阅读小记 近期对libatapp的一些优化调整(增加服务发现和连接管理,支持yaml等) xresloader转表工具链增加了一些新功能(map,oneof支持,输出矩阵,基于模板引擎的加载代码生成等) 在游戏服务器中使用分布式事务 libcopp接入C++20 Coroutine和一些过渡期的设计 libatbus 的大幅优化 nftables初体验 容器配置开发环境小计 PALM Tree - 适合多核并发架构的B+树 - 论文阅读小记 跨平台协程库 - libcopp 简介 C++20 Coroutine 性能测试 (附带和libcopp/libco/libgo/goroutine/linux ucontext对比) 尝鲜Github Action 一些xresloader(转表工具)的改进 protobuf、flatbuffer、msgpack 针对小数据包的简单对比 协程框架(libcopp) 小幅优化 Excel转表工具(xresloader) 增加protobuf插件功能和集成 UnrealEngine 支持 Anna(支持任意扩展和超高性能的KV数据库系统)阅读笔记 C++20 Coroutine libcopp merge boost.context 1.69.0 Google去中心化分布式系统论文三件套(Percolator、Spanner、F1)读后感 Rust玩具-企业微信机器人通用服务 使用ELK辅助监控开发测试环境服务质量和问题定位 2018年的新通用伪随机数算法(xoshiro / xoroshiro)的C++(head only)实现 Webpack+vue+boostrap+ejs构建Web版GM工具 Rust的第二次接触-写个小服务器程序 理解和适配AEAD加密套件 atsf4g-co的进化:协程框架v2、对象路由系统和一些其他细节优化 协程框架(libcopp)v2优化、自适应栈池和同类库的Benchmark对比 可执行文件压缩 初识Rust 使用restructedtext编写xresloader文档 atframework的etcd模块化重构 C++的backtrace ECDH椭圆双曲线(比DH快10倍的密钥交换)算法简介和封装 protobuf-net的动态Message实现 pbc的proto3接入 atgateway内置协议流程优化-加密、算法协商和ECDH 整理一波软件源镜像同步工具+DevOps工具 Blog切换到Hugo libcopp v2的第一波优化完成 libcopp(v2) vs goroutine性能测试 libcopp的线程安全、栈池和merge boost.context 1.64.0 GCC 7和LLVM+Clang+libc++abi 4.0的构建脚本 libatbus的几个藏得很深的bug 用cmake交叉编译到iOS和Android 开源项目得一些小维护 atapp的c binding和c#适配 对象路由系统设计 2016年总结 近期的一个协程流程BUG 重写了llvm+clang+libc++和libc++abi的构建脚本 atsf4g完整游戏工程示例|I'm OWenT atframework基本框架已经完成|I'm OWenT
C++小协程栈和临时变量及作用域的栈溢出问题分析
owent · 2025-08-03 · via I'm OWenT

blog-website

背景

近期在给一个项目换一些底层接口的日志处理部分。把原始的类 printf 的格式化方式换成 fmtlib / C++ 20 Text Formatting 的方案。

然后发现,替换完一段未执行的代码后,会发生内存写坏的情况。

问题分析

通过跟踪生成的汇编和 gdb 的 info frame 位置。发现替换之后,栈帧位置大幅增加了。比如对这类代码:

#define LOGFMT(...)                                                 \
    do {                                                            \
        auto buf = get_log_buffer_addr();                           \
        auto size = get_log_buffer_size();                          \
        auto fmt_res = fmt::format_to_n(buf, size, __VA_ARGS__);    \
        if (fmt_res.size >= size) {                                 \
            buf[size - 1] = 0;                                      \
        } else {                                                    \
            buf[fmt_res.size] = 0;                                  \
        }                                                           \
        std::cout << buf << '\n';                                   \
    } while(false)

void func1() {
  //...
}

void func2() {
  //...
  LOGFMT("test {}, data {}", a, b);

  func1();
}

LOGFMT(...) 宏的实现里,使用 fmt::format_to_nsnprintffunc1func2 的函数栈顶增量大幅增加。

理论上, LOGFMT() 的代码都处于子作用域里,无论是临时变量还是子作用域里的变量,出了作用域之后应该可以释放并被复用。 但是现在各个编译器(包括GCC、Clang和MSVC)似乎是为了方便调试信息定位和区分变量,都没有复用这部分栈空间。

而在我们项目工程里,有些地方使用了64K栈的协程。我改造的地方属于日志相关的模块,被大量多层级使用。 这两个因素叠加以后,恰好成为了压死骆驼的最后一根稻草。

问题测试代码

这里贴一下独立的复现和测试代码:

// -std=c++17 -O0 -g -ggdb -fno-omit-frame-pointer
// /O0 /Zc:__cplusplus
#include <fmt/format.h>

#ifdef _MSC_VER
#  include <intrin.h>
#endif

#include <iostream>
#include <cstddef>
#include <string>

#ifndef TEST_NOINLINE_NOCLONE
#  if defined(__clang__)
#    if __cplusplus >= 201103L
#      define TEST_NOINLINE_NOCLONE [[gnu::noinline]]
#    else
#      define TEST_NOINLINE_NOCLONE __attribute__((noinline))
#    endif
#  elif defined(__GNUC__) && __GNUC__ > 3
#    if __cplusplus >= 201103L && (__GNUC__ * 100 + __GNUC_MINOR__) >= 408
#      define TEST_NOINLINE_NOCLONE [[gnu::noinline, gnu::noclone]]
#    else
#      define TEST_NOINLINE_NOCLONE __attribute__((noinline, noclone))
#    endif
#  elif defined(_MSC_VER)
#    define TEST_NOINLINE_NOCLONE __declspec(noinline)
#  else
#    define TEST_NOINLINE_NOCLONE
#  endif
#endif

// 模拟日志代码
namespace {
constexpr size_t get_log_buffer_size() {
    return 1 << 20; // 1 MiB
}
char* get_log_buffer_addr() {
    static char log_buffer[get_log_buffer_size()];
    return log_buffer;
}
}

#define LOGFMT(...)                                                 \
    do {                                                            \
        auto buf = get_log_buffer_addr();                           \
        auto size = get_log_buffer_size();                          \
        auto fmt_res = fmt::format_to_n(buf, size, __VA_ARGS__);    \
        if (fmt_res.size >= size) {                                 \
            buf[size - 1] = 0;                                      \
        } else {                                                    \
            buf[fmt_res.size] = 0;                                  \
        }                                                           \
        std::cout << buf << '\n';                                   \
    } while(false)

#ifdef _MSC_VER
#  define TEST_TOP_FRAME_ADDR ((uintptr_t)_AddressOfReturnAddress())
#else
#  define TEST_TOP_FRAME_ADDR ((uintptr_t)__builtin_frame_address(0))
#endif

TEST_NOINLINE_NOCLONE void func_leaf(uintptr_t top, uintptr_t previous) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    std::cout<< "======\n"<< "(LEAF) from func_no_var_no_fmt"
        << ", previous offset: "<< (previous - current)
        << ", top offset: "<< (top - current)
        << '\n';
}

TEST_NOINLINE_NOCLONE void func_no_var_no_fmt(uintptr_t top, uintptr_t previous) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    std::cout<< "======\n"<< "from func_no_var_fmt_once"
        << ", previous offset: "<< (previous - current)
        << ", top offset: "<< (top - current)
        << '\n';

    func_leaf(top, current);
}

TEST_NOINLINE_NOCLONE void func_no_var_fmt_once(uintptr_t top, uintptr_t previous) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    LOGFMT("======\n{}", "func_no_var_fmt_once");
    std::cout<< "from func_no_var_fmt_twice"
        << ", previous offset: "<< (previous - current)
        << ", top offset: "<< (top - current)
        << '\n';

    func_no_var_no_fmt(top, current);
}

TEST_NOINLINE_NOCLONE void func_no_var_fmt_twice(uintptr_t top, uintptr_t previous) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    LOGFMT("======\n{}", "func_no_var_fmt_twice");
    LOGFMT("{}: previous offset: {}, top offset: {}",
            "from func_int_var_fmt_once", (previous - current), (top - current));

    func_no_var_fmt_once(top, current);
}


TEST_NOINLINE_NOCLONE void func_int_var_fmt_once(uintptr_t top, uintptr_t previous, int p1) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    volatile int p2 = 0;
    
    {
        char buf[1024];
        LOGFMT("======\n{}: sizeof(parameter1): {}, sizeof(stack var): {}",
                "func_int_var_fmt_once", sizeof(p1), sizeof(p2));
    }
    std::cout<< "from func_int_var_fmt_twice"
        << ", p2 addr: " << (uintptr_t)&p2
        << ", previous offset: "<< (previous - current)
        << ", top offset: "<< (top - current)
        << '\n';

    func_no_var_fmt_twice(top, current);
}

TEST_NOINLINE_NOCLONE void func_int_var_fmt_twice(uintptr_t top, uintptr_t previous, int p1) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    volatile int p2 = 0;
    
    LOGFMT("======\n{}: sizeof(parameter1): {}, sizeof(stack var): {}",
            "func_int_var_fmt_twice", sizeof(p1), sizeof(p2));
    LOGFMT("{}: p2 addr: {}, previous offset: {}, top offset: {}",
            "from func_string_var_fmt_once", (uintptr_t)&p2, (previous - current), (top - current));

    func_int_var_fmt_once(top, current, p1);
}

TEST_NOINLINE_NOCLONE void func_string_var_fmt_once(uintptr_t top, uintptr_t previous, std::string p1) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    volatile std::string p2 = "from " + std::string(__FUNCTION__);
    
    LOGFMT("======\n{}: sizeof(parameter1): {}, sizeof(stack var): {}",
            "func_string_var_fmt_once", sizeof(p1), sizeof(p2));
    std::cout<< p1
        << ", p2 addr: " << (uintptr_t)&p2
        << ", previous offset: "<< (previous - current)
        << ", top offset: "<< (top - current)
        << '\n';

    func_int_var_fmt_twice(top, current, 0);
}

TEST_NOINLINE_NOCLONE void func_string_var_fmt_twice(uintptr_t top, uintptr_t previous, std::string p1) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    volatile std::string p2 = "from " + std::string(__FUNCTION__);
    
    LOGFMT("======\n{}: sizeof(parameter1): {}, sizeof(stack var): {}",
            "func_string_var_fmt_twice", sizeof(p1), sizeof(p2));
    LOGFMT("{}: p2 addr: {}: , previous offset: {}, top offset: {}",
            p1, (uintptr_t)&p2, (previous - current), (top - current));

    func_string_var_fmt_once(top, current, "from func_string_var_fmt_twice");
}

TEST_NOINLINE_NOCLONE void func_empty(uintptr_t top, uintptr_t previous) {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    volatile int p2 = 0;
    
    std::cout<< "func_empty"
        << ", p2 addr: " << (uintptr_t)&p2
        << ", previous offset: "<< (previous - current)
        << ", top offset: "<< (top - current)
        << '\n';

    func_string_var_fmt_twice(top, current, "from func_empty");
}


int main() {
    uintptr_t current = TEST_TOP_FRAME_ADDR;
    func_empty(current, current);
    return 0;
}

各个编译器的编译指令在注释里,可以在 https://godbolt.org 上测试运行。各个编译器的结论都差不多。 这里贴一下 Clang 20 的输出:

func_empty, p2 addr: 140734321135460, previous offset: 32, top offset: 32
======
func_string_var_fmt_twice: sizeof(parameter1): 32, sizeof(stack var): 32
from func_empty: p2 addr: 140734321135184: , previous offset: 160, top offset: 192
======
func_string_var_fmt_once: sizeof(parameter1): 32, sizeof(stack var): 32
from func_string_var_fmt_twice, p2 addr: 140734321134664, previous offset: 576, top offset: 768
======
func_int_var_fmt_twice: sizeof(parameter1): 4, sizeof(stack var): 4
from func_string_var_fmt_once: p2 addr: 140734321134316, previous offset: 384, top offset: 1152
======
func_int_var_fmt_once: sizeof(parameter1): 4, sizeof(stack var): 4
from func_int_var_fmt_twice, p2 addr: 140734321134052, previous offset: 288, top offset: 1440
======
func_no_var_fmt_twice
from func_int_var_fmt_once: previous offset: 176, top offset: 1616
======
func_no_var_fmt_once
from func_no_var_fmt_twice, previous offset: 240, top offset: 1856
======
from func_no_var_fmt_once, previous offset: 128, top offset: 1984
======
(LEAF) from func_no_var_no_fmt, previous offset: 48, top offset: 2032

可以看到,每次调用fmt接口增量都挺大。在 -O2 下可能是涉及内存对齐(我没有再仔细查看汇编),offset会更大。

解决方案

这个问题我试了一些方案,都无法零开销地解决这个问题。最后采用的方法是利用匿名的Lambda对象做一次中转。相当于把内存增量控制在Lambda表达式的对象本身的开销上。(直接加函数中转可能会被内联,从而导致栈仍然无法被复用)

按上面的代码例子就是 LOGFMT(...) 改成如下形式, 其他代码不变:

#define LOGFMT(...)                                                 \
    ([&]() {                                                        \
        auto buf = get_log_buffer_addr();                           \
        auto size = get_log_buffer_size();                          \
        auto fmt_res = fmt::format_to_n(buf, size, __VA_ARGS__);    \
        if (fmt_res.size >= size) {                                 \
            buf[size - 1] = 0;                                      \
        } else {                                                    \
            buf[fmt_res.size] = 0;                                  \
        }                                                           \
        std::cout << buf << '\n';                                   \
    })()

对比结果如下:

func_empty, p2 addr: 140736400274708, previous offset: 32, top offset: 32
======
func_string_var_fmt_twice: sizeof(parameter1): 32, sizeof(stack var): 32
from func_empty: p2 addr: 140736400274480: , previous offset: 160, top offset: 192
======
func_string_var_fmt_once: sizeof(parameter1): 32, sizeof(stack var): 32
from func_string_var_fmt_twice, p2 addr: 140736400274208, previous offset: 304, top offset: 496
======
func_int_var_fmt_twice: sizeof(parameter1): 4, sizeof(stack var): 4
from func_string_var_fmt_once: p2 addr: 140736400274028, previous offset: 240, top offset: 736
======
func_int_var_fmt_once: sizeof(parameter1): 4, sizeof(stack var): 4
from func_int_var_fmt_twice, p2 addr: 140736400273932, previous offset: 96, top offset: 832
======
func_no_var_fmt_twice
from func_int_var_fmt_once: previous offset: 64, top offset: 896
======
func_no_var_fmt_once
from func_no_var_fmt_twice, previous offset: 80, top offset: 976
======
from func_no_var_fmt_once, previous offset: 48, top offset: 1024
======
(LEAF) from func_no_var_no_fmt, previous offset: 48, top offset: 1072

可以看到,各层级的 previous offset 都已经控制在一个比较小的值里了。

最后

这个问题大多数场景不会遇到,但是涉及栈很小的协程,或者类似其他的应用场景可能都会碰到。

比如 https://github.com/yuanzhubi/call_in_stack 的使用场景。之前和这个库的作者交流说是用在流媒体处理的某些业务处理里。

我暂时没有进一步研究是否有跨平台的方案告知编译器去完全复用这块内存,如果可以的话应该是最佳的解法。

也欢迎有兴趣的小伙伴们互相交流探讨。