惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

MyScale Blog
MyScale Blog
人人都是产品经理
人人都是产品经理
云风的 BLOG
云风的 BLOG
小众软件
小众软件
F
Fortinet All Blogs
爱范儿
爱范儿
WordPress大学
WordPress大学
N
Netflix TechBlog - Medium
Recent Announcements
Recent Announcements
Google DeepMind News
Google DeepMind News
C
Check Point Blog
博客园 - 聂微东
D
Docker
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
aimingoo的专栏
aimingoo的专栏
Vercel News
Vercel News
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
A
About on SuperTechFans
博客园 - 【当耐特】
Microsoft Azure Blog
Microsoft Azure Blog
B
Blog
宝玉的分享
宝玉的分享
Jina AI
Jina AI
H
Hackread – Cybersecurity News, Data Breaches, AI and More

博客园 - Angry_Panda

军事防务 —— 城市反无 —— 无线电侦测设备需要进行攻击目标分配吗?无线电侦测设备的调度在应用中是需要在部署时进行考虑还是在攻击时进行考虑 从一张AI合成的无人机救援图说起 —— 多人机协作的可行性 985大学不相信眼泪,信奉丛林法则;211大学更讲人情味 军事防务 —— 反无激光武器攻后的冷却和充能时间与其攻击的持续时长是否有关系 军事防务 —— 北京顺义李桥镇 (AI大模型生成答案)—— 反无激光武器攻后的冷却和充能时间与其攻击的持续时长是否有关系 军事防务:激光武器的参数 武器装备参数介绍 军事防务:城市反无 —— 无线电干扰设备的攻击范围 百家讲坛 —— 再度翻红 —— 长大后才发现最好的教育早已播下种子,只等阅历浇灌才真正发芽 军事防务 —— AFSim雷达传感器仿真技术 防务 —— 军事建模AFSIM —— 电磁波 为什么倒卖 军火最赚钱 —— 从防务公司的业务发展来看待军费问题 防务:防务业务 —— 武器开火后的返回结果 —— 武器结果:0=开火, 1=命中, 2=未命中 豆包AI回答 —— 为什么城市反无场景下无线电干扰设备即使击中目标也会一直攻击呢 防务:雷达和光电探测设备 —— 无人机的轨迹信息与真实位置信息的差异性,是根据随机函数来实现的吗,比如在真实位置上加一点的随机扰动吗 —— AFsim的手册 北京市顺义区李桥镇 —— 中科星图公司 —— 出行路线交通 —— “东方通勤车”(误区,“东方通勤车”的站点根本就找不到,如果不坐地铁,那么就坐850号公交) 北京市顺义区李桥镇(首都机场附件)—— 中科星图(星图防务) 公司宿舍 【转载】cessium python部署离线版本 ———— 如何使用Python操作三维地图 cessium —— cessium python部署离线版本 如何使用uv安装pytorch 基于GA-BP神经网络的防空导弹实时目标分配方法 【人生哲理】【视频】为什么说该花的钱不花,就会变成灾难呢? 随身移动WiFi ——50元级别的(三网 4G移动网络)—— 网速测试 豆包AI —— 为什么不把离散的状态空间属性用one-shot方式编码而是直接归一化为0到1范围的属性值 dogfight问题中(UAV 无人机空战——狗斗)—— 状态空间设计 为ubuntu系统安装samba网络磁盘,实现局域网中的共享网络磁盘 —— 跨系统文件共享的完整方案 sudo fwupdmgr get-upgrades —— 在 Linux 系统中,用 fwupd 工具查看当前机器所有可升级固件(BIOS/UEFI、SSD、雷电、外设等) git免密认证同步仓库代码报错——git@github.com: Permission denied (publickey) —— 所需的ssh-add加载加密私钥 —— 指定加密私钥存储位置 【转载】 执行 ssh-add 报错 Could not open a connection to your authentication agent —— git免密认证同步仓库代码,所需的ssh-add加载加密私钥 uv python环境管理工具 ubuntu系统python安装pycairo报错:Run-time dependency python found: NO (tried pkgconfig and sysconfig)
强化学习 —— Partially Observable Tasks(部分可观测任务)...
Angry_Panda · 2026-05-10 · via 博客园 - Angry_Panda

image

Limited Sensors: For this variation, we restrict the obser-
vations to only provide positional information (including
joint angles), excluding velocities. An agent now has to
learn to infer velocity information in order to recover the
full state. Similar tasks have been explored in Gomez &
Miikkulainen (1998); Sch¨afer & Udluft (2005); Heess et al.
(2015a); Wierstra et al. (2007).
Noisy Observations and Delayed Actions: In this case,
sensor noise is simulated through the addition of Gaussian
noise to the observations. We also introduce a time de-
lay between taking an action and the action being in effect,
accounting for physical latencies (Hester & Stone, 2013).
Agents now need to learn to integrate both past observa-
tions and past actions to infer the current state. Similar
tasks have been proposed in Bakker (2001).
System Identification: For this category, the underly-
ing physical model parameters are varied across different
episodes (Szita et al., 2003). The agents must learn to gen-
eralize across different models, as well as to infer the model
parameters from its observation and action history.

Partially Observable Tasks(部分可观测任务)


有限感知(Limited Sensors)

在该变体任务中,我们对观测进行限制,仅提供位置信息(包括关节角度),剔除速度信息。此时智能体必须学会推断速度,才能恢复出完整系统状态。Gomez & Miikkulainen (1998)、Schäfer & Udluft (2005)、Heess et al. (2015a) 以及 Wierstra et al. (2007) 均对类似任务进行过研究。

带噪声观测与动作延迟(Noisy Observations and Delayed Actions)

在该设置下,我们通过对观测值叠加高斯噪声来模拟传感器噪声。同时,我们在智能体执行动作与动作实际生效之间引入时间延迟,以模拟真实物理系统中的固有延迟(Hester & Stone, 2013)。智能体需要学习融合历史观测与历史动作序列,从而推断当前系统状态。Bakker (2001) 中也曾提出过类似任务设定。

系统辨识(System Identification)

在这一类任务中,底层物理模型参数在不同回合间随机变化。智能体不仅需要在不同动力学参数下具备泛化能力,还必须从历史观测与动作序列中推断出当前的模型参数。

Partially Observable Tasks(部分可观测任务):

  • 部分可观测马尔可夫决策过程(POMDP)类

  • 含扰动与时延的鲁棒控制类(Perturbation & Delay)

  • 动态系统辨识 + 元强化学习类(Meta-RL / System ID)

本博客是博主个人学习时的一些记录,不保证是为原创,个别文章加入了转载的源地址,还有个别文章是汇总网上多份资料所成,在这之中也必有疏漏未加标注处,如有侵权请与博主联系。 如果未特殊标注则为原创,遵循 CC 4.0 BY-SA 版权协议。