English
联系我们
网站地图
邮箱
旧版回顾



大秦帝国

复旦大学造出“超级视频剪刀手”:同时追踪20个目标,速度还跟追一个一样快_我的网站

家族诞生

一 |     这项研究来自复旦大学与上海财经大学的联合团队,论文以预印本形式于2026年7月9日在arXiv公开发表,编号为arXiv:2607.08688,感兴趣的读者可通过该编号查阅完整论文。         你有没有想过,当一辆自动驾驶汽车行驶在繁忙的十字路口时,它的"眼睛"需要同时盯住多少个目标?行人、自行车、公交车、出租车、路边突然跑出来的小狗……每一个都不能漏掉,而且要实时、毫不迟疑地判断每个目标的位置和边界。这不是科幻场景,而是现代计算机视觉系统正在努力攻克的真实难题。    As Massoud walked down a Kabul street one cold Sunday morning, looking for a day job to feed his family, pickup trucks full of armed Taliban members stopped in front of him. He told CBS News the men aimed their AK-47s at him, he was handcuffed, blindfolded and taken to an office of the Taliban's General Directorate of Intelligence.For more than a month, Massoud's family had no idea where he was. They searched everywhere, including hospitals, until they arrived at the Taliban's intelligence department. "After six weeks of searching, they found me at the Taliban's 040 intelligence department," Massoud told CBS News in a phone interview. He said during the first 15 days of his imprisonment, he was "beaten, struck with electric shock sticks, electrocuted, waterboarded and hanged upside down."

First Anniversary Of Taliban Retaking Control Of Afghanistan              
Taliban members ride in a pickup truck during a celebration of the first anniversary of the Taliban's return to power, August 15, 2022, in Kabul, Afghanistan.                    Nava Jamshidi/Getty             
His crime? Massoud worked for the U.S. military as an interpreter from 2011 to 2013, including a year spent working with U.S. Navy SEALs. (CBS News is not using the real name of Massoud or the other former interpreter interviewed for this story to protect them from possible retaliation.)       

"Don't want to see that horror again" 

Massoud said that during interrogations, Taliban intelligence officers told him that, "with my help, the Americans have killed our people, and that I was still spying for the Americans.""I told them, 'You have announced a general amnesty,'" Massoud told CBS News, but he was informed by the Taliban interrogators, "there is no amnesty for you people."                 Massoud was finally released by the Taliban after more than three months of imprisonment, after his brothers signed two separate guarantees promising the Taliban they would bring him back to the intelligence agency if ever asked to do so. CBS News has seen the letters and other documents his family filed with Taliban officials while he was imprisoned."They can find me anytime they wish and put me back in the prison," he told CBS News. "I just don't want to see that horror again." 

"Still in danger"

U.S. Army Sgt. Jordan David Johnson, who has since been honorably discharged, was Massoud's direct supervisor in Helmand province and has written to members of the U.S. Congress supporting his former Afghan colleague's application for a U.S. visa, but to no avail. "Every time I hear from Massoud I feel guilty, because he is still in danger," Johnson told CBS News. "We told them that, 'You help us, and we will help you.' But now we are not, and that is wrong."
afghanistan-interpreters-cbs.jpg              
U.S. Army Sgt. Jordan David Johnson (right), who has since been honorably discharged, is seen during his deployment in Afghanistan's Helmand province, with his Afghan interpreter Massoud (top left) and others.                    Photo courtesy of Jordan David Johnson             
In a September 2022 letter to lawmakers, Johnson said he trusted Massoud then, "and I am proud to call him a friend today," adding that he did not believe the Afghan "poses a national security threat to the United States of America."                      

"They will come after me and my family"

Omar, 32, told CBS News that he worked with the U.S. military from 2008 until 2012 and was deployed alongside U.S. troops in eastern Paktia province. From 2012 until Afghanistan fell back into the Taliban's hands in August 2021, he worked on various projects with the U.S. Agency for International Development (USAID) at the U.S. Embassy in Kabul. He was threatened many times for working with the U.S. and was injured in what he believes was an assassination attempt in 2014, after he filed for a U.S. visa. 
    
                                                     
    
                        Afghan women who served with Americans fight for U.S. residency 2 years after Taliban takeover         03:05                            
Despite the threats, which he continued reporting to his supervisors at the embassy, Omar was informed that his U.S. Special Immigration Visa, or SIV, application had been rejected because documents he submitted previously had been deemed fraudulent. He believes it's because he failed a polygraph administered by U.S. officials eight years earlier, and that the process was unfair. "They intentionally make you a criminal," he told CBS News. "You are only allowed to answer their questions with yes and no, and they don't give you a chance to explain." Omar filed an appeal against the rejection of his application in mid-June and is waiting for a response. He urged the U.S. government to "seriously look into our cases and take us into safety," adding that if it doesn't happen, "they will come after me and my family one day."

"Absurd that it takes so long"

During the 20-year war that followed the 2001 U.S.-led invasion of Afghanistan, thousands of Afghans served as interpreters and translators, working shoulder to shoulder with U.S. troops and diplomats, risking their lives serving on the battlefield and communicating with locals.                       These interpreters were essential to bridge the language barrier, but also to provide cultural context, gather intelligence, negotiate with tribal elders and build trust with local communities. Massoud and Omar both applied for SIVs under a program created by the U.S. Congress in 2006 to offer legal pathways to the United States for Iraqis and Afghans who helped during the U.S. military operations in those countries. But the bureaucracy of the SIV application process has left many applicants frustrated, with little faith in the program.Massoud said his application was rejected due to a lack of documentation from his supervisors, despite Johnson trying to help. He said he submitted the requested documents and has waited for more than 320 days with no update from the U.S. government. "Every time Massoud submits all his documents and we think, 'now we are waiting for his visa to be approved,' then Massoud would contact me again saying, 'I need this and this document, because they keep changing the requirements,'" Johnson said. 
    
                                                     
    
                        U.S. Air Force translator stranded in Kabul opens up about life one year after U.S. withdrawal         03:28                            
"The SIV process is flawed and ridiculous and absurd that it takes so long. These interpreters, their lives are in danger," the former U.S. soldier told CBS News. "We don't do enough for them, and it's very frustrating."

The backlog, and work to improve a "vital program"

"We have surged resources to this vital program, significantly increasing the number of staff dedicated to it. We have reviewed every stage of the multiple step application process to streamline it wherever possible, consistent with U.S. law, and continue to look for areas to improve," a State Department spokesperson told CBS News.The official said the steps had enabled the State Department to issue "nearly 34,000 SIVs to principal applicants and their eligible family members" from the beginning of the Biden administration until August 1, 2023.                      As of the end of March, State Department figures show about 9,800 principal SIV applicants had cleared a major hurdle in the process, securing Chief Of Mission (COM) approval. Those individuals are "awaiting further processing and their eventual visa interview before being issued an SIV," the spokesperson said, adding: "We are working to process these cases as quickly as possible."The State Department's figures show that another 69,000 principal applicants were undergoing the review process, and the spokesperson told CBS News that, historically, about half of the applications who reach that stage of the process do not end up qualifying for an SIV.According to the figures, 3,241 Afghan applicants were "deemed unqualified to receive COM approval or had the approval revoked during the second quarter" of 2023."The Department will continue to ensure Afghan SIV applications are processed as quickly as possible in accordance with the statutorily required program parameters and national security requirements," the spokesman told CBS News. A report issued this week by a State Department inspector general said, meanwhile, that according to the department's own estimation, as of April 2023, a total of "more than 840,000 principal and derivative SIV applicants remained in Afghanistan."CBS News' Tucker Reals and Paulina Smolinski contributed to this report.                                  。复旦大学的研究团队最近拿出了一套名叫SAM-MT的新方案,在这个问题上迈出了关键的一步。         当前业界最强的视频目标分割工具——比如大名鼎鼎的SAM2(Segment Anything 2,由Meta AI开发)——虽然能够精准地在视频里"圈出"某个物体并持续追踪它,但有一个致命的弱点:每多追踪一个目标,系统就要多跑一遍完整的计算流程,就好像一个厨师,无论做几道菜,都必须把整个厨房从头收拾一遍才能下锅。追踪1个目标时,SAM2能跑到每秒37帧的流畅速度;但追踪3个目标时,速度就跌到17.8帧;追踪5个目标,更是只剩12.4帧——画面已经开始出现明显卡顿。如果目标再多,整个系统几乎就跑不动了。

二 |          SAM-MT的核心思路,就是彻底改变这种"追一个、算一遍"的低效模式,让系统无论面对多少个目标,计算量都几乎保持不变。结果相当令人印象深刻:追踪10个目标时,SAM-MT仍然能跑到36帧以上的实时速度,与追踪单个目标时几乎无异,是SAM2在同等条件下的6倍速度。与此同时,它在六个主流视频分割基准测试上的准确率,依然与SAM2的最强版本旗鼓相当,甚至在部分场景下略有超越。         一、多目标追踪的老大难:为什么加一个目标就慢这么多          要理解SAM-MT解决了什么问题,得先搞清楚传统方法是怎么运转的,以及它在哪里卡了壳。         视频目标分割,通俗地说,就是在视频的每一帧里,把你指定的那个东西(比如一只猫、一辆红色轿车)精确地"涂出来",并且随着视频播放,这个"涂色区域"要始终跟着目标走,不跑偏、不认错。这个任务背后最流行的技术框架叫做"时空记忆网络"(STM范式),核心思路是给每个被追踪的目标建一个专属的"记忆本",记录这个目标历史上长什么样、在哪里出现过,然后在新的一帧里,把当前画面和记忆本做比对,找到目标的位置,再精确地把它圈出来。         这个记忆本是非常"厚重"的——它存储的是像素级别的特征图,一张高清图片里有数千个像素点,每个点都要记录一套复杂的特征描述。追踪一个目标,维护一本记忆本;追踪两个目标,就得同时维护两本——不仅如此,每处理一帧新画面,所有的比对、更新、解码操作都得对每本记忆本各做一遍。这就像一个办公室职员,每多接手一个客户案例,他就要把整套接待流程完整地走一遍,客户越多,他就越忙,而且是线性地越来越忙,没有尽头。         后来出现了STCN、XMem、Cutie等改进方案,它们做了一个聪明的优化:提取图像特征这一步,可以所有目标共享,只算一次。这确实减少了一部分重复计算,但问题的根源没有被触动——每个目标的"专属记忆匹配"和"专属掩码解码",仍然需要独立地跑一遍。打个比方,这就像多个厨师共用一台打蛋机来打蛋液,但每人还是要独立地完成切菜、炒锅、摆盘全套流程。

三 | 共用的那台机器省了点时间,但整体的忙碌程度仍然随人数线性增长。         还有一种听起来聪明、实则行不通的方法:干脆把所有目标合并成一个大目标来追踪。

四 | 比如同时追踪三辆车,就把三辆车的轮廓合并成一个奇形怪状的大轮廓,当成一个目标来处理。

五 | 这样确实只用算一遍,但代价是失去了"谁是谁"的身份信息——你不再知道这是第一辆车还是第三辆车——而且这个合并出来的怪形状,在现实世界中根本不存在,AI模型是用真实物体的图片训练出来的,它根本认不出这个东西,很快就会追丢。论文里专门做了实验验证这一点:让SAM2追踪三辆合并后的"超级车",很快就彻底失去了目标。         二、SAM-MT的核心思路:用"通缉令"代替"全程录像"          SAM-MT的解法,可以用一个侦探团队办案的比喻来理解。         传统方法就像这样:团队里有10个嫌疑人需要监视,就派10个侦探,每人全程跟踪一个嫌疑人,各自记录详细的行动录像,互不干扰,但人手成本随嫌疑人数量线性增长。

六 |          SAM-MT换了一种玩法:整个团队共享一套城市监控系统(这是"全局上下文"),掌握所有嫌疑人所在区域的大环境信息;同时,每个嫌疑人只有一张精简的"通缉令"(这就是"目标查询",target query),上面记录了这个人的关键特征。侦探们用共享的监控系统扫描全局环境,同时拿着各自的通缉令在里面找对应的人,一次扫描,所有人同时完成比对。新增再多嫌疑人,也只是多几张通缉令而已,监控系统本身不需要重新跑一遍。         在技术层面,SAM-MT在SAM2的架构基础上做了以下几项关键改造,每一项都至关重要,共同构成了这套系统的完整解法。

七 |          三、解耦掩码注意力:让"通缉令"彼此不干扰          多目标同时处理的最大风险是"串台"——追踪猫的那套特征,和追踪狗的那套特征,可能会相互影响,导致AI搞混了谁是谁。         SAM-MT用一个叫做"解耦掩码注意力"(Decoupled Masked Attention)的机制来解决这个问题。在AI的注意力计算中,有一种操作叫"自注意力",让所有的"查询"(queries)互相交流信息、相互参考。在多目标场景里,如果来自不同目标的查询可以随意交流,那么A目标的信息就会流入B目标的描述里,最终导致身份混乱。         SAM-MT的做法是在这个交流过程中加一张"隔离屏障":不同目标的专属查询之间,交流被直接屏蔽,设置为负无穷(相当于"对方根本不存在");但所有目标的专属查询,都可以自由地与代表全局环境的"全局查询"交流。用侦探比喻来说:各位侦探拿着自己的通缉令,不能互相分享内容、以免混淆嫌疑人特征,但他们都可以查阅公共的城市地图和监控档案,了解大环境。这样,每个目标既保持了自己的独立身份,又都能感知到整个场景的全局信息,二者不再是非此即彼的选择。         数学层面上,这个隔离屏障用一个注意力掩码矩阵M来实现:矩阵里,全局查询与所有查询之间的位置填0(允许交流),同一目标的查询彼此之间填0(允许交流),不同目标的查询之间填负无穷(完全阻断)。

八 | 这个设计精巧地同时实现了两个目标:保护身份的独立性,同时共享全局上下文。         研究团队通过消融实验验证了这个设计的必要性。如果去掉隔离屏障,让所有目标的查询自由混合,准确率(J&F指标)会从43.0骤降到37.5,足足跌了5.5个百分点;反过来,如果把隔离做得过头,连全局查询也被隔离,准确率则降到39.3,跌了3.7个百分点。只有"解耦"这个恰到好处的中间状态,才能同时保住身份和上下文。         四、查询聚合:把多个"线索"压缩成一张"通缉令"          在用户第一次指定目标时,可以对同一个目标点多个点(正点击表示"这里是我要追踪的",负点击表示"这里不是"),提供更精确的初始描述。这些多个点会产生多个初始查询。         SAM-MT用一个轻量级的"加权头"(MLP-based weighting head)把这些多个查询合并成一个单一的"目标查询":系统会自动评估每个点的重要性,给重要的点更高的权重,然后加权平均,得到一个最具代表性的单一向量。

九 | 这个单一向量就是后续帧中代表这个目标的"通缉令"。         从第二帧开始,每个目标只有一个查询在流转,既简洁,又携带了最关键的身份信息。这个设计把初始帧"点多个点"的灵活性,与后续帧"单一查询"的高效性,优雅地衔接在了一起。

十 |          五、稀疏记忆:用"关键词档案"替代"全程录像带"          SAM2的记忆系统非常"重":它存储的是每一帧图像的像素级特征图,一帧图像大约有4096个特征"像素点",每个点都有一套完整的特征描述。如果为每个目标单独维护这样一套记忆,随着目标数量增加,内存占用会急剧膨胀。         SAM-MT的应对方案是引入"基于查询的稀疏记忆"(Query-based Sparse Memory)。核心思路是:不再给每个目标存储完整的像素级记忆,而是只存储那个经过聚合的"目标查询"——一个目标,一帧,只有一个向量。         这个设计的压缩效率极高。用数字来说,传统方法每帧每目标需要存储4096个特征点,而SAM-MT只需要1个查询向量。这意味着同样的内存,SAM-MT可以往记忆库里存放多得多的历史帧,从而让系统"记住"更长时间跨度里目标的变化。这对于处理目标被遮挡后重新出现的场景尤为重要——记忆越长,就越不容易在目标消失一段时间后把它认错。         实验数据印证了这一点:在长序列基准测试LVOSv2和LVOSv1上,SAM-MT比SAM2.1-B+分别高出了2.0和2.3个百分点,而这两个数据集正是专门考验长时序追踪能力的。内存占用方面,追踪20个目标时,SAM2.1-B+需要8585MB显存,SAM-MT只需要3785MB,相差悬殊。         在稀疏记忆的具体组织上,SAM-MT采用先进先出(FIFO)的滑动窗口策略:始终保留第一帧的目标查询(因为那是用户初始指定的"基准形象"),以及最近T-1帧的目标查询。论文实验测试了不同窗口大小(8、12、16、32帧)的效果,最终选定16帧作为速度与精度的最佳平衡点。         六、身份变换器:确保"通缉令"随时间自动更新          目标不是静止的,它们会运动、旋转、被遮挡、改变姿态。一张在视频开头拍的"通缉令",到了视频后半段可能已经不太准确了。SAM-MT用"身份变换器"(Identity Transformer)来解决这个问题。         在每一帧处理结束后,当前帧的目标查询会被存入稀疏记忆。在处理下一帧时,身份变换器会让上一帧的目标查询,去"查阅"稀疏记忆里这个目标的所有历史查询,通过注意力机制综合参考历史信息,对当前查询进行更新和校正。这就像侦探每天下班前,会把今天观察到的新线索与历史档案对比,更新对嫌疑人最新状态的判断,让明天的追踪更精准。

十一 |          身份变换器同样引入了一个"身份感知掩码":每个目标的查询只能查阅自己历史档案里的记录,不能跨目标查阅,从而杜绝了历史记忆层面的"串档"风险。

十二 | 消融实验表明,去掉这个掩码后,J&F指标会下降3.9个百分点。

十三 | 此外,研究团队测试了不同深度(1层、3层、5层)的变换器,最终选择3层,以在精度和速度之间取得平衡。         七、训练策略:让模型学会应对现实的复杂性          一个好的模型框架,还需要配套合理的训练策略才能发挥出应有的潜力。SAM-MT在训练上采取了几个有针对性的设计。         训练分为两个阶段:第一阶段在静态图片上训练,确保模型能够准确地从点击信号出发,一次性完成多目标的图像分割;第二阶段在视频序列上训练,强化跨帧的身份一致性。这个"先学静态、再学动态"的课程式学习策略,让基础打得更扎实。实验表明,去掉图像预训练阶段,准确率会下降2.7个百分点。         帧采样策略也经过精心设计。传统方法通常采样相邻的连续帧,这对于应对快速运动有好处,但对于"目标消失后重新出现"这种长时间跨度的事件,相邻帧的训练几乎没有帮助。SAM-MT采用"跨步采样":每次训练取8帧,其中一部分是连续帧(捕捉短期运动),另一部分是间隔4帧的跨步采样(覆盖更长的时间窗口,最多跨越32帧)。去掉跨步采样后,准确率下降1.3个百分点,而且在目标重新出现的场景中,系统会频繁认错目标。         重叠惩罚损失函数是另一个关键设计。在多目标场景中,如果两个目标的预测掩码出现重叠(即同一个像素被判定属于两个不同目标),就意味着身份出现了混乱。SAM-MT在损失函数里加入了一项专门的惩罚项:对于目标i的预测概率图,计算它与所有其他目标概率图的逐元素乘积,取平均值作为惩罚项,鼓励模型尽量输出互不重叠的掩码。

十四 | 这在羊群、车队等密集场景里效果尤为明显,能显著减少同一像素被多个目标"抢占"的混乱情况。         八、实验结果:数字背后的真实表现          SAM-MT在六个主流视频分割基准测试上进行了全面评估,每一个都代表了不同的真实挑战场景。         MOSEv2和MOSEv1是专门收录了频繁遮挡、快速运动、低光照、目标密集等极端场景的数据集。SAM-MT在MOSEv2上达到43.0分(J&F指标),超过了之前最好的结果Cutie的42.8分和SAM2.1-B+的41.1分。值得注意的是,SAM-MT和SAM2.1-B+都使用点击初始化,而其他方法使用的是更为"作弊"的真实标注掩码初始化,这意味着SAM-MT在更弱的初始条件下取得了更好的结果。         LVOSv2和LVOSv1是专注于长时序追踪的数据集,视频更长,目标会长时间消失后重新出现。这正是稀疏记忆设计的主场,SAM-MT的优势也最为突出:在LVOSv2上达到76.6分,比SAM2.1-B+的74.6高出2.0分;在LVOSv1上达到73.6分,比SAM2.1-B+的71.3高出2.3分。         SA-V val和SA-V test是包含大量遮挡和局部目标(如只露出头的人)的数据集,SAM-MT同样与SAM2.1-B+持平,在val上分别为66.1对65.6,在test上并列于66.4对66.1。         速度方面的对比最为直观。研究团队专门构建了一个合成基准测试,包含20个视频序列,目标数量从1个到20个分布,每个序列100帧,用来测量不同方法在不同目标密度下的帧率变化。

十五 | 在单目标时,SAM-MT和SAM2.1-B+的帧率相同,都是37.2帧/秒。但随着目标数量增加,SAM2.1-B+的帧率急剧下滑:3个目标时17.8帧,5个目标时12.4帧,9个目标时7.8帧,20个目标时只剩3.7帧。

十六 | SAM-MT的帧率曲线则近乎水平:3个目标36.8帧,9个目标36.3帧,20个目标35.4帧,几乎感受不到任何差异。         在真实的视频数据集上,这种差距同样显著。以MOSEv2数据集中包含5个以上并发目标的子集为例,SAM-MT的帧率从整体的36.9帧仅轻微下降到35.8帧,而SAM2.1-B+从32.1帧骤跌至11.5帧,Cutie(1024p分辨率)从21.3帧跌至10.2帧。         九、真实场景中的表现:密集、相似、遮挡          研究团队还做了一系列定性实验,在真实视频里直观展示了SAM-MT的效果。         在高密度场景中,包括马戏表演(多个演员持续交叉移动)、鸭群(大量外观相似的鸭子)、团体健身课(十几个动作相似的参与者),SAM-MT都能为每个指定目标维持精确、稳定的分割轮廓,不同目标的颜色标记清晰分明,几乎没有出现混淆或丢失目标的情况。         在身份模糊场景中(如多只熊猫在草地上玩耍、多辆公交车在站台前停靠、台球游戏中多个颜色相近的球),SAM2.1-B+的表现是:开始时追踪正常,但过了一段时间后,要么丢失了某个目标,要么把两个目标的身份搞混,用错误的颜色标记了目标。SAM-MT则全程保持了正确的身份标记,多只外观相近的目标始终被用不同颜色准确区分。         这背后的原理差异在于:SAM-MT通过解耦掩码注意力,让全局上下文信息在所有目标之间共享,这使得系统在做判断时,知道场景里还有其他目标存在,可以利用"这个区域已经被另一个目标占据了"这样的信息来辅助判断;而SAM2每个目标完全独立处理,对其他目标的存在一无所知,更容易被相似的干扰物迷惑。         说到底,SAM-MT做的事情并不神秘——它就是把"追踪多个目标"这个问题,从"一个接一个地串行处理"变成了"一次全部并行处理",同时通过精巧的隔离机制确保不同目标的信息互不干扰。

十七 | 这种思路的转变,让速度和效率的提升几乎是量级上的。         对普通人而言,这项研究意味着:未来的视频监控系统、自动驾驶视觉模块、运动分析工具,在处理密集多目标场景时,不再需要在"追踪精度"和"实时速度"之间艰难取舍。

十八 | 当然,SAM-MT目前仍然是纯视觉的系统,它看的懂画面,却不理解画面的语义——比如它能把一只猫精确圈出来,但它不知道这只猫正在捉弄它旁边的那只狗。研究团队也指出,将这套高效的多目标追踪框架与多模态大模型结合,是下一步值得探索的方向。         有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.08688查阅完整论文,代码也已在GitHub的FudanCVL/SAM-MT仓库开源。         ---          Q&A          Q1:SAM-MT追踪多个目标为什么比SAM2快这么多?          A:SAM2追踪多个目标时,每新增一个目标就要完整重跑一遍记忆匹配和掩码解码,速度随目标数量线性下降。SAM-MT用轻量级"目标查询"代替了每个目标的完整像素级记忆,所有目标共享一套图像处理流程并行处理,增加目标只是多了几个查询向量,计算量几乎不变,所以追踪10个目标的速度依然能达到36帧以上。         Q2:SAM-MT是怎么避免追踪多个目标时把身份搞混的?          A:SAM-MT设计了"解耦掩码注意力"机制:不同目标的专属查询之间被完全隔离,不能相互参考,避免了特征污染;但所有目标都可以访问代表全局场景的公共查询,保持对整体环境的感知。同时,身份变换器在更新每个目标的查询时,也严格限制每个目标只查阅自己的历史档案,从根本上切断了跨目标的"串台"路径。         Q3:SAM-MT在哪些实际场景里能用上?          A:SAM-MT适合任何需要实时追踪多个物体的场景。

十九 | 自动驾驶需要同时追踪周围所有行人和车辆;体育分析需要实时标记场上所有球员的运动轨迹;视频监控需要持续识别多个嫌疑目标;机器人导航需要同时感知多个障碍物。这套方案在目标密集时仍能保持实时速度,正好满足这类场景对"快"和"多"的双重需求。

Current article:http://80xtan.diuhuairandaikaomangshangnen.buzz/news/20260826_6636838.html

Published on:16:13:17


专题推荐

相关新闻


© 1996 - 我的网站 版权所有   联系我们

地址:北京市三里河路52号 邮编:100864